Request to Modify Code to Enable TEXT_SPLITTER_EMBEDDING_MODEL Customization through Configuration File
@sumitkbh já está trabalhando nisso.
Desde 18/1/2024.
Avaliação
Esta issue ainda não foi avaliada.
Descrição
I am looking to create a Chinese RAG demo service using RetrievalAugmentedGeneration.
However, I encountered an issue where the default SentenceTransformersTokenTextSplitter model used in the RetrievalAugmentedGeneration/common/utils.py file is hardcoded as 'intfloat/e5-large-v2'. This model generates a significant number of [UNK] tokens when processing Chinese text.
I would like the ability to specify a specific model for the text splitter, similar to how the embedding model can be specified through the config.yaml file.
Thank you for your assistance and support.
- Linguagem predominante
- Jupyter Notebook
- Estrelas
- 4.2k
- Forks
- 1.1k
- Merge médio
- 10h 15min
- PRs com merge (30d)
- 1
Preparar o ambiente
- Sem Dockerfile nem arquivo Docker Compose
- Sem modelo de pull request
- Ler o guia de contribuição
Primeiros passos
- Leia a issue inteira e depois o guia de contribuição do projeto.
- Comente na issue dizendo que vai assumir — evita que duas pessoas façam o mesmo trabalho.
- Faça um fork do repositório e trabalhe em uma branch.
- Abra um pull request que referencie o número da issue.
Mais de NVIDIA/GenerativeAIExamples
-
Dificuldade 1/5 Menos de uma hora Facilidade para iniciantes 70/100
NVIDIA/GenerativeAIExamples#361 · 2 comentários ·
-
Dificuldade 2/5 1-3 horas Facilidade para iniciantes 72/100
NVIDIA/GenerativeAIExamples#299 ·
-
Dificuldade 3/5 1-2 dias Facilidade para iniciantes 35/100
NVIDIA/GenerativeAIExamples#437 ·
-
hyperlink not workingAberta
Dificuldade 1/5 Menos de uma hora Facilidade para iniciantes 45/100
NVIDIA/GenerativeAIExamples#400 ·
-
Dificuldade 5/5 Mais de uma semana Facilidade para iniciantes 10/100
NVIDIA/GenerativeAIExamples#399 ·