Hacktoberfest 2026: as issues que os mantenedores marcaram para outubro, abertas e boas para iniciantes. Ver issues do Hacktoberfest

Request to Modify Code to Enable TEXT_SPLITTER_EMBEDDING_MODEL Customization through Configuration File

Aberta
#27 1 comentário 0 reações 1 responsável Ver no GitHub

@sumitkbh já está trabalhando nisso.

Desde 18/1/2024.

Avaliação

Esta issue ainda não foi avaliada.

Descrição

enhancement

I am looking to create a Chinese RAG demo service using RetrievalAugmentedGeneration.

However, I encountered an issue where the default SentenceTransformersTokenTextSplitter model used in the RetrievalAugmentedGeneration/common/utils.py file is hardcoded as 'intfloat/e5-large-v2'. This model generates a significant number of [UNK] tokens when processing Chinese text.

I would like the ability to specify a specific model for the text splitter, similar to how the embedding model can be specified through the config.yaml file.

Thank you for your assistance and support.
image

Linguagem predominante
Jupyter Notebook
Estrelas
4.2k
Forks
1.1k
Merge médio
10h 15min
PRs com merge (30d)
1

Preparar o ambiente

Primeiros passos

  1. Leia a issue inteira e depois o guia de contribuição do projeto.
  2. Comente na issue dizendo que vai assumir — evita que duas pessoas façam o mesmo trabalho.
  3. Faça um fork do repositório e trabalhe em uma branch.
  4. Abra um pull request que referencie o número da issue.

Mais de NVIDIA/GenerativeAIExamples

Todas as issues de NVIDIA/GenerativeAIExamples

Receba novas issues na sua caixa de entrada

Um resumo curto de issues do GitHub para quem está começando.