Request to Modify Code to Enable TEXT_SPLITTER_EMBEDDING_MODEL Customization through Configuration File

Abierto
#27 1 comentario 0 reacciones 1 asignado Ver en GitHub

@sumitkbh ya está trabajando en esto.

Desde el 18/1/2024.

Evaluación

Este issue todavía no se ha evaluado.

Descripción

enhancement

I am looking to create a Chinese RAG demo service using RetrievalAugmentedGeneration.

However, I encountered an issue where the default SentenceTransformersTokenTextSplitter model used in the RetrievalAugmentedGeneration/common/utils.py file is hardcoded as 'intfloat/e5-large-v2'. This model generates a significant number of [UNK] tokens when processing Chinese text.

I would like the ability to specify a specific model for the text splitter, similar to how the embedding model can be specified through the config.yaml file.

Thank you for your assistance and support.
image

Lenguaje dominante
Jupyter Notebook
Estrellas
4.2k
Forks
1.1k
Merge medio
10 h 15 min
PR fusionados (30 d)
1

Guía de contribución

Abrir la guía de contribución

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de NVIDIA/GenerativeAIExamples

Todos los issues de NVIDIA/GenerativeAIExamples

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.