Request to Modify Code to Enable TEXT_SPLITTER_EMBEDDING_MODEL Customization through Configuration File
@sumitkbh ya está trabajando en esto.
Desde el 18/1/2024.
Evaluación
Este issue todavía no se ha evaluado.
Descripción
I am looking to create a Chinese RAG demo service using RetrievalAugmentedGeneration.
However, I encountered an issue where the default SentenceTransformersTokenTextSplitter model used in the RetrievalAugmentedGeneration/common/utils.py file is hardcoded as 'intfloat/e5-large-v2'. This model generates a significant number of [UNK] tokens when processing Chinese text.
I would like the ability to specify a specific model for the text splitter, similar to how the embedding model can be specified through the config.yaml file.
Thank you for your assistance and support.
- Lenguaje dominante
- Jupyter Notebook
- Estrellas
- 4.2k
- Forks
- 1.1k
- Merge medio
- 10 h 15 min
- PR fusionados (30 d)
- 1
Guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de NVIDIA/GenerativeAIExamples
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 70/100
NVIDIA/GenerativeAIExamples#361 · 2 comentarios ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
NVIDIA/GenerativeAIExamples#299 ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 35/100
NVIDIA/GenerativeAIExamples#437 ·
-
hyperlink not working Abierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 45/100
NVIDIA/GenerativeAIExamples#400 ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 10/100
NVIDIA/GenerativeAIExamples#399 ·