Request to Modify Code to Enable TEXT_SPLITTER_EMBEDDING_MODEL Customization through Configuration File
@sumitkbh y travaille déjà.
Depuis le 18/1/2024.
Évaluation
Cette issue n'a pas encore été évaluée.
Description
I am looking to create a Chinese RAG demo service using RetrievalAugmentedGeneration.
However, I encountered an issue where the default SentenceTransformersTokenTextSplitter model used in the RetrievalAugmentedGeneration/common/utils.py file is hardcoded as 'intfloat/e5-large-v2'. This model generates a significant number of [UNK] tokens when processing Chinese text.
I would like the ability to specify a specific model for the text splitter, similar to how the embedding model can be specified through the config.yaml file.
Thank you for your assistance and support.
- Langage dominant
- Jupyter Notebook
- Étoiles
- 4.2k
- Forks
- 1.1k
- Merge moyen
- 10 h 15 min
- PR mergées (30 j)
- 1
Préparer son environnement
- Aucun Dockerfile ni fichier Docker Compose
- Aucun modèle de pull request
- Lire le guide de contribution
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Autres issues de NVIDIA/GenerativeAIExamples
-
Difficulté 1/5 Moins d'une heure Accessibilité débutants 70/100
NVIDIA/GenerativeAIExamples#361 · 2 commentaires ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 72/100
NVIDIA/GenerativeAIExamples#299 ·
-
Difficulté 3/5 1-2 jours Accessibilité débutants 35/100
NVIDIA/GenerativeAIExamples#437 ·
-
hyperlink not workingOuverte
Difficulté 1/5 Moins d'une heure Accessibilité débutants 45/100
NVIDIA/GenerativeAIExamples#400 ·
-
Difficulté 5/5 Plus d'une semaine Accessibilité débutants 10/100
NVIDIA/GenerativeAIExamples#399 ·