Hacktoberfest 2026 : les issues que les mainteneurs ont marquées pour octobre, ouvertes et accessibles aux débutants. Parcourir les issues Hacktoberfest

Request to Modify Code to Enable TEXT_SPLITTER_EMBEDDING_MODEL Customization through Configuration File

Ouverte
#27 1 commentaire 0 réactions 1 personne assignée Voir sur GitHub

@sumitkbh y travaille déjà.

Depuis le 18/1/2024.

Évaluation

Cette issue n'a pas encore été évaluée.

Description

enhancement

I am looking to create a Chinese RAG demo service using RetrievalAugmentedGeneration.

However, I encountered an issue where the default SentenceTransformersTokenTextSplitter model used in the RetrievalAugmentedGeneration/common/utils.py file is hardcoded as 'intfloat/e5-large-v2'. This model generates a significant number of [UNK] tokens when processing Chinese text.

I would like the ability to specify a specific model for the text splitter, similar to how the embedding model can be specified through the config.yaml file.

Thank you for your assistance and support.
image

Langage dominant
Jupyter Notebook
Étoiles
4.2k
Forks
1.1k
Merge moyen
10 h 15 min
PR mergées (30 j)
1

Préparer son environnement

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Autres issues de NVIDIA/GenerativeAIExamples

Toutes les issues de NVIDIA/GenerativeAIExamples

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.