2 件のコメント (2 件のコメント)1 件のリアクション (1 件のリアクション)1 人の担当者 (1 人の担当者)C++4,093 件のフォーク (4,093 件のフォーク)batch import
enhancementhelp wanted
Repository metrics
- Stars
- 26,755 個のスター (26,755 個のスター)
- PR merge metrics
- PR metrics pending (PR metrics pending)
コントリビューターガイド
- 調査方針
- DeepSpeechトレーニングパイプラインの現在のトークン化コード(おそらくPython)を理解してください。トランスクリプトがコードポイントでどのようにトークン化されているかを学びます。次に、Unicodeセグメンテーション(例:PythonのgraphemeライブラリやC++のICU)を使用して書記素クラスターでトークン化する方法を調査します。コードベースでトークン化が発生する正確な場所を特定し、コードポイントではなく書記素クラスターで分割する変更を提案します。結合文字や絵文字シーケンスなどのエッジケースを考慮してください。
- 技術スタック
- python
- 領域
- machine learningaidata
- Issue 種別
- 機能
- 前提条件
- PythonUnicode text processingDeepSpeech training pipeline