Cannot tokenize byte sequences that are not valid UTF-8 due to design flaw

Aperta
#51 1 commento 0 reazioni 0 assegnatari Vedi su GitHub

Nessuno ha ancora preso questa issue.

Valutazione

Difficoltà
5/5
Tempo stimato
Più di una settimana
Idoneità per principianti
35/100
Tipo di issue
Bug
Chiarezza
Da chiarire
Stato di attività
Ferma
Stack tecnologico
rust
Ambito
tooling

Direzione di ricerca

Inizia esaminando il metodo encode di bpe-openai e il tipo di input che accetta. Determina come la libreria dovrebbe esporre sequenze arbitrarie di byte, quindi aggiungi la copertura per gli input UTF-8 non validi e verifica che tutte le sequenze di byte possano essere tokenizzate.

Scritto dal modello di indicizzazione a partire dal testo della issue.

Descrizione

Hello,

The BPE algorithm is capable of tokenizing any byte sequence, and LLMs generally accept any sequence of tokens and use token dictionaries that can successfully represent any byte sequence, but the encode method in bpe-openai accepts a type that has to be valid UTF-8. So there are lots of byte sequences, many of which are only 1 byte long, which you cannot tokenize using this library.

Lingua principale
Rust
Stelle
134
Fork
24
Merge medio
16h 27m
PR unite (30g)
11

Guida per i contributori

Apri la guida per i contributori

Come iniziare

  1. Leggi tutta la issue e poi la guida ai contributi del progetto.
  2. Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
  3. Fai un fork del repository e lavora su un branch.
  4. Apri una pull request che faccia riferimento al numero della issue.

Altre issue di github/rust-gems

Tutte le issue di github/rust-gems

Issue simili

Altre issue su Rust

Ricevi le nuove issue nella tua casella

Un breve riepilogo di issue GitHub adatte ai principianti.