Why tokenizer.pad_token == args.pad (i.e., 50256)??
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 20/100
- Tipo de issue
- Error
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- python
- Área
- machine-learning, testing
Línea de trabajo
Start with jaxformer/hf/sample.py around lines 234 and 240 to inspect how tokenizer.pad_token and pad_token_id are passed during sampling. Then compare that procedure with the single-turn HumanEval setup used for the paper's Table 1 results; done means the padding behavior and benchmark discrepancy are explained.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Hi,
For my project, I'm trying to fine-tune CodeGen models on my dataset and evaluate the resulting fine-tuned model on the HumanEval benchmark dataset. I have a few questions that I would appreciate if you could address.
-
First, why in the sampling code, at line 234, we have
tokenizer.pad_token == args.pad, which is 50256. Shouldn't we set the pad_token to eos_token, not 50256 (which is the eos_token_id)? I'm confused by this. At line 240, you set the parameter pad_token_id=args.pad. So in your sampling code, both pad_token and pad_token_id are set to 50256. Can you please elaborate on this? That would be super helpful. -
As a baseline, I need to replicate your single-turn HumanEval benchmark results, but unfortunately, I'm getting surprisingly lower results compared to what is reported in the paper. And, I'm 99% positive that I'm probably missing a point. To produce Table 1 results in the paper, did you use the exact same sampling procedure as sample.py?
Thanks a lot for your time.
- Lenguaje dominante
- Python
- Estrellas
- 5.2k
- Forks
- 420
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de salesforce/CodeGen
-
Verify evals on Papers with Code Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 45/100
salesforce/CodeGen#107 ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100
salesforce/CodeGen#104 ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
salesforce/CodeGen#101 ·
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 48/100
salesforce/CodeGen#95 ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 35/100
salesforce/CodeGen#94 · 8 comentarios ·
Todos los issues de salesforce/CodeGen
Issues similares
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
stephrobert/dsoxlab#238 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
sublimehq/package_control#1780 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
nwg-piotr/nwg-displays#145 ·