A question about the detail of data preprocessing
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 1/5
- Tiempo estimado
- Menos de una hora
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Documentación
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- python
Línea de trabajo
Start with preprocess/1_split_raw.py at line 33 and trace how train.txt is read or produced. Document what data belongs in train.txt and whether it contains all training code; done when the preprocessing input and split expectations are clear.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Hello!
I would like to finetune the model, and during the part of data preprocessing. I saw that in line 33 of the file https://github.com/salesforce/jaxformer/blob/main/preprocess/1_split_raw.py, the code is args.data_bucket_path = '/tmp/dataset_v1/ 0_raw/train.txt'.
I would like to know what kind of data is in the file train.txt? Is all the code data to be trained put into this train.txt file?
- Lenguaje dominante
- Python
- Estrellas
- 5.2k
- Forks
- 420
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Preparar el entorno
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de salesforce/CodeGen
-
Verify evals on Papers with CodeAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 45/100
salesforce/CodeGen#107 ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100
salesforce/CodeGen#104 ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
salesforce/CodeGen#101 ·
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 48/100
salesforce/CodeGen#95 ·
-
Dificultad 3/5 1-2 días Aptitud para principiantes 35/100
salesforce/CodeGen#94 · 8 comentarios ·
Todos los issues de salesforce/CodeGen
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
PedestrianDynamics/pyFDS-Evac#199 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
521xueweihan/HelloGitHub#3790 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
sandialabs/atlas-ui-3#978 ·
Los mantenedores suelen responder en 1 día
-
area: tests perceived difficulty: 2
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
Nitjsefnie-Harness-Commons/daedalus#1255 ·
Los mantenedores suelen responder en 1 día
-
hf-audiolm-qwen: `generate_until` hardcodes `.to("cuda")` and aborts on non-CUDA acceleratorsAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 86/100
EleutherAI/lm-evaluation-harness#4256 ·
Los mantenedores suelen responder en 1 día