InternVideo-NeXt clip_projector training procedure: eval only? from scratch?
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Documentación
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- huggingface, python
Línea de trabajo
Comienza con el archivo vinculado modeling_internvideo_next.py de Hugging Face y con InternVideo2/single_modality/run_linear_probing.py; después, compara el comportamiento de sus proyectores con las secciones B.2 y 4.2 del artículo. Se considera terminado cuando se hayan documentado los datos de entrenamiento de clip_projector, si la evaluación utiliza pesos entrenados desde cero o preentrenados, y qué configuración produjo los resultados reportados.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Dear authors,
Thanks for your interesting paper!
I see you mention in your paper in section B.2 of the appendix that you train an attention pooling head for evaluation.
At the same time, I see that the model you released on HuggingFace has a clip_projector module (AttentionPoolingBlock) attached to it, and in the forward of the model you set projected=True (HF code here)
What I would like to know is:
- on what data was this release clip_projector trained?
- if I want to evaluate your model on action recognition, should I:
a. train the attentive probe from scratch on the target dataset
b. finetune the attentive probe on the target dataset (if so, from which weights?) - which setup did you use in your paper, 2.a. or 2.b., or none of them?
You released some action recognition code for InternVideo2 and for linear probing / attention probing there is this --open_clip_projector parameter which controls whether you're finetuning the head, or not. But this doesn't say on which data the head was trained before the finetuning.
You mention in the paper in section 4.2 (Video Classification)
We test the model in an ‘Attentive Probing’ setting
where the encoders are frozen and a single-layer attention
pooling head is trained. Such Frozen Encoder settings can
test representation’s quality in an unbiased way. Our methods achieve the best results with only public data and less
computation cost on these foundation tasks.
What would make sense to me is that you're not using the Internvideo2 evaluation script anymore and you're training the attentive probe from scratch (2.a. mentioned above). But if so, I'd like to know on which evaluation experiment the weights of the release clip_projector were obtained.
Thanks in advance for your clarifications!
- Lenguaje dominante
- Python
- Estrellas
- 2.4k
- Forks
- 160
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de OpenGVLab/InternVideo
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
OpenGVLab/InternVideo#324 · 1 comentario ·
-
InternVideo2 stage-1 weights Abierto
Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100
OpenGVLab/InternVideo#323 ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 25/100
OpenGVLab/InternVideo#322 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 42/100
OpenGVLab/InternVideo#321 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 35/100
OpenGVLab/InternVideo#319 · 1 comentario ·
Todos los issues de OpenGVLab/InternVideo
Issues similares
-
enhancement
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
canonical/paas-charm#368 · 1 comentario ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
tech debt
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
addition to tracking list Abierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 90/100
StevenBlack/hosts#3256 ·
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 90/100
qualcomm/qai-appbuilder#275 ·