[Q] InternVideo 2.5,, TPO
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 5/5
- Thời gian dự kiến
- Hơn một tuần
- Mức phù hợp với người mới
- 20/100
- Loại issue
- Tài liệu
- Độ rõ ràng
- Cần làm rõ
- Mức độ hoạt động
- Đình trệ
- Công nghệ
- python
- Lĩnh vực
- machine-learning
Hướng nghiên cứu
Không có tệp, bài kiểm thử hoặc điểm vào cụ thể nào được nêu. Hãy xem xét các script suy luận hiện có của repository và phần mô tả TPO trong bài báo để xác định liệu ba task head và quy trình huấn luyện có tồn tại hay không; để hoàn tất sẽ cần maintainer làm rõ hoặc có hướng dẫn được ghi thành tài liệu.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
Hello, thank you for the excellent research and for sharing the code.
I understand that TPO (Task Preference Optimization) has been applied to InternVideo 2.5, and as mentioned in the related paper, it includes three task-specific heads: region, temporal, and mask.
I have two questions regarding this:
- Are these three heads already implemented and integrated into the current InternVideo 2.5 codebase?
- The paper describes a detailed multi-stage training process, but the repository currently provides only inference scripts. Will the training scripts for these heads be released in the future? Alternatively, is there any guidance or reference available to perform supervised fine-tuning (sFT) with these task heads?
Any support or clarification would be greatly appreciated. Thank you again for your valuable contribution!
- Ngôn ngữ chính
- Python
- Star
- 531
- Fork
- 21
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Chuẩn bị môi trường
Dự án này không cung cấp dev container, Dockerfile hay hướng dẫn đóng góp, nên bạn cần tự thiết lập môi trường: hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của OpenGVLab/VideoChat-Flash
-
Verify evals on Papers with CodeĐang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 55/100
OpenGVLab/VideoChat-Flash#75 ·
-
baseline is qwen2.5vlĐang mở
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 25/100
OpenGVLab/VideoChat-Flash#72 ·
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 15/100
OpenGVLab/VideoChat-Flash#67 · 5 bình luận ·
-
support for vLLM deploymentĐang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 25/100
OpenGVLab/VideoChat-Flash#66 · 1 bình luận ·
-
Support for LoRA finetuning.Đang mở
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 20/100
OpenGVLab/VideoChat-Flash#56 · 3 bình luận ·
Tất cả issue của OpenGVLab/VideoChat-Flash
Issue tương tự
-
bug
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100
awslabs/visual-asset-management-system#414 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
bug v1 v2
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 75/100
modelcontextprotocol/python-sdk#3670 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 82/100
aicell-lab/bioengine#232 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 74/100
modelscope/evalscope#1836 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 72/100