Create Dataset with metadata
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức phù hợp với người mới
- 25/100
- Loại issue
- Tính năng
- Độ rõ ràng
- Cần làm rõ
- Mức độ hoạt động
- Đình trệ
- Công nghệ
- python
- Lĩnh vực
- data-engineering
Hướng nghiên cứu
Không có tệp hoặc bài kiểm thử nào được nêu. Hãy bắt đầu bằng việc xem lại các bước trích xuất đã hoàn tất và đầu ra dataset hiện tại, sau đó xử lý các mục còn lại trong checklist: dọn dẹp các dòng trống và các cột lỗi khi thích hợp, thu thập siêu dữ liệu nếu cần, rồi push dataset đã hoàn tất lên Hub.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
Steps:
- pseudo crawl ~10% of C4 web page from Common Crawl @tianjianjiang
- import pseudo crawled dataset on JZ @SaulLu
- run 1st step of extraction:
- Extract text, HTML head sections, HTML footer sections, HTML Titles section and HTML metadata @SaulLu
- Change format of URL @SaulLu
- Extract Timestamp @cccntu @SaulLu
- Extract Generation Length Sentence @chkla @SaulLu
- Extract Generation Length Text @chkla @SaulLu
- Extract Data source @chkla @SaulLu
- run 2nd step of extraction:
- Extract Website descriptions @shanyas10 @SaulLu
- run 3rd step of extraction:
- Extract Entities @manandey @SaulLu
- (option) Extract Entities descriptions @manandey @SaulLu
- run 4th step of extraction:
- Extract Paragraph @tianjianjiang @SaulLu
- #114
- #125
- annotator (preprocessor) of the metadata
- Modify entities metadata with paragraph information @manandey @SaulLu
- Modify generation length with paragraph information @chkla @SaulLu
- Extract Paragraph @tianjianjiang @SaulLu
- (optional) clean final dataset:
- Remove empty lines @SaulLu
- Remove "errors" columns @SaulLu
- (optional) Gather all metadata into same column @cccntu @timoschick @SaulLu
- push dataset to Hub @SaulLu
- Ngôn ngữ chính
- Python
- Star
- 29
- Fork
- 11
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Chuẩn bị môi trường
Dự án này không cung cấp dev container, Dockerfile hay hướng dẫn đóng góp, nên bạn cần tự thiết lập môi trường: hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của bigscience-workshop/metadata
-
Common simple eval function to calculate pplCó thể làm lại được @shanyas10 đã nhận 1686 ngày trước và không có pull request nào đang mở. Đang mở
bigscience-workshop/metadata#138 · 1 người được giao ·
-
multi gpu trainingCó thể làm lại được @changjonathanc đã nhận 1719 ngày trước và không có pull request nào đang mở. Đang mở
bigscience-workshop/metadata#129 · 1 người được giao ·
-
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 25/100
bigscience-workshop/metadata#122 ·
-
Which HTML tags should be used during training?Có thể làm lại được @SaulLu đã nhận 1750 ngày trước và không có pull request nào đang mở. Đang mở
bigscience-workshop/metadata#113 · 1 người được giao ·
-
slurm script test multi-gpu trainingCó thể làm lại được @SaulLu đã nhận 1722 ngày trước và không có pull request nào đang mở. Đang mở
bigscience-workshop/metadata#109 · 3 người được giao ·
Tất cả issue của bigscience-workshop/metadata
Issue tương tự
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 85/100
Maintainer thường phản hồi trong vòng 3 ngày
-
Negation with "not" and "no" is ignored during sentiment analysisCó thể đã có người làm @vivek-3728 đã nhận hôm nay. Đang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 68/100
techcsispit/mess-mood#11 · 1 bình luận ·
-
changelog investigate
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 68/100
ramnes/notion-sdk-py#408 ·
-
good first issue
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 83/100
btclib-org/btclib-wallet#267 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
good first issue tech-debt
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 85/100
knnmelprop/YAADO#111 ·