Create dataset iarpa_babel_swahili_language_pack
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 2/5
- Thời gian dự kiến
- 1-3 giờ
- Mức phù hợp với người mới
- 62/100
- Loại issue
- Tính năng
- Độ rõ ràng
- Đặc tả rõ ràng
- Mức độ hoạt động
- Đình trệ
- Lĩnh vực
- data-engineering
Hướng nghiên cứu
Bắt đầu với siêu dữ liệu dataset được yêu cầu trong issue này và nguồn IARPA Babel Swahili Language Pack được tham chiếu. Thêm mục nhập dưới tên iarpa_babel_swahili_language_pack.json bằng cách sử dụng các quy ước hiện có của repository cho các mục nhập dataset; công việc được coi là hoàn tất khi dataset được biểu diễn với các thông tin chi tiết về nguồn, tính khả dụng, cấp phép, ngôn ngữ và phương tiện.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
- uid: iarpa_babel_swahili_language_pack
- type: processed
- description:
- name: IARPA Babel Swahili Language Pack
- description: Swahili ASR Dataset. Official description says "IARPA Babel Swahili Language Pack IARPA-babel202b-v1.0d was developed by Appen for the IARPA (Intelligence Advanced Research Projects Activity) Babel program. It contains approximately 350 hours of Swahili conversational and scripted telephone speech collected from 2012-2014 along with corresponding transcripts."
- homepage: https://doi.org/10.35111/afrp-a637
- validated: True
- languages:
- language_names:
- Niger-Congo
- Swahili
- language_comments:
- language_locations:
- Eastern Africa
- Kenya
- validated: False
- language_names:
- custodian:
- name:
- in_catalogue: linguistic_data_consortium_ldc
- type:
- location:
- contact_name:
- contact_email:
- contact_submitter: False
- additional:
- validated: False
- availability:
- procurement:
- for_download: Yes - after signing a user agreement
- download_url: https://doi.org/10.35111/afrp-a637
- download_email:
- licensing:
- has_licenses: Yes
- license_text: Multiple licenses:
- license_properties:
- multiple licenses
- research use
- non-commercial use
- copyright - all rights reserved
- license_list:
- other: Other license
- pii:
- has_pii: Unclear
- generic_pii_likely:
- generic_pii_list:
- numeric_pii_likely:
- numeric_pii_list:
- sensitive_pii_likely:
- sensitive_pii_list:
- no_pii_justification_class: general knowledge not written by or referring to private persons
- no_pii_justification_text:
- validated: False
- procurement:
- processed_from_primary:
- from_primary: Taken from primary source
- primary_availability: No - the dataset curators kept the source data secret
- primary_license:
- primary_types:
- validated: False
- media:
- category:
- audiovisual
- text_format:
- audiovisual_format:
- .WAV
- image_format:
- database_format:
- text_is_transcribed:
- instance_type: 350 hours of telephone conversations, no clue how long each file is. Estimating 15 minutes each, and 350 words per minute?
- instance_count: 10K<n<100K
- instance_size: 100<n<10,000
- validated: False
- category:
- fname: iarpa_babel_swahili_language_pack.json
- Ngôn ngữ chính
- HTML
- Star
- 91
- Fork
- 47
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Chuẩn bị môi trường
Dự án này không cung cấp dev container, Dockerfile hay hướng dẫn đóng góp, nên bạn cần tự thiết lập môi trường: hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của bigscience-workshop/data_tooling
-
data catalog
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 82/100
-
data catalog
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 62/100
-
Create dataset bhaskarĐang mởdata catalog
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 68/100
-
Create dataset mediapartĐang mởdata catalog
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 72/100
-
Create dataset goierna_magazineĐang mởdata catalog
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 82/100
Tất cả issue của bigscience-workshop/data_tooling
Issue tương tự
-
Report: A few extra shortlinksĐang mởcheck:passed streams:remove
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 70/100
Maintainer thường phản hồi trong vòng 1 ngày
-
GLM-5.3 available on bedrock nowĐang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 65/100
anomalyco/models.dev#8862 · 1 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 64/100
Maintainer thường phản hồi trong vòng 2 ngày
-
Drained trajectory arrays are overwritten when the sequence buffer is reusedCó thể đã có người làm @sylvesterkaczmarek đã nhận hôm nay. Đang mở
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
google-deepmind/bsuite#56 ·
-
[bug] Part headings suppress structural chapter countCó thể đã có người làm Có pull request liên kết đang mở hoặc đã được merge. Đang mởbug
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 74/100
virgiliojr94/book-to-skill#271 ·
Maintainer thường phản hồi trong vòng 5 ngày