Hacktoberfest 2026: những issue maintainer đã đánh dấu cho tháng Mười, đang mở và phù hợp người mới. Xem issue Hacktoberfest

Create dataset iarpa_babel_swahili_language_pack

Đang mở Phù hợp với người mới
#128 1 bình luận 0 reaction 0 người được giao Xem trên GitHub

Chưa có ai nhận issue này.

Đánh giá

Độ khó
2/5
Thời gian dự kiến
1-3 giờ
Mức phù hợp với người mới
62/100
Loại issue
Tính năng
Độ rõ ràng
Đặc tả rõ ràng
Mức độ hoạt động
Đình trệ
Lĩnh vực
data-engineering

Hướng nghiên cứu

Bắt đầu với siêu dữ liệu dataset được yêu cầu trong issue này và nguồn IARPA Babel Swahili Language Pack được tham chiếu. Thêm mục nhập dưới tên iarpa_babel_swahili_language_pack.json bằng cách sử dụng các quy ước hiện có của repository cho các mục nhập dataset; công việc được coi là hoàn tất khi dataset được biểu diễn với các thông tin chi tiết về nguồn, tính khả dụng, cấp phép, ngôn ngữ và phương tiện.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Mô tả

data catalog need custodian permission need data sourcing feedback
  • uid: iarpa_babel_swahili_language_pack
  • type: processed
  • description:
    • name: IARPA Babel Swahili Language Pack
    • description: Swahili ASR Dataset. Official description says "IARPA Babel Swahili Language Pack IARPA-babel202b-v1.0d was developed by Appen for the IARPA (Intelligence Advanced Research Projects Activity) Babel program. It contains approximately 350 hours of Swahili conversational and scripted telephone speech collected from 2012-2014 along with corresponding transcripts."
    • homepage: https://doi.org/10.35111/afrp-a637
    • validated: True
  • languages:
    • language_names:
      • Niger-Congo
      • Swahili
    • language_comments:
    • language_locations:
      • Eastern Africa
      • Kenya
    • validated: False
  • custodian:
    • name:
    • in_catalogue: linguistic_data_consortium_ldc
    • type:
    • location:
    • contact_name:
    • contact_email:
    • contact_submitter: False
    • additional:
    • validated: False
  • availability:
  • processed_from_primary:
    • from_primary: Taken from primary source
    • primary_availability: No - the dataset curators kept the source data secret
    • primary_license:
    • primary_types:
    • validated: False
  • media:
    • category:
      • audiovisual
    • text_format:
    • audiovisual_format:
      • .WAV
    • image_format:
    • database_format:
    • text_is_transcribed:
    • instance_type: 350 hours of telephone conversations, no clue how long each file is. Estimating 15 minutes each, and 350 words per minute?
    • instance_count: 10K<n<100K
    • instance_size: 100<n<10,000
    • validated: False
  • fname: iarpa_babel_swahili_language_pack.json
Ngôn ngữ chính
HTML
Star
91
Fork
47
Chỉ số merge pull request
Không có pull request nào được merge trong 30 ngày

Chuẩn bị môi trường

Dự án này không cung cấp dev container, Dockerfile hay hướng dẫn đóng góp, nên bạn cần tự thiết lập môi trường: hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.

Bắt đầu từ đâu

  1. Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
  2. Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
  3. Fork repository và làm thay đổi trên một nhánh.
  4. Mở pull request có tham chiếu số hiệu của issue.

Issue khác của bigscience-workshop/data_tooling

Tất cả issue của bigscience-workshop/data_tooling

Issue tương tự

Thêm issue về Data Engineering

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.