Create dataset malindomorph__morphological_dictionary_and_analyser_for_malay_indonesian
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 2/5
- Tiempo estimado
- 1-3 horas
- Aptitud para principiantes
- 45/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Bastante claro
- Estado de actividad
- Estancado
- Stack tecnológico
- json
- Área
- data
Línea de trabajo
Localiza la entrada de datos del catálogo representada por malindomorph__morphological_dictionary_and_analyser_for_malay_indonesian.json y compara su estructura con los metadatos proporcionados. Confirma que el registro de MALINDOMorph se añade con la fuente, disponibilidad, licencia, idioma y detalles de medios indicados, incluidos los campos de validación no resueltos.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
- uid: malindomorph__morphological_dictionary_and_analyser_for_malay_indonesian
- type: processed
- description:
- name: MALINDOMorph: Morphological dictionary and analyser for Malay/Indonesian
- description: Malay/Indonesian lacked an open wide-coverage dictionary that can be used for both NLP tasks and non-NLP purposes. The MALINDO Morph morphological dictionary is the first such dictionary. It provides morphological information (root, prefix, suffix, circumfix, reduplication) for roughly 232K surface forms. The entry forms are those found in the authoritative dictionaries in Malaysia (Kamus Dewan4) and Indonesia (Kamus Besar Bahasa Indonesia5) (core dictionary) as well as frequent words in the Leipzig Corpora Collection (Goldhahn et al., 2012) (expanded dictionary). The morphological analyses were checked by hand for all surface forms, except for (i) basic and di-forms in the expanded dictionary whose existence is predicted from the corresponding meN-active forms in the core dictionary and (ii) the case variants of the items in the core dictionary. This paper also discusses the morphological analyser that we developed to create our morphological dictionary. Our morphological analyser is more linguistically rigorous than previous morphological analysers and stemmers/lemmatizers such as MorphInd (Larasati et al., 2011) because it takes into account circumfixes, which have previously been neglected, largely due to a misunderstanding among NLP researchers that circumfixes are no more than combinations of a prefix and a suffix.
- homepage: chrome-extension://efaidnbmnnnibpcajpcglclefindmkaj/viewer.html?pdfurl=http%3A%2F%2Flrec-conf.org%2Fworkshops%2Flrec2018%2FW29%2Fpdf%2F8_W29.pdf&clen=201938&chunk=true
- validated: True
- languages:
- language_names:
- Indonesian
- language_comments:
- language_locations:
- Asia
- Indonesia
- validated: False
- language_names:
- custodian:
- name: Hiroki Nomoto
- in_catalogue:
- type: A university or research institution
- location: Japan
- contact_name: Hiroki Nomoto
- contact_email: nomoto@tufs.ac.jp
- contact_submitter: False
- additional: chrome-extension://efaidnbmnnnibpcajpcglclefindmkaj/viewer.html?pdfurl=http%3A%2F%2Flrec-conf.org%2Fworkshops%2Flrec2018%2FW29%2Fpdf%2F8_W29.pdf&clen=201938&chunk=true
- validated: False
- availability:
- procurement:
- for_download: No - but the current owners/custodians have contact information for data queries
- download_url:
- download_email:
- licensing:
- has_licenses: Yes
- license_text:
- license_properties:
- license_list:
- pii:
- has_pii: Yes
- generic_pii_likely:
- generic_pii_list:
- numeric_pii_likely:
- numeric_pii_list:
- sensitive_pii_likely:
- sensitive_pii_list:
- no_pii_justification_class:
- no_pii_justification_text:
- validated: False
- procurement:
- processed_from_primary:
- from_primary: Taken from primary source
- primary_availability: Yes - their documentation/homepage/description is available
- primary_license: Unclear / I don't know
- primary_types:
- validated: False
- from_primary_entries:
- media:
- category:
- text
- text_format:
- audiovisual_format:
- image_format:
- database_format:
- other
- text_is_transcribed: No
- instance_type:
- instance_count:
- instance_size:
- validated: False
- category:
- fname: malindomorph__morphological_dictionary_and_analyser_for_malay_indonesian.json
- Lenguaje dominante
- HTML
- Estrellas
- 91
- Forks
- 47
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de bigscience-workshop/data_tooling
-
data catalog
Dificultad 1/5 Menos de una hora Aptitud para principiantes 82/100
-
data catalog
Dificultad 1/5 Menos de una hora Aptitud para principiantes 62/100
-
Create dataset bhaskar Abiertodata catalog
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
-
Create dataset mediapart Abiertodata catalog
Dificultad 1/5 Menos de una hora Aptitud para principiantes 72/100
-
Create dataset goierna_magazine Abiertodata catalog
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
Todos los issues de bigscience-workshop/data_tooling
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
TauricResearch/TradingAgents#1397 ·
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
TencentCloud/Octop#1085 · 1 comentario ·
-
Sandy macrofaunal assemblages adjacent to rocky reefs on São Miguel Island (Azores, NE Atlantic) Abiertodataset
Dificultad 1/5 Menos de una hora Aptitud para principiantes 80/100
iobis/obis-network-datasets#909 ·
-
Copy cohorts to keep old cohorts Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
OHDSI/CohortConstructor#774 ·