Normalize and filter dataset
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Idoneità per principianti
- 35/100
Direzione di ricerca
Non vengono indicati file o test. Inizia individuando la pipeline del dataset, le regole di normalizzazione di foundations e lo schema canonico; quindi identifica dove devono collocarsi il filtraggio e le metriche di qualità. Il lavoro è completato quando sono disponibili un dataset canonico ripulito, statistiche di filtraggio documentate e report sulla qualità prima/dopo che coprano tutti i criteri elencati.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Summary
Apply normalization rules and filter out low-quality commit messages.
Success Criteria
- Apply all normalization rules from foundations
- Filter criteria defined and applied:
- Remove non-conventional commits
- Remove commits with parsing errors
- Remove duplicates
- Remove auto-generated commits (dependabot, etc.)
- Quality metrics computed and documented
- Before/after statistics reported
Quality Filters
- Minimum subject length
- Valid type (feat, fix, docs, etc.)
- No merge commits
- English language only (v1)
Output
- Cleaned dataset in canonical schema format
- Quality report with filtering statistics
- Lingua principale
- Python
- Stelle
- 0
- Fork
- 0
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Guida per i contributori
Apri la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di aRustyDev/ccgram
-
docs experiment
Difficoltà 5/5 Più di una settimana Idoneità per principianti 35/100
-
Write usage documentation Apertadocs
Difficoltà 4/5 3-5 giorni Idoneità per principianti 55/100
-
Freeze architecture Apertainfra model
Difficoltà 5/5 Più di una settimana Idoneità per principianti 25/100
-
Document findings Apertadocs experiment
Difficoltà 3/5 3-5 giorni Idoneità per principianti 45/100
-
ablation evaluation
Difficoltà 4/5 3-5 giorni Idoneità per principianti 30/100
Tutte le issue di aRustyDev/ccgram
Issue simili
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
anthropics/skills#1811 · 1 commento ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
speaches-ai/speaches#678 ·
-
bug
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
datalayer/mcp-compose#42 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
conda-forge/spacy-feedstock#177 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 70/100
UKGovernmentBEIS/inspect_evals#2523 ·