Primitive for normalizing (feature scaling) input data
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 25/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Ferma
- Ambito
- data, machine-learning
Direzione di ricerca
Inizia esaminando le convenzioni esistenti per le primitive Python e il modo in cui vengono gestiti i pandas DataFrames in questo repository. Risolvi se l'intervallo target è [-1,1] oppure quello [0,1] della formula fornita, insieme al comportamento previsto di trimming, clipping e inplace. Il lavoro è completato quando la primitiva di normalizzazione e i relativi casi limite sono coperti dai test.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
I want to create a primitive for normalization of data, or feature scaling so that the input is rescaled to [-1,1]
The formula for rescaling is
X_rescaled = (X - X.min) / (X.max - X.min)
The primitive input arguments are:
data(pandas dataframe)column(string): the column to be rescaledtrim_percentage(float): percentage from the bottom and top to triminplace=True: if false, creates a new column calledrescaled_input
Here are some potential issues with the implementation:
-
the implementation will run on historic data. If this primitive were to be used in an online system, we would have to either implement dynamic rescaling of dataset or automatically flag values larger than
minandmaxas anomalies. Or we can just clip the input and assign large values as-1or1. The last suggestion makes the most sense, in my opinion. -
distribution of the data. The data may have an outlier (very large value,
e.g. 1234) and then the remaining values would be somewhere between-10 and 10. This would result in bad rescaling. One solution is to trim the lowest and highest 1% values, but what if those were outliers?
- Lingua principale
- Python
- Stelle
- 70
- Fork
- 37
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Preparare l'ambiente
- Nessun Dockerfile né file Docker Compose
- Nessun modello di pull request
- Leggi la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di MLBazaar/MLPrimitives
-
Update dependency listAperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 35/100
MLBazaar/MLPrimitives#274 ·
-
Upgrade ``featuretools``Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 45/100
MLBazaar/MLPrimitives#270 · 1 reazione ·
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 20/100
MLBazaar/MLPrimitives#269 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 45/100
MLBazaar/MLPrimitives#268 ·
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 50/100
MLBazaar/MLPrimitives#260 ·
Tutte le issue di MLBazaar/MLPrimitives
Issue simili
-
request-theme
Difficoltà 2/5 Meno di un'ora Idoneità per principianti 70/100
LizardByte/ThemerrDB#8877 · 1 commento ·
I maintainer di solito rispondono entro 1 giorno
-
area/install-update comp/gateway P0 sweeper:risk-compatibility type/bug
Difficoltà 2/5 Meno di un'ora Idoneità per principianti 72/100
NousResearch/hermes-agent#135997 · 3 commenti ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
deepset-ai/haystack#13199 ·
I maintainer di solito rispondono entro 1 giorno
-
[BUG] JSONLoader rejects valid UTF-8 BOM filesForse già presa @zouyonghe l’ha presa oggi. Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
anthropics/knowledge-work-plugins#1298 ·
I maintainer di solito rispondono entro 1 giorno