[Python][Docs] Opening a partitioned dataset with schema and filter
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 2/5
- Tempo stimato
- 1-3 ore
- Idoneità per principianti
- 72/100
- Tipo di issue
- Documentazione
- Chiarezza
- Abbastanza chiara
- Stato di attività
- Attiva
- Stack tecnologico
- python
- Ambito
- documentation
Direzione di ricerca
Inizia individuando la documentazione Python sull’apertura dei dataset che tratta il partizionamento, gli schemi e i filtri. Aggiungi l’esempio fornito di un dataset partizionato oppure una nota concisa che spieghi che lo schema deve includere i nomi delle partizioni quando i filtri vi fanno riferimento, e verifica che il comportamento documentato corrisponda all’esempio.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Add a note to the docs that if partitioning and schema are both specified at opening of a dataset and partitioning names are not included in the data, schema needs to include the partitioning names (directory or hive partitioning) in a case that filtering will be done.
Example:
import numpy as np
import pyarrow as pa
import pyarrow.parquet as pq
import pyarrow.dataset as ds
# Define the data
table = pa.table({'one': [-1, np.nan, 2.5],
'two': ['foo', 'bar', 'baz'],
'three': [True, False, True]})
# Write to partitioned dataset
# The files will include columns "two" and "three"
pq.write_to_dataset(table, root_path='dataset_name',
partition_cols=['one'])
# Reading the partitioned dataset with schema not including partitioned names
# will error
schema = pa.schema([("three", "double")])
data = ds.dataset("dataset_name", partitioning="hive", schema=schema)
subset = ds.field("one") == 2.5
data.to_table(filter=subset)
# And will not if done like so:
schema = pa.schema([("three", "double"), ("one", "double")])
data = ds.dataset("dataset_name", partitioning="hive", schema=schema)
subset = ds.field("one") == 2.5
data.to_table(filter=subset)
Reporter: Alenka Frim / @AlenkaF
Note: This issue was originally created as ARROW-15311. Please see the migration documentation for further details.
- Lingua principale
- C++
- Stelle
- 17.1k
- Fork
- 4.3k
- Merge medio
- 3g 13h
- PR unite (30g)
- 93
Guida per i contributori
Apri la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di apache/arrow
-
Component: Continuous Integration Component: MATLAB Type: enhancement
Difficoltà 2/5 1-3 ore Idoneità per principianti 72/100
-
Component: C++ Component: Parquet Type: enhancement
Difficoltà 2/5 1-3 ore Idoneità per principianti 76/100
-
Component: C++ Component: Parquet
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100
-
Component: C++ Type: bug
Difficoltà 2/5 1-3 ore Idoneità per principianti 76/100
-
Component: Archery Component: Continuous Integration Component: Developer Tools Type: enhancement
Difficoltà 2/5 1-3 ore Idoneità per principianti 70/100
Tutte le issue di apache/arrow
Issue simili
-
enhancement
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 88/100
QuantStack/git2cpp#187 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 86/100
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 90/100
AXERA-TECH/ax-llm#77 ·
-
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 90/100
games-on-whales/wolf#509 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100