Hacktoberfest 2026 : les issues que les mainteneurs ont marquées pour octobre, ouvertes et accessibles aux débutants. Parcourir les issues Hacktoberfest

Store high-order tensors as 1d vectors

Ouverte
#47 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub

Personne n'a encore pris cette issue.

Évaluation

Difficulté
5/5
Temps estimé
Plus d'une semaine
Accessibilité débutants
30/100
Type d'issue
Fonctionnalité
Clarté
Plutôt claire
Activité
À l'abandon
Stack technique
scala, spark, tensorflow

Piste de recherche

Commencez par localiser les points d’entrée analyze et printschema et examiner la manière dont les métadonnées représentent actuellement les tenseurs imbriqués et aplatis. Le travail sera considéré comme terminé lorsque le stockage row-major listé et le comportement correspondant d’ingestion/de sortie seront pris en charge, y compris les options compact_storage, et que printschema distinguera le stockage 1d des tenseurs de dimension supérieure.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Description

enhancement

Because catalyst is optimized for 0d and 1d tensors, all the tensors should be stored this way. Of course, users can still input some arrays of arrays at the inputs, but the outputs should be optimized for 1d arrays. It should be the recommended output for anything above 3d tensors.

This can be done only with a more flexible interpretation of the metadata.

One concern is that the data storage as seen by sql may be different from the interpretation seen by tensorframes. On the positive side, it will simplify the low-level operations.

Expected modifications:

  • default storage layout is row major (but with consideration to a potential option to column major)
  • all operations should accept at ingest imbricated arrays or flattened tensors
  • all operations should output flattened tensors for tensors >= 2 dimensions -> this is a user-facing change
  • analyze will be the conversion point between flattened and nested representations, with an extra option compact_storage. This option will either accept a single boolean (all numerical types), the letter 'R" (all columns compacted in Row order) or a list of names of columns (only these columns are compacted in Row order). A dictionary could be supported later.
  • printschema will differentiate between tensors stored in 1d and n
Langage dominant
Scala
Étoiles
743
Forks
158
Métriques de merge des PR
Aucune PR mergée en 30 j

Préparer son environnement

  • Fournit un Dockerfile ou un fichier Docker Compose
  • Aucun modèle de pull request
  • Aucun guide de contribution

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Autres issues de databricks/tensorframes

Toutes les issues de databricks/tensorframes

Issues similaires

Plus d'issues Scala

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.