Hacktoberfest 2026 : les issues que les mainteneurs ont marquées pour octobre, ouvertes et accessibles aux débutants. Parcourir les issues Hacktoberfest

Experimental catalyst conversions for low-dimension tensors

Ouverte
#35 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub

Personne n'a encore pris cette issue.

Évaluation

Difficulté
5/5
Temps estimé
Plus d'une semaine
Accessibilité débutants
20/100
Type d'issue
Fonctionnalité
Clarté
À clarifier
Activité
À l'abandon
Stack technique
scala, spark

Piste de recherche

Commencez par étudier comment les plans logiques de Catalyst et la représentation Tungsten de Spark gèrent les colonnes scalaires, vectorielles et de tenseurs d'ordre supérieur. Comparez le calcul actuel de la matrice de covariance avec les approches proposées de copie et d'aplatissement des buffers, et déterminez comment les quatre types de base pourraient partager du code généré. Le travail est considéré comme terminé lorsqu'il existe un chemin de conversion expérimental, un fallback pour les tenseurs d'ordre supérieur et un résultat de benchmark.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Description

enhancement

Directly integrate with the logical plan of Catalyst when working on small dimensions.

For columns containing scalars or vectors, perform an unsafe memory copy to a buffer instead of using scala collections, and provide a fallback for higher-order tensors. It is recommended to flatten the operations for higher order tensors because the Tungsten representation is not very efficient from a memory perspective.

Implementation for the 4 basic types will duplicate some code, so investigate a templating library or scala macros to generate the code for each type?

The benchmark for this task will be the computation of the covariance matrix of a dataset (hopefully, it can get faster than the current computation in Spark).

Langage dominant
Scala
Étoiles
743
Forks
158
Métriques de merge des PR
Aucune PR mergée en 30 j

Préparer son environnement

  • Fournit un Dockerfile ou un fichier Docker Compose
  • Aucun modèle de pull request
  • Aucun guide de contribution

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Autres issues de databricks/tensorframes

Toutes les issues de databricks/tensorframes

Issues similaires

Plus d'issues Scala

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.