Hacktoberfest 2026: những issue maintainer đã đánh dấu cho tháng Mười, đang mở và phù hợp người mới. Xem issue Hacktoberfest

Experimental catalyst conversions for low-dimension tensors

Đang mở
#35 0 bình luận 0 reaction 0 người được giao Xem trên GitHub

Chưa có ai nhận issue này.

Đánh giá

Độ khó
5/5
Thời gian dự kiến
Hơn một tuần
Mức phù hợp với người mới
20/100
Loại issue
Tính năng
Độ rõ ràng
Cần làm rõ
Mức độ hoạt động
Đình trệ
Công nghệ
scala, spark

Hướng nghiên cứu

Bắt đầu bằng việc tìm hiểu cách các logical plan của Catalyst và biểu diễn Tungsten của Spark xử lý các cột scalar, vector và tensor bậc cao. So sánh cách tính ma trận hiệp phương sai hiện tại với các cách tiếp cận sao chép và flattening buffer được đề xuất, đồng thời xác định cách bốn kiểu cơ bản có thể dùng chung generated code. Được xem là hoàn thành khi có một conversion path thử nghiệm, một fallback cho tensor bậc cao và một kết quả benchmark.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Mô tả

enhancement

Directly integrate with the logical plan of Catalyst when working on small dimensions.

For columns containing scalars or vectors, perform an unsafe memory copy to a buffer instead of using scala collections, and provide a fallback for higher-order tensors. It is recommended to flatten the operations for higher order tensors because the Tungsten representation is not very efficient from a memory perspective.

Implementation for the 4 basic types will duplicate some code, so investigate a templating library or scala macros to generate the code for each type?

The benchmark for this task will be the computation of the covariance matrix of a dataset (hopefully, it can get faster than the current computation in Spark).

Ngôn ngữ chính
Scala
Star
743
Fork
158
Chỉ số merge pull request
Không có pull request nào được merge trong 30 ngày

Hướng dẫn đóng góp

Chưa lập chỉ mục được hướng dẫn đóng góp cho kho mã nguồn này

Bắt đầu từ đâu

  1. Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
  2. Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
  3. Fork repository và làm thay đổi trên một nhánh.
  4. Mở pull request có tham chiếu số hiệu của issue.

Issue khác của databricks/tensorframes

Tất cả issue của databricks/tensorframes

Issue tương tự

Thêm issue về Scala

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.