Hacktoberfest 2026: những issue maintainer đã đánh dấu cho tháng Mười, đang mở và phù hợp người mới. Xem issue Hacktoberfest

Feature request: Modify `text.regex_split_with_offsets()` behavior to be in line with `tf.strings.length()`

Đang mở
#1,245 1 bình luận 0 reaction 0 người được giao Xem trên GitHub

Maintainer thường phản hồi trong vòng 1 ngày

Chưa có ai nhận issue này.

Đánh giá

Độ khó
4/5
Thời gian dự kiến
3-5 ngày
Mức phù hợp với người mới
42/100
Loại issue
Tính năng
Độ rõ ràng
Khá rõ ràng
Mức độ hoạt động
Đình trệ
Công nghệ
cpp, tensorflow
Lĩnh vực
api, machine-learning

Hướng nghiên cứu

Bắt đầu với API text.regex_split_with_offsets() và so sánh các offset được ghi trong tài liệu của API này với tf.strings.length() và tf.strings.substr(), đặc biệt là hành vi BYTE và UTF8_CHAR của chúng. Truy vết phần triển khai và các bài kiểm thử hiện có cho thao tác split; công việc được xem là hoàn tất khi các offset sử dụng đơn vị được yêu cầu và luôn trả về các giá trị tf.int32 nhất quán với các API chuỗi TensorFlow liên quan.

Do mô hình lập chỉ mục viết ra từ nội dung của issue.

Mô tả

text.regex_split_with_offsets() currently returns begin and end as tf.int64 tensors that count indices in bytes.

tf.strings.length() on the other hand, returns a tf.int32 tensor which counts lengths in either bytes or UTF8 characters according to the value of the parameter unit.

So this would actually be two separate requests:

  1. Change the return types of text.regex_split_with_offsets() to tf.int32, removing the need for a cast when comparing with tf.strings.length(). I doubt there will be a use case for strings longer than INT32_MAX in the foreseeable future.
  2. Add parameter unit: Literal["BYTE", "UTF8_CHAR"] = "BYTE" matching the behavior of tf.strings.length() and tf.strings.substr(). Seeing the regular expressions are already being interpreted in 'utf-8', I think it would make sense to add a layer of abstraction to facilitate slicing by UTF-8 character index.
Ngôn ngữ chính
C++
Star
1.3k
Fork
378
Merge trung bình
10 giờ 48 phút
Pull request đã merge (30 ngày)
2

Chuẩn bị môi trường

Bắt đầu từ đâu

  1. Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
  2. Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
  3. Fork repository và làm thay đổi trên một nhánh.
  4. Mở pull request có tham chiếu số hiệu của issue.

Issue khác của tensorflow/text

Tất cả issue của tensorflow/text

Issue tương tự

Thêm issue về C++

Nhận issue mới trong hộp thư của bạn

Bản tóm tắt ngắn những issue GitHub phù hợp với người mới.