Feature request: Modify `text.regex_split_with_offsets()` behavior to be in line with `tf.strings.length()`
Maintainer thường phản hồi trong vòng 1 ngày
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức phù hợp với người mới
- 42/100
- Loại issue
- Tính năng
- Độ rõ ràng
- Khá rõ ràng
- Mức độ hoạt động
- Đình trệ
- Công nghệ
- cpp, tensorflow
- Lĩnh vực
- api, machine-learning
Hướng nghiên cứu
Bắt đầu với API text.regex_split_with_offsets() và so sánh các offset được ghi trong tài liệu của API này với tf.strings.length() và tf.strings.substr(), đặc biệt là hành vi BYTE và UTF8_CHAR của chúng. Truy vết phần triển khai và các bài kiểm thử hiện có cho thao tác split; công việc được xem là hoàn tất khi các offset sử dụng đơn vị được yêu cầu và luôn trả về các giá trị tf.int32 nhất quán với các API chuỗi TensorFlow liên quan.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
text.regex_split_with_offsets() currently returns begin and end as tf.int64 tensors that count indices in bytes.
tf.strings.length() on the other hand, returns a tf.int32 tensor which counts lengths in either bytes or UTF8 characters according to the value of the parameter unit.
So this would actually be two separate requests:
- Change the return types of
text.regex_split_with_offsets()totf.int32, removing the need for a cast when comparing withtf.strings.length(). I doubt there will be a use case for strings longer than INT32_MAX in the foreseeable future. - Add parameter
unit: Literal["BYTE", "UTF8_CHAR"] = "BYTE"matching the behavior oftf.strings.length()andtf.strings.substr(). Seeing the regular expressions are already being interpreted in 'utf-8', I think it would make sense to add a layer of abstraction to facilitate slicing by UTF-8 character index.
- Ngôn ngữ chính
- C++
- Star
- 1.3k
- Fork
- 378
- Merge trung bình
- 10 giờ 48 phút
- Pull request đã merge (30 ngày)
- 2
Chuẩn bị môi trường
- Không có Dockerfile hay tệp Docker Compose
- Không có mẫu pull request
- Đọc hướng dẫn đóng góp
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của tensorflow/text
-
Is there a plan to release 2.21?Đang mở
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 25/100
tensorflow/text#1498 · 2 bình luận ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Dataset for tutorial missingĐang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 35/100
tensorflow/text#1497 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 5/5 Hơn một tuần Mức phù hợp với người mới 20/100
tensorflow/text#1448 · 3 reaction ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 35/100
tensorflow/text#1421 · 2 bình luận · 1 reaction ·
Maintainer thường phản hồi trong vòng 1 ngày
-
Allow `tensorflow-text[cpu]`Đang mở
Độ khó 3/5 1-2 ngày Mức phù hợp với người mới 38/100
tensorflow/text#1393 · 1 reaction ·
Maintainer thường phản hồi trong vòng 1 ngày
Tất cả issue của tensorflow/text
Issue tương tự
-
needs-triage
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 70/100
flashinfer-ai/flashinfer#6212 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
bug graphics
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 76/100
FlaxEngine/FlaxEngine#4295 · 2 bình luận ·
Maintainer thường phản hồi trong vòng 2 ngày
-
bug
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 66/100
Algorithmiq/monoprop#390 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
docs
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 68/100
Maintainer thường phản hồi trong vòng 1 ngày
-
8-membered-ring atrop stereo lost in 2026.09.1Có thể đã có người làm Có pull request liên kết đang mở hoặc đã được merge. Đang mởbug
Độ khó 2/5 Nửa ngày Mức phù hợp với người mới 86/100
Maintainer thường phản hồi trong vòng 2 ngày