Issue with storing a parsetree
Chưa có ai nhận issue này.
Đánh giá
- Độ khó
- 4/5
- Thời gian dự kiến
- 3-5 ngày
- Mức phù hợp với người mới
- 20/100
Hướng nghiên cứu
Issue không nêu tệp nào trong repository hoặc bài kiểm thử nào. Hãy bắt đầu với lời gọi parsetree(...) và các lớp Text và Sentence, sau đó kiểm tra cách nội dung của chúng được biểu diễn và liệu có giao diện export hiện có nào được ghi lại hay không. Để được coi là hoàn tất, cần có định dạng đầu ra do một maintainer định nghĩa và phần xác minh tương ứng, nhưng issue không chỉ rõ điều này.
Do mô hình lập chỉ mục viết ra từ nội dung của issue.
Mô tả
Hello !
Painful issue right here.
I have built a parse tree quite simply on a large volume of texts like :
s = parsetree(string, relations=True, lemmata=True)
with s being of the type : <class 'pattern.text.tree.Text'>
If I do a pprint(s) I get a very clean data structure like :
WORD TAG CHUNK ROLE ID PNP LEMMA
@MAP_Information NN NP - - - @map_information
et CC - - - - et
pendant IN PP - - PNP pendant
ce PRP NP SBJ 1 PNP ce
temps NN NP ^ SBJ 1 PNP temps
Which is want I want ! So I would like to store the exact same data structure to any file like a DataFrame, a CSV, plain text... for better readability and user-friendliness.
However this is not possible since it all the outputs belong to <class 'pattern.text.tree.Text'> or <class 'pattern.text.tree.Sentence'> etc... classes, which make them painful to use.
For example I cannot :
encode my object to utf-8 for exporting :
s = s.encode('utf8')
AttributeError: 'Text' object has no attribute 'encode'
Export my object as a text file :
with open("D:\\Testpprint4.txt", 'w') as export :
for sentence in s :
export.write(sentence)
TypeError: expected a string or other character buffer object
Put my object to a dataframe :
`pd = pandas.DataFrame(sentence)
PandasError : DataFrame constructor not properly called!`
Or use pprint.pformat to store it as a csv since it does not deal with utf-8.
Would you have a solution ?
Thanks,
- Ngôn ngữ chính
- Python
- Star
- 8.9k
- Fork
- 1.6k
- Chỉ số merge pull request
- Không có pull request nào được merge trong 30 ngày
Chuẩn bị môi trường
Dự án này không cung cấp dev container, Dockerfile hay hướng dẫn đóng góp, nên bạn cần tự thiết lập môi trường: hãy bắt đầu từ README và xem hướng dẫn đóng góp lần đầu của chúng tôi để biết các bước chung.
Bắt đầu từ đâu
- Đọc hết issue, rồi đọc hướng dẫn đóng góp của dự án.
- Bình luận trên issue rằng bạn sẽ nhận — tránh hai người làm cùng một việc.
- Fork repository và làm thay đổi trên một nhánh.
- Mở pull request có tham chiếu số hiệu của issue.
Issue khác của clips/pattern
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 72/100
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 72/100
-
pattern.graph exampleĐang mở
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 65/100
-
Độ khó 1/5 Dưới một giờ Mức phù hợp với người mới 45/100
-
pattern lib not foundĐang mở
Độ khó 4/5 3-5 ngày Mức phù hợp với người mới 30/100
Tất cả issue của clips/pattern
Issue tương tự
-
needs triage
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
Maintainer thường phản hồi trong vòng 2 ngày
-
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 82/100
openvinotoolkit/openvino_notebooks#3665 ·
Maintainer thường phản hồi trong vòng 1 ngày
-
bug
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 86/100
Maintainer thường phản hồi trong vòng 1 ngày
-
docs
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 88/100
Maintainer thường phản hồi trong vòng 1 ngày
-
benchmark-gap
Độ khó 2/5 1-3 giờ Mức phù hợp với người mới 78/100
Maintainer thường phản hồi trong vòng 1 ngày