Issue with storing a parsetree
Personne n'a encore pris cette issue.
Évaluation
- Difficulté
- 4/5
- Temps estimé
- 3-5 jours
- Accessibilité débutants
- 20/100
Piste de recherche
L’issue ne mentionne aucun fichier du dépôt ni aucun test. Commencez par l’appel parsetree(...) et les classes Text et Sentence, puis examinez comment leur contenu est représenté et si une interface d’export existante est documentée. Pour considérer le travail comme terminé, il faudrait un format de sortie défini par un maintainer ainsi qu’une vérification correspondante, ce que l’issue ne précise pas.
Rédigé par le modèle d'indexation à partir du texte de l'issue.
Description
Hello !
Painful issue right here.
I have built a parse tree quite simply on a large volume of texts like :
s = parsetree(string, relations=True, lemmata=True)
with s being of the type : <class 'pattern.text.tree.Text'>
If I do a pprint(s) I get a very clean data structure like :
WORD TAG CHUNK ROLE ID PNP LEMMA
@MAP_Information NN NP - - - @map_information
et CC - - - - et
pendant IN PP - - PNP pendant
ce PRP NP SBJ 1 PNP ce
temps NN NP ^ SBJ 1 PNP temps
Which is want I want ! So I would like to store the exact same data structure to any file like a DataFrame, a CSV, plain text... for better readability and user-friendliness.
However this is not possible since it all the outputs belong to <class 'pattern.text.tree.Text'> or <class 'pattern.text.tree.Sentence'> etc... classes, which make them painful to use.
For example I cannot :
encode my object to utf-8 for exporting :
s = s.encode('utf8')
AttributeError: 'Text' object has no attribute 'encode'
Export my object as a text file :
with open("D:\\Testpprint4.txt", 'w') as export :
for sentence in s :
export.write(sentence)
TypeError: expected a string or other character buffer object
Put my object to a dataframe :
`pd = pandas.DataFrame(sentence)
PandasError : DataFrame constructor not properly called!`
Or use pprint.pformat to store it as a csv since it does not deal with utf-8.
Would you have a solution ?
Thanks,
- Langage dominant
- Python
- Étoiles
- 8.9k
- Forks
- 1.6k
- Métriques de merge des PR
- Aucune PR mergée en 30 j
Préparer son environnement
Ce projet ne fournit ni conteneur de développement, ni Dockerfile, ni guide de contribution : l'installation est à votre charge. Commencez par son README, et consultez notre guide de la première contribution pour les étapes générales.
Par où commencer
- Lisez l'issue en entier, puis le guide de contribution du projet.
- Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
- Forkez le dépôt et travaillez sur une branche.
- Ouvrez une pull request qui référence le numéro de l'issue.
Autres issues de clips/pattern
-
Difficulté 1/5 Moins d'une heure Accessibilité débutants 72/100
-
Difficulté 1/5 Moins d'une heure Accessibilité débutants 72/100
-
pattern.graph exampleOuverte
Difficulté 1/5 Moins d'une heure Accessibilité débutants 65/100
-
Difficulté 1/5 Moins d'une heure Accessibilité débutants 45/100
-
pattern lib not foundOuverte
Difficulté 4/5 3-5 jours Accessibilité débutants 30/100
Toutes les issues de clips/pattern
Issues similaires
-
Difficulté 2/5 1-3 heures Accessibilité débutants 86/100
Les mainteneurs répondent en général sous 1 jour
-
Difficulté 2/5 1-2 jours Accessibilité débutants 70/100
-
FingerprintSplitter raises ZeroDivisionError when int(frac_train * len(dataset)) floors to zeroOuverte
Difficulté 2/5 1-3 heures Accessibilité débutants 88/100
Les mainteneurs répondent en général sous 7 jours
-
Difficulté 2/5 1-3 heures Accessibilité débutants 70/100
lmstudio-ai/mlx-engine#376 ·
-
Difficulté 2/5 1-3 heures Accessibilité débutants 72/100
pyiron/bagofholding#166 ·