Hacktoberfest 2026 : les issues que les mainteneurs ont marquées pour octobre, ouvertes et accessibles aux débutants. Parcourir les issues Hacktoberfest

Issue with storing a parsetree

Ouverte
#150 0 commentaires 0 réactions 0 personnes assignées Voir sur GitHub

Personne n'a encore pris cette issue.

Évaluation

Difficulté
4/5
Temps estimé
3-5 jours
Accessibilité débutants
20/100
Type d'issue
Fonctionnalité
Clarté
À clarifier
Activité
À l'abandon
Stack technique
python
Domaine
data

Piste de recherche

L’issue ne mentionne aucun fichier du dépôt ni aucun test. Commencez par l’appel parsetree(...) et les classes Text et Sentence, puis examinez comment leur contenu est représenté et si une interface d’export existante est documentée. Pour considérer le travail comme terminé, il faudrait un format de sortie défini par un maintainer ainsi qu’une vérification correspondante, ce que l’issue ne précise pas.

Rédigé par le modèle d'indexation à partir du texte de l'issue.

Description

Hello !

Painful issue right here.

I have built a parse tree quite simply on a large volume of texts like :

s = parsetree(string, relations=True, lemmata=True)

with s being of the type : <class 'pattern.text.tree.Text'>

If I do a pprint(s) I get a very clean data structure like :


             WORD   TAG    CHUNK   ROLE   ID     PNP    LEMMA               

@MAP_Information   NN     NP      -      -      -      @map_information   
               et   CC     -       -      -      -      et                  
          pendant   IN     PP      -      -      PNP    pendant             
               ce   PRP    NP      SBJ    1      PNP    ce                  
            temps   NN     NP ^    SBJ    1      PNP    temps               

Which is want I want ! So I would like to store the exact same data structure to any file like a DataFrame, a CSV, plain text... for better readability and user-friendliness.

However this is not possible since it all the outputs belong to <class 'pattern.text.tree.Text'> or <class 'pattern.text.tree.Sentence'> etc... classes, which make them painful to use.

For example I cannot :

encode my object to utf-8 for exporting :

s = s.encode('utf8')

AttributeError: 'Text' object has no attribute 'encode'

Export my object as a text file :

with open("D:\\Testpprint4.txt", 'w') as export :
    for sentence in s :
        export.write(sentence)

TypeError: expected a string or other character buffer object

Put my object to a dataframe :

`pd = pandas.DataFrame(sentence)

PandasError : DataFrame constructor not properly called!`

Or use pprint.pformat to store it as a csv since it does not deal with utf-8.

Would you have a solution ?

Thanks,

Langage dominant
Python
Étoiles
8.9k
Forks
1.6k
Métriques de merge des PR
Aucune PR mergée en 30 j

Préparer son environnement

Ce projet ne fournit ni conteneur de développement, ni Dockerfile, ni guide de contribution : l'installation est à votre charge. Commencez par son README, et consultez notre guide de la première contribution pour les étapes générales.

Par où commencer

  1. Lisez l'issue en entier, puis le guide de contribution du projet.
  2. Signalez en commentaire que vous la prenez — cela évite que deux personnes fassent le même travail.
  3. Forkez le dépôt et travaillez sur une branche.
  4. Ouvrez une pull request qui référence le numéro de l'issue.

Autres issues de clips/pattern

Toutes les issues de clips/pattern

Issues similaires

Plus d'issues Python

Recevez les nouvelles issues par e-mail

Un résumé court des issues GitHub adaptées aux débutants.