Add utility to index ePub documents content

Offen
#333 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen

Dieses Issue hat noch niemand übernommen.

Bewertung

Schwierigkeit
3/5
Geschätzter Aufwand
1-2 Tage
Anfängerfreundlichkeit
55/100
Issue-Typ
Feature
Klarheit
Größtenteils klar
Aktivitätsstatus
Ruhig
Tech-Stack
python
Bereich
search

Rechercherichtung

Beginnen Sie mit der Durchsicht der PDF-Extraktionsarbeit im pull request 182 von python-scraperlib und des zugehörigen Gutenberg issue 95. Identifizieren Sie den wiederverwendbaren scraperlib-Einstiegspunkt, der für die ePub-Extraktion benötigt wird, und definieren Sie den Abschluss so, dass ePub-Inhalte und -Metadaten bereitgestellt werden, damit Scraper sie für die Volltextindizierung verwenden können.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Beschreibung

enhancement

Content of ePub documents is not indexed for full text search, while on some ZIM it is the "core" of the ZIM.

Extracting ePub info would be beneficial to multiple scrapers and should thus ideally be exposed in scraperlib, just like we did for PDFs in https://github.com/openzim/python-scraperlib/pull/182

See https://github.com/openzim/gutenberg/issues/95

Vorherrschende Sprache
Python
Sterne
31
Forks
27
Ø Merge
3 T. 7 Std.
Gemergte PRs (30 T.)
2

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Erste Schritte

  1. Lesen Sie das ganze Issue und danach den Beitragsleitfaden des Projekts.
  2. Schreiben Sie ins Issue, dass Sie es übernehmen — das erspart doppelte Arbeit.
  3. Forken Sie das Repository und arbeiten Sie in einem Branch.
  4. Öffnen Sie einen Pull Request, der die Issue-Nummer nennt.

Mehr aus openzim/python-scraperlib

Alle Issues in openzim/python-scraperlib

Ähnliche Issues

Weitere Issues zu Python

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.