Config option to disable is_blocked() post-crawl content veto
Los mantenedores suelen responder en 1 día
@nightcityblade ya está trabajando en esto.
Desde el 19/7/2026.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 55/100
Línea de trabajo
Start by tracing arun() post-processing in async_webcrawler.py and the is_blocked() implementation in antibot_detector.py, including the existing binary-download and fallback-fetch special cases. Then inspect CrawlerRunConfig and CrawlResult to determine the least disruptive opt-out or verdict exposure, and add regression coverage showing that fetched content remains available for caller-side quality checks.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
is_blocked() (antibot_detector.py) is applied unconditionally in arun()'s post-processing and can mark successfully-fetched content as failed. Your own code already special-cases it twice in async_webcrawler.py — the comments note it "would misread 0 bytes html as a block" for binary downloads, and that real pages containing anti-bot script markers "trigger false positives" after fallback fetches. We hit a third case: small legitimate pages (a 378-byte file:// document) fail the minimal_text structural tier. Downstream consumers with their own quality pipelines currently have no way to receive the fetched content plus the verdict instead of a hard failure. Would you accept a PR adding a CrawlerRunConfig flag (e.g. check_blocked: bool = True) — or alternatively surfacing the verdict on a successful CrawlResult field — so callers can opt into making that judgment themselves?
- Lenguaje dominante
- Python
- Estrellas
- 84.8k
- Forks
- 8.8k
- Merge medio
- 13 h 57 min
- PR fusionados (30 d)
- 13
Preparar el entorno
- Incluye un Dockerfile o un archivo de Docker Compose
- Tiene una plantilla de pull request
- Leer la guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de unclecode/crawl4ai
-
[Bug]: whitespace-only inline elements are removed from cleaned_html, merging words in raw_markdown (prose, not only <pre>/<code>)Posiblemente ocupada @drakeo338 la tomó hace 7 días. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 83/100
Los mantenedores suelen responder en 1 día
-
[Bug]: HTTP crawler puts proxy credentials into the URL unencodedPosiblemente ocupada @omarbounawarapy la tomó hace 8 días. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
unclecode/crawl4ai#2326 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
[Bug]: Same PDF gives different markdown on each run when batch_size > 1 (threads share current_page_number)Posiblemente ocupada @Kylinny la tomó hace 9 días. Abierto🐞 Bug 🩺 Needs Triage
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
unclecode/crawl4ai#2319 · 2 comentarios ·
Los mantenedores suelen responder en 1 día
-
[Bug]: Reusing BFSDeepCrawlStrategy leaks the previous crawl's max_pages budget into a fresh runPosiblemente ocupada @nightcityblade la tomó hace 10 días. Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
unclecode/crawl4ai#2309 · 2 comentarios ·
Los mantenedores suelen responder en 1 día
-
[Bug]: Docker server fails to boot after mcp 2.0.0 release — mcp_bridge uses the removed v1 low-level APIQuizá libre de nuevo @nightcityblade la tomó hace 50 días y no hay ningún pull request abierto. Abierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 84/100
unclecode/crawl4ai#2147 · 5 comentarios ·
Los mantenedores suelen responder en 1 día
Todos los issues de unclecode/crawl4ai
Issues similares
-
Performance: deprecated DeviceEntry.config_entries access blocks the event loop for tens of secondsAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
tuya/tuya_cloud_ha_bridge#14 ·
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
semantica-agi/semantica#1968 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 62/100
Los mantenedores suelen responder en 1 día
-
agent: ready area: submission priority: high type: docs
Dificultad 2/5 1-3 horas Aptitud para principiantes 62/100
dkritarth/scopewatch#213 ·
Los mantenedores suelen responder en 1 día
-
Broken link in RELEASE.mdPosiblemente ocupada @Jah-yee la tomó hoy. Abierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 88/100
sphinx-contrib/httpdomain#143 ·
Los mantenedores suelen responder en 1 día