fix(api): DELETE /sandboxes/{id} returns 500/404 with no structured log — root cause invisible
Los mantenedores suelen responder en 1 día
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 3/5
- Tiempo estimado
- 1-2 días
- Aptitud para principiantes
- 58/100
- Tipo de issue
- Error
- Claridad
- Bien especificado
- Estado de actividad
- Tranquilo
- Stack tecnológico
- go
- Área
- api, backend, observability
Línea de trabajo
Comienza en el handler DeleteSandboxesSandboxID e inspecciona cada rama de error terminal, incluyendo ErrSandboxOperationFailed, la ruta de no encontrado y los fallos de deleteSnapshot. Reproduce los escenarios DELETE documentados y, después, verifica que cada respuesta produzca un registro estructurado con sandbox_id, team_id y el error completo en un nivel apropiado.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Problem
DeleteSandboxesSandboxID can return HTTP 500 or 404 with no structured log entry that explains why, making production incidents hard to diagnose.
500 — ErrSandboxOperationFailed path has no log at all
case errors.Is(err, orchestrator.ErrSandboxOperationFailed):
a.sendAPIStoreError(c, http.StatusInternalServerError, ...) // no log, no telemetry
return
This is the most common 500 cause (node unreachable, gRPC error during kill), yet nothing is written to Loki and no span error is recorded. The only signal is the ALB upstream status code.
404 — logged at Debug level, missing teamID
logger.L().Debug(ctx, "Sandbox not found for deletion", logger.WithSandboxID(sandboxID))
Debug level is suppressed in production by default, so 404 responses leave no queryable trace. There is also no teamID field, preventing per-team filtering.
deleteSnapshot failure message is ambiguous
telemetry.ReportError(ctx, "error deleting sandbox", ...) does not distinguish between a kill failure and a snapshot DB failure.
Impact
- On-call cannot distinguish node crash (500) from DB error (500) without reading gRPC traces
- 404 frequency per team is invisible — no Loki query possible
- Incident response requires guessing which layer failed
Reproduction
Any DELETE /sandboxes/{id} where:
- The orchestrator node is unreachable → 500 with zero log
- The sandbox never existed → 404 with zero visible log
Expected behaviour
Each terminal branch emits a structured log at the appropriate level (Error / Info) with sandbox_id, team_id, and the full error field so operators can query Loki directly.
- Lenguaje dominante
- Go
- Estrellas
- 1.6k
- Forks
- 448
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Preparar el entorno
Inicia el contenedor de desarrollo del proyecto en tu navegador, con tu propia cuenta de GitHub.
- Sin Dockerfile ni archivo de Docker Compose
- Sin plantilla de pull request
- Leer la guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de e2b-dev/runtime
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
Los mantenedores suelen responder en 1 día
-
sandbox cache: StartRemoving state transition not broadcast, all allocations see stale Running stateAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 86/100
Los mantenedores suelen responder en 1 día
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 86/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 86/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
Los mantenedores suelen responder en 1 día
Todos los issues de e2b-dev/runtime
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
-
[开源推荐] FCaptcha:可自行部署的开源验证码Abierto
Dificultad 1/5 Menos de una hora Aptitud para principiantes 65/100
521xueweihan/HelloGitHub#3789 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 88/100
Los mantenedores suelen responder en 12 días
-
stage-fail
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
siyuan-note/bazaar#2282 ·
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
openshift/kube-compare#307 ·
Los mantenedores suelen responder en 1 día