Driver-level rx-drop counters (kernel-drops, ppline-drops) aren't exposed via the Prometheus endpoint
I maintainer di solito rispondono entro 1 giorno
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 5/5
- Tempo stimato
- Più di una settimana
- Idoneità per principianti
- 35/100
- Tipo di issue
- Funzionalità
- Chiarezza
- Da chiarire
- Stato di attività
- Attiva
- Stack tecnologico
- prometheus, rust
- Ambito
- cli, observability
Direzione di ricerca
Inizia dall’output dello stato del driver di dataplane-cli e dall’endpoint /metrics di Prometheus, quindi confronta le metriche vpc_* esistenti con kernel-drops e ppline-drops. Esamina i comandi correlati, inclusi show vpc peerings/routing/summary e show pipeline stats o stages, insieme all’indagine in githedgehog/fabricator#1989. Il lavoro è completato quando l’ambito delle metriche e la semantica di kernel-drops sono stati decisi e l’esposizione richiesta è chiaramente specificata.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Found while investigating githedgehog/fabricator#1989. Two drop signals live on opposite sides of a gap, each visible through exactly one interface:
dataplane-cli show driver statusexposes per-AF_PACKET-workerkernel-dropsandppline-drops. Nothing on/metricscorresponds to it. Full metric list from a live gateway is 8 names, allvpc_*:vpc_byte_count, vpc_byte_rate, vpc_packet_count, vpc_packet_rate, vpc_pair_drops_byte_count, vpc_pair_drops_byte_rate, vpc_pair_drops_packet_count, vpc_pair_drops_packet_rate- Conversely,
vpc_pair_drops_packet_count(metrics-only) has no CLI equivalent:show vpc peerings/routing/summarydon't surface a per-pair drop count, andshow pipeline stats/show pipeline stages(the two commands that look like the natural home for it) both currently answerNot supported: Not implemented yet.
This matters because production monitoring is the Prometheus scrape, not an interactive dataplane-cli session. In the #1989 investigation, kernel-drops turned out to be the one signal that correlated with the failure (bursty, clustered on the exact NAT tests driving real throughput, on the one or two workers actually carrying that traffic, silent otherwise) - and it would have been invisible to any dashboard or alert built on the existing metrics, discoverable only by someone thinking to run the CLI by hand.
Ask: is there a reason kernel-drops/ppline-drops aren't exposed as metrics today (cardinality, overhead, or just not gotten to), or would it be reasonable to add them (per worker, or aggregated) so a burst-driven drop shows up alongside vpc_pair_drops_packet_count in whatever already watches that?
Separately, confirming the semantics would help interpret this and future readings correctly: does kernel-drops mean what its name suggests, packets the kernel dropped before this worker's AF_PACKET socket could read them (e.g. ring full)?
- Lingua principale
- Rust
- Stelle
- 20
- Fork
- 9
- Merge medio
- 4g 9h
- PR unite (30g)
- 35
Preparare l'ambiente
- Include un Dockerfile o un file Docker Compose
- Nessun modello di pull request
- Nessuna guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di githedgehog/dataplane
-
Allow per-expose gwgroup override for GatewayPeeringForse già presa @Fredi-raspall l’ha presa 9 giorni fa. Aperta
githedgehog/dataplane#1864 · 1 assegnatario ·
I maintainer di solito rispondono entro 1 giorno
-
Run Nvidia Infra controller, configure vtap on the DPU and peer with fabricForse già presa @sergeymatov l’ha presa 9 giorni fa. Aperta
githedgehog/dataplane#1863 · 1 assegnatario ·
I maintainer di solito rispondono entro 1 giorno
-
Dependencies: Revisit minor version pinning for `smallvec`Forse già presa @qmonnet l’ha presa 9 giorni fa. Apertadependencies
githedgehog/dataplane#1861 · 1 assegnatario ·
I maintainer di solito rispondono entro 1 giorno
-
NAT config: reject absurdly-long flow timeoutsForse già presa @qmonnet l’ha presa 14 giorni fa. Apertaarea/nat
githedgehog/dataplane#1854 · 1 assegnatario ·
I maintainer di solito rispondono entro 1 giorno
-
Fix cargo test in dataplaneForse già presa @daniel-noland l’ha presa 15 giorni fa. Aperta
githedgehog/dataplane#1853 · 1 assegnatario ·
I maintainer di solito rispondono entro 1 giorno
Tutte le issue di githedgehog/dataplane
Issue simili
-
mxl-compile: пример заполнения ячеек отклоняется UnicaForse già presa Una pull request collegata a questa issue è aperta o già unita. Aperta
Difficoltà 1/5 1-3 ore Idoneità per principianti 91/100
IngvarConsulting/unica#1301 ·
I maintainer di solito rispondono entro 1 giorno
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100
-
curator: add tutros/sbxmAperta
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 75/100
ajeetraina/awesome-docker-sbx#220 ·
-
`helios / deploy`: switch zone wait in `deploy.sh` has almost no headroom over healthy startup timesForse già presa Una pull request collegata a questa issue è aperta o già unita. ApertaTest Flake
Difficoltà 2/5 1-3 ore Idoneità per principianti 74/100
oxidecomputer/omicron#11453 ·
I maintainer di solito rispondono entro 1 giorno