SOTA experiment: CacheBridge cross-model KV transfer for router handoffs
Los mantenedores suelen responder en 1 día
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 5/5
- Tiempo estimado
- Más de una semana
- Aptitud para principiantes
- 35/100
- Tipo de issue
- Nueva funcionalidad
- Claridad
- Necesita aclaración
- Estado de actividad
- Activo
- Stack tecnológico
- pytorch, rust
- Área
- ai, distributed-systems, performance
Línea de trabajo
No se nombran archivos, pruebas ni puntos de entrada. Empieza localizando los puntos de entrada existentes para el enrutamiento del modelo y los benchmarks de adaptadores; después, compara el re-prefill ordinario, la línea base de mapeo simple anterior y el mapeo de cabezas coincidentes al estilo de CacheBridge bajo las condiciones fijadas. Se considera terminado cuando las métricas requeridas de latencia, calidad, almacenamiento, calibración, memoria, ancho de banda, longitud de contexto, dirección y múltiples cambios cumplen el umbral de promoción indicado, manteniendo el rollback.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Finding
CacheBridge: Efficient Cross-Model KV Cache Transfer (arXiv:2609.00891, submitted 2026-09-01) reports cross-model KV transfer intended to avoid full receiver prefill during model-family handoffs. The originating team reports 99.83% mean target retention on Qwen3 in one direction family, up to 3x faster mapper application, 8x lower mapper storage, matching with one tenth the calibration data, and a reported mapper construction reduction from 92.63s to 8.63s in a Qwen3 14B to 32B setting.
Evidence status: originating-team measured, GPU/model-family specific, not independently reproduced by RuV.
RuV opportunity
This maps to ruvLLM, RuVector, Cognitum model routing, MidStream, and distributed inference. It could make mid-session model escalation materially cheaper if cache transfer preserves quality.
Experiment
Do not replace prefill globally. Add an isolated adapter benchmark with:
- normal target re-prefill
- prior simple cross-model mapping baseline
- CacheBridge-style head-matched mapping
Pin model revisions, tokenizer, RoPE configuration, context lengths, CUDA, driver, PyTorch/serving runtime, GPU, calibration corpus, and random seeds.
Metrics
- target task accuracy / perplexity retention
- TTFT and p50/p95 handoff latency
- mapper construction time
- mapper storage
- calibration sample count
- GPU memory and transfer bandwidth
- failure by context length and transfer direction
- quality after multiple model switches
Falsification
Mandatory controls include just re-prefilling, prefix caching on the same model, and a simpler linear map. If handoff frequency is low or transferred quality falls materially, the added mapping layer should be rejected.
Promotion gate
At least 2x lower handoff prefill latency on a real RuV routed workload, target quality loss no greater than 1 absolute point, deterministic rollback to ordinary prefill, and no change to RVM authority or provenance semantics.
- Lenguaje dominante
- Rust
- Estrellas
- 4.5k
- Forks
- 603
- Merge medio
- 1 d 11 h
- PR fusionados (30 d)
- 56
Preparar el entorno
Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de ruvnet/RuVector
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 83/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 74/100
Los mantenedores suelen responder en 1 día
Todos los issues de ruvnet/RuVector
Issues similares
-
type/bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
stackabletech/kafka-operator#1033 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
bug good first issue needs testing
Dificultad 2/5 1-3 horas Aptitud para principiantes 84/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
Los mantenedores suelen responder en 3 días
-
docs: release notes v3.7.0–v3.8.0 footer links to README/CHANGELOG are broken after docs reorgAbierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 90/100
farion1231/cc-switch#7744 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
datafusion
Dificultad 2/5 1-3 horas Aptitud para principiantes 76/100
apache/iceberg-rust#3297 ·
Los mantenedores suelen responder en 1 día