Hacktoberfest 2026: los issues que los mantenedores marcaron para octubre, abiertos y aptos para principiantes. Explorar issues de Hacktoberfest

SOTA experiment: CacheBridge cross-model KV transfer for router handoffs

Abierto
#956 0 comentarios 0 reacciones 0 asignados Ver en GitHub

Los mantenedores suelen responder en 1 día

Nadie ha tomado este issue todavía.

Evaluación

Dificultad
5/5
Tiempo estimado
Más de una semana
Aptitud para principiantes
35/100
Tipo de issue
Nueva funcionalidad
Claridad
Necesita aclaración
Estado de actividad
Activo
Stack tecnológico
pytorch, rust

Línea de trabajo

No se nombran archivos, pruebas ni puntos de entrada. Empieza localizando los puntos de entrada existentes para el enrutamiento del modelo y los benchmarks de adaptadores; después, compara el re-prefill ordinario, la línea base de mapeo simple anterior y el mapeo de cabezas coincidentes al estilo de CacheBridge bajo las condiciones fijadas. Se considera terminado cuando las métricas requeridas de latencia, calidad, almacenamiento, calibración, memoria, ancho de banda, longitud de contexto, dirección y múltiples cambios cumplen el umbral de promoción indicado, manteniendo el rollback.

Escrito por el modelo de indexación a partir del texto del issue.

Descripción

Finding

CacheBridge: Efficient Cross-Model KV Cache Transfer (arXiv:2609.00891, submitted 2026-09-01) reports cross-model KV transfer intended to avoid full receiver prefill during model-family handoffs. The originating team reports 99.83% mean target retention on Qwen3 in one direction family, up to 3x faster mapper application, 8x lower mapper storage, matching with one tenth the calibration data, and a reported mapper construction reduction from 92.63s to 8.63s in a Qwen3 14B to 32B setting.

Evidence status: originating-team measured, GPU/model-family specific, not independently reproduced by RuV.

RuV opportunity

This maps to ruvLLM, RuVector, Cognitum model routing, MidStream, and distributed inference. It could make mid-session model escalation materially cheaper if cache transfer preserves quality.

Experiment

Do not replace prefill globally. Add an isolated adapter benchmark with:

  1. normal target re-prefill
  2. prior simple cross-model mapping baseline
  3. CacheBridge-style head-matched mapping

Pin model revisions, tokenizer, RoPE configuration, context lengths, CUDA, driver, PyTorch/serving runtime, GPU, calibration corpus, and random seeds.

Metrics

  • target task accuracy / perplexity retention
  • TTFT and p50/p95 handoff latency
  • mapper construction time
  • mapper storage
  • calibration sample count
  • GPU memory and transfer bandwidth
  • failure by context length and transfer direction
  • quality after multiple model switches

Falsification

Mandatory controls include just re-prefilling, prefix caching on the same model, and a simpler linear map. If handoff frequency is low or transferred quality falls materially, the added mapping layer should be rejected.

Promotion gate

At least 2x lower handoff prefill latency on a real RuV routed workload, target quality loss no greater than 1 absolute point, deterministic rollback to ordinary prefill, and no change to RVM authority or provenance semantics.

Lenguaje dominante
Rust
Estrellas
4.5k
Forks
603
Merge medio
1 d 11 h
PR fusionados (30 d)
56

Preparar el entorno

Aún no hemos revisado los archivos de configuración de este proyecto. Empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.

Primeros pasos

  1. Lee el issue completo y luego la guía de contribución del proyecto.
  2. Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
  3. Haz un fork del repositorio y trabaja en una rama.
  4. Abre un pull request que haga referencia al número del issue.

Más de ruvnet/RuVector

Todos los issues de ruvnet/RuVector

Issues similares

Más issues de Rust

Recibe los nuevos issues en tu correo

Un resumen breve de issues de GitHub para principiantes.