Why Does vf_loss Take the Maximum Value, Rendering Clamp Meaningless?
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Error
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- python
- Área
- machine-learning
Línea de trabajo
Comienza leyendo la implementación de critic_loss_fn mostrada en el issue, centrándote en values_clipped, vf_loss1, vf_loss2, torch.max y mask. Compara el cálculo de la pérdida con el comportamiento previsto de la pérdida de valor y determina si el clamp es efectivo; se considera terminado cuando se documenta la justificación o se identifica un problema de implementación confirmado.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
critic_loss:
def critic_loss_fn(self, values, old_values, returns, mask):
value loss
values_clipped = torch.clamp(
values,
old_values - self.cliprange_value,
old_values + self.cliprange_value,
)
vf_loss1 = (values - returns) ** 2
vf_loss2 = (values_clipped - returns) ** 2
vf_loss = 0.5 * torch.sum(
torch.max(vf_loss1, vf_loss2) * mask) / mask.sum()
return vf_loss
Why does vf_loss take the maximum value? If that's the case, wouldn't the clamp be meaningless?
- Lenguaje dominante
- Python
- Estrellas
- 6.8k
- Forks
- 1.1k
- Merge medio
- 3 d 20 h
- PR fusionados (30 d)
- 5
Preparar el entorno
Este proyecto no incluye contenedor de desarrollo, Dockerfile ni guía de contribución, así que la configuración corre por tu cuenta: empieza por su README y consulta nuestra guía para la primera contribución para los pasos generales.
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de deepspeedai/DeepSpeedExamples
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 52/100
deepspeedai/DeepSpeedExamples#996 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
deepspeedai/DeepSpeedExamples#995 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 52/100
deepspeedai/DeepSpeedExamples#989 ·
-
moe example 404Abierto
Dificultad 4/5 3-5 días Aptitud para principiantes 25/100
deepspeedai/DeepSpeedExamples#984 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 42/100
deepspeedai/DeepSpeedExamples#979 · 6 comentarios ·
Todos los issues de deepspeedai/DeepSpeedExamples
Issues similares
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 82/100
Los mantenedores suelen responder en 1 día
-
Dificultad 2/5 Medio día Aptitud para principiantes 70/100
Los mantenedores suelen responder en 1 día
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 72/100
Qiskit/qiskit-ibm-runtime#3431 · 1 comentario ·
Los mantenedores suelen responder en 1 día
-
[Lesson] A compatibility-gate rejection is a verdict, not something to overwrite with --accept-riskAbiertolesson-submission needs-ac pending-review
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
Ikalus1988/MisakaNet#2870 ·
Los mantenedores suelen responder en 1 día
-
feature:LinkChecker
Dificultad 2/5 1-3 horas Aptitud para principiantes 66/100
digitalfabrik/integreat-cms#4594 ·
Los mantenedores suelen responder en 5 días