response_evaluation_score (COHERENCE) fails with INVALID_ARGUMENT: Error parsing JSON in all regions — vertexai 1.153.1
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 38/100
- Tipo de issue
- Error
- Claridad
- Bastante claro
- Estado de actividad
- Tranquilo
- Stack tecnológico
- google-cloud, python
- Área
- machine-learning
Línea de trabajo
Empieza reproduciendo el fallo con client.evals.evaluate() y PrebuiltMetric.COHERENCE en las regiones y la versión indicadas. Sigue la solicitud de evaluación a través del SDK hasta el endpoint :evaluateInstances y determina si la respuesta de autorater malformada se gestiona en este repositorio; se considera terminado cuando la evaluación devuelve una puntuación de coherencia sin el error de análisis de JSON.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Bug description
When using PrebuiltMetric.COHERENCE via client.evals.evaluate() (which backs response_evaluation_score in google-adk), the call consistently fails with:
400 INVALID_ARGUMENT: Error parsing JSON. Last error: Expecting property name
enclosed in double quotes: line 1 column 2 (char 1), Input: {* **STEP 1: ...}
The autorater LLM generates a free-text response starting with {* (bullet points), and the :evaluateInstances endpoint attempts to parse it as JSON and fails.
Reproduction
import vertexai
import pandas as pd
client = vertexai.Client(project="<project>", location="us-central1")
df = pd.DataFrame([{
"prompt": "What slabs are in the model?",
"response": "The model has 17 C25 concrete slabs."
}])
result = client.evals.evaluate(
dataset=df,
metrics=[vertexai.types.PrebuiltMetric.COHERENCE],
)
Environment
google-cloud-aiplatform(vertexai): 1.153.1- Regions tested:
us-central1,europe-west1,europe-west3— all fail - The COHERENCE metric YAML (
gs://vertex-ai-generative-ai-eval-sdk-resources/metrics/coherence/v1.yaml) produces free-text output, but the:evaluateInstancesserver endpoint attempts to parse the autorater response as JSON and fails
Expected behavior
Metric evaluation completes and returns a coherence score.
Actual behavior
num_cases_error=1, num_cases_valid=0 on every call. The full error from the server:
google.genai.errors.ClientError: 400 INVALID_ARGUMENT.
Error parsing JSON. Last error: Expecting property name enclosed in double quotes:
line 1 column 2 (char 1), Input: {* **STEP 1: Identify the purpose and audience:...
The autorater generates a valid free-text evaluation but the server-side JSON parser rejects it.
- Lenguaje dominante
- Python
- Estrellas
- 907
- Forks
- 467
- Merge medio
- 1 d 11 h
- PR fusionados (30 d)
- 38
Guía de contribución
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de googleapis/python-aiplatform
-
Protobuf 7.35.1+ support Abiertoapi: vertex-ai
Dificultad 1/5 Menos de una hora Aptitud para principiantes 85/100
googleapis/python-aiplatform#7132 ·
-
api: vertex-ai
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
googleapis/python-aiplatform#7097 ·
-
CustomContainerTrainingJob.run drops max_wait_duration=0 instead of requesting indefinite DWS wait Abiertoapi: vertex-ai
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
googleapis/python-aiplatform#7067 · 1 comentario ·
-
api: vertex-ai
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
googleapis/python-aiplatform#6877 ·
-
api: vertex-ai
Dificultad 2/5 1-3 horas Aptitud para principiantes 68/100
googleapis/python-aiplatform#6865 · 1 comentario ·
Todos los issues de googleapis/python-aiplatform
Issues similares
-
bug
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
stephrobert/dsoxlab#238 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 75/100
sublimehq/package_control#1780 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 70/100
nwg-piotr/nwg-displays#145 ·