Running into "Internal error occurred for the current attempt" problem
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Idoneità per principianti
- 25/100
- Tipo di issue
- Bug
- Chiarezza
- Da chiarire
- Stato di attività
- Ferma
- Stack tecnologico
- gcp, python, tensorflow
- Ambito
- cloud, machine-learning
Direzione di ricerca
Inizia esaminando models/model.py alla riga collegata e l’entry point di TFX CloudTuner tfx.extensions.google_cloud_ai_platform.tuner.executor._WorkerExecutor. Riproduci l’esecuzione con la configurazione fornita, quindi esamina i log di CloudTuner e Google Cloud per identificare il problema sottostante. Il lavoro è completato quando l’errore interno viene sostituito da una diagnosi utile oppure il problema di configurazione segnalato viene identificato chiaramente.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
I am using CloudTuner for TFX project, but I keep getting Internal error occurred for the current attempt error, and it doesn't show me what is the actual problem under the hood.
Below is the JSON passed to the CloudTuner, and this is my repository.
The imageUri, I passed the TFX docker image.
{
"scaleTier": "CUSTOM",
"masterType": "standard",
"workerType": "standard",
"workerCount": "2",
"region": "us-central1",
"masterConfig": {
"imageUri": "gcr.io/gcp-ml-172005/img-classification",
"containerCommand": [
"python",
"-m",
"tfx.scripts.run_executor",
"--executor_class_path",
"tfx.extensions.google_cloud_ai_platform.tuner.executor._WorkerExecutor",
"--inputs",
"{\"examples\": [{\"artifact\": {\"id\": \"302652664909979029\", \"uri\": \"gs://gcp-ml-172005-complete-mlops/tfx_pipeline_output/img-classification/874401645461/img-classification-20220725145617/Transform_-7372794461505454080/transformed_examples\", \"properties\": {\"split_names\": {\"string_value\": \"[\\\"train\\\", \\\"eval\\\"]\"}}, \"custom_properties\": {\"tfx_version\": {\"struct_value\": {\"__value__\": \"1.9.0\"}}}}, \"artifact_type\": {\"name\": \"Examples\", \"properties\": {\"span\": \"INT\", \"version\": \"INT\", \"split_names\": \"STRING\"}, \"base_type\": \"DATASET\"}, \"__artifact_class_module__\": \"tfx.types.standard_artifacts\", \"__artifact_class_name__\": \"Examples\"}], \"transform_graph\": [{\"artifact\": {\"id\": \"7122557137885461129\", \"uri\": \"gs://gcp-ml-172005-complete-mlops/tfx_pipeline_output/img-classification/874401645461/img-classification-20220725145617/Transform_-7372794461505454080/transform_graph\", \"custom_properties\": {\"tfx_version\": {\"struct_value\": {\"__value__\": \"1.9.0\"}}}}, \"artifact_type\": {\"name\": \"TransformGraph\"}, \"__artifact_class_module__\": \"tfx.types.standard_artifacts\", \"__artifact_class_name__\": \"TransformGraph\"}]}",
"--outputs",
"{\"best_hyperparameters\": [{\"artifact\": {\"id\": \"6837211415839241726\", \"uri\": \"gs://gcp-ml-172005-complete-mlops/tfx_pipeline_output/img-classification/874401645461/img-classification-20220725145617/Tuner_6462263593776709632/best_hyperparameters\"}, \"artifact_type\": {\"name\": \"HyperParameters\"}, \"__artifact_class_module__\": \"tfx.types.standard_artifacts\", \"__artifact_class_name__\": \"HyperParameters\"}]}",
"--exec-properties",
"{\"custom_config\": \"{\\\"ai_platform_tuning_args\\\": {\\\"masterConfig\\\": {\\\"imageUri\\\": \\\"gcr.io/gcp-ml-172005/img-classification\\\"}, \\\"project\\\": \\\"gcp-ml-172005\\\", \\\"region\\\": \\\"us-central1\\\", \\\"scaleTier\\\": \\\"STANDARD_1\\\"}, \\\"masterConfig\\\": {\\\"imageUri\\\": \\\"gcr.io/gcp-ml-172005/img-classification\\\"}, \\\"project\\\": \\\"gcp-ml-172005\\\", \\\"region\\\": \\\"us-central1\\\", \\\"remote_trials_working_dir\\\": \\\"gs://gcp-ml-172005-complete-mlops/tfx_pipeline_output/img-classification/trials\\\", \\\"scaleTier\\\": \\\"STANDARD_1\\\"}\", \"eval_args\": \"{\\n \\\"num_steps\\\": 4\\n}\", \"train_args\": \"{\\n \\\"num_steps\\\": 160\\n}\", \"tune_args\": \"{\\n \\\"num_parallel_trials\\\": 3\\n}\", \"tuner_fn\": \"models.model.cloud_tuner_fn\"}"
]
}
}
- Lingua principale
- Python
- Stelle
- 383
- Fork
- 93
- Merge medio
- 1g 3h
- PR unite (30g)
- 1
Guida per i contributori
Apri la guida per i contributori
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di tensorflow/cloud
-
Is this project deprecated Aperta
Difficoltà 5/5 Più di una settimana Idoneità per principianti 10/100
tensorflow/cloud#397 · 1 commento · 1 reazione ·
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 30/100
tensorflow/cloud#392 · 3 commenti ·
-
Difficoltà 3/5 1-2 giorni Idoneità per principianti 35/100
tensorflow/cloud#391 ·
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 20/100
tensorflow/cloud#388 · 1 commento ·
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 1/100
tensorflow/cloud#382 ·
Tutte le issue di tensorflow/cloud
Issue simili
-
triage/confirmed
Difficoltà 2/5 1-3 ore Idoneità per principianti 88/100
agentscope-ai/agentscope#2775 ·
-
comp/desktop P3 type/bug
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 92/100
NousResearch/hermes-agent#118866 ·
-
bug
Difficoltà 1/5 Meno di un'ora Idoneità per principianti 90/100
apache/cloudstack#14222 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 76/100
-
bug
Difficoltà 2/5 1-3 ore Idoneità per principianti 82/100