Need help with enabling GPUs while predicting through fine-tuned BERT Tensorflow Model on Azure Databricks
Nessuno ha ancora preso questa issue.
Valutazione
- Difficoltà
- 4/5
- Tempo stimato
- 3-5 giorni
- Idoneità per principianti
- 25/100
- Tipo di issue
- Bug
- Chiarezza
- Da chiarire
- Stato di attività
- Ferma
- Stack tecnologico
- azure, scala, spark, tensorflow
- Ambito
- cloud, distributed-systems, machine-learning
Direzione di ricerca
Inizia con il predicting_movie_reviews_with_bert_on_tf_hub.ipynb collegato e la documentazione Azure Databricks TensorFlow. Riproduci l’output riportato di tf.__version__ e tf.test.is_gpu_available() sul cluster Runtime 7.2 ML con quattro GPU indicato, quindi verifica se il lavoro di predizione raggiunge i nodi worker. Il lavoro è completato quando il controllo della disponibilità delle GPU e l’utilizzo del cluster dimostrano che la predizione usa le GPU previste.
Scritto dal modello di indicizzazione a partire dal testo della issue.
Descrizione
Hi,
I am referring to this code (https://github.com/google-research/bert/blob/master/predicting_movie_reviews_with_bert_on_tf_hub.ipynb for classification) and running it on Azure Databricks Runtime 7.2 ML (includes Apache Spark 3.0.0, GPU, Scala 2.12). I was able to train a model. Although for predictions, I am using a 4 GPU cluster but it is still taking very long time. I suspect that my cluster is not fully utilized and infact still being used as CPU only...Is there anything I need to change to ensure that the GPUs cluster is being utilized and able to function in distributed manner.
I also referred to Databricks documentation (https://docs.microsoft.com/en-us/azure/databricks/applications/machine-learning/train-model/tensorflow) and did install gpu enabled tensorflow mentioned as:
But even after that print([tf.version, tf.test.is_gpu_available()]) still shows FALSE as value and no improvement in my cluster utilization
Can anyone help on how can i enable full cluster utilization (to worker nodes) for my prediction through fine-tuned bert model?
I would really appreciate the help.
- Lingua principale
- Scala
- Stelle
- 743
- Fork
- 158
- Metriche di merge delle PR
- Nessuna PR unita negli ultimi 30g
Guida per i contributori
Nessuna guida per i contributori indicizzata per questo repository
Come iniziare
- Leggi tutta la issue e poi la guida ai contributi del progetto.
- Commenta sulla issue per dire che te ne occupi tu — evita che due persone facciano lo stesso lavoro.
- Fai un fork del repository e lavora su un branch.
- Apri una pull request che faccia riferimento al numero della issue.
Altre issue di databricks/tensorframes
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 20/100
databricks/tensorframes#185 ·
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 30/100
databricks/tensorframes#179 ·
-
Difficoltà 5/5 Più di una settimana Idoneità per principianti 15/100
databricks/tensorframes#176 · 2 commenti ·
-
Difficoltà 4/5 3-5 giorni Idoneità per principianti 30/100
databricks/tensorframes#165 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 30/100
databricks/tensorframes#164 ·
Tutte le issue di databricks/tensorframes
Issue simili
-
Area: Excel support
Difficoltà 2/5 1-3 ore Idoneità per principianti 75/100
orbeon/orbeon-forms#7893 ·
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 70/100
chipsalliance/rocket-chip#3833 ·
-
ShuffleManagerRegistry.register recursion guard is inverted, permits GlutenShuffleManager subclasses Aperta
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100
-
enhancement
Difficoltà 2/5 1-3 ore Idoneità per principianti 65/100
-
Difficoltà 2/5 1-3 ore Idoneità per principianti 78/100