Need help with enabling GPUs while predicting through fine-tuned BERT Tensorflow Model on Azure Databricks
Nadie ha tomado este issue todavía.
Evaluación
- Dificultad
- 4/5
- Tiempo estimado
- 3-5 días
- Aptitud para principiantes
- 25/100
- Tipo de issue
- Error
- Claridad
- Necesita aclaración
- Estado de actividad
- Estancado
- Stack tecnológico
- azure, scala, spark, tensorflow
Línea de trabajo
Comience con el predicting_movie_reviews_with_bert_on_tf_hub.ipynb enlazado y la documentación de Azure Databricks TensorFlow. Reproduzca la salida indicada de tf.__version__ y tf.test.is_gpu_available() en el clúster de cuatro GPU de Runtime 7.2 ML especificado y, después, compruebe si el trabajo de predicción llega a los nodos worker. Se considera completado cuando la comprobación de disponibilidad de GPU y la utilización del clúster demuestren que la predicción utiliza las GPU previstas.
Escrito por el modelo de indexación a partir del texto del issue.
Descripción
Hi,
I am referring to this code (https://github.com/google-research/bert/blob/master/predicting_movie_reviews_with_bert_on_tf_hub.ipynb for classification) and running it on Azure Databricks Runtime 7.2 ML (includes Apache Spark 3.0.0, GPU, Scala 2.12). I was able to train a model. Although for predictions, I am using a 4 GPU cluster but it is still taking very long time. I suspect that my cluster is not fully utilized and infact still being used as CPU only...Is there anything I need to change to ensure that the GPUs cluster is being utilized and able to function in distributed manner.
I also referred to Databricks documentation (https://docs.microsoft.com/en-us/azure/databricks/applications/machine-learning/train-model/tensorflow) and did install gpu enabled tensorflow mentioned as:
But even after that print([tf.version, tf.test.is_gpu_available()]) still shows FALSE as value and no improvement in my cluster utilization
Can anyone help on how can i enable full cluster utilization (to worker nodes) for my prediction through fine-tuned bert model?
I would really appreciate the help.
- Lenguaje dominante
- Scala
- Estrellas
- 743
- Forks
- 158
- Métricas de merge de PR
- Sin PR fusionados en 30 d
Guía de contribución
No hay ninguna guía de contribución indexada para este repositorio
Primeros pasos
- Lee el issue completo y luego la guía de contribución del proyecto.
- Comenta en el issue que vas a ocuparte — evita que dos personas hagan lo mismo.
- Haz un fork del repositorio y trabaja en una rama.
- Abre un pull request que haga referencia al número del issue.
Más de databricks/tensorframes
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 20/100
databricks/tensorframes#185 ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 30/100
databricks/tensorframes#179 ·
-
Dificultad 5/5 Más de una semana Aptitud para principiantes 15/100
databricks/tensorframes#176 · 2 comentarios ·
-
Dificultad 4/5 3-5 días Aptitud para principiantes 30/100
databricks/tensorframes#165 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 30/100
databricks/tensorframes#164 ·
Todos los issues de databricks/tensorframes
Issues similares
-
ShuffleManagerRegistry.register recursion guard is inverted, permits GlutenShuffleManager subclasses Abierto
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
-
enhancement
Dificultad 2/5 1-3 horas Aptitud para principiantes 65/100
-
module: unknown type: bug/reported
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
OpenXiangShan/XiangShan#6623 ·
-
Dificultad 2/5 1-3 horas Aptitud para principiantes 78/100
-
Dificultad 1/5 Menos de una hora Aptitud para principiantes 70/100