Hacktoberfest 2026: die Issues, die Maintainer für den Oktober markiert haben – offen und einsteigerfreundlich. Hacktoberfest-Issues durchsuchen

[azureml python sdk v2] access files in URI_FOLDER output after job has finished?

Offen
#1,891 0 Kommentare 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen

Dieses Issue hat noch niemand übernommen.

Bewertung

Schwierigkeit
4/5
Geschätzter Aufwand
3-5 Tage
Anfängerfreundlichkeit
35/100
Issue-Typ
Bug
Klarheit
Größtenteils klar
Aktivitätsstatus
Veraltet
Tech-Stack
azure, jupyter-notebook, python

Rechercherichtung

Beginnen Sie mit den im Issue gezeigten Azure ML v2 SDK-Job- und NodeOutput-APIs und vergleichen Sie sie anschließend mit dem Zugriffsweg über MlflowClient. Als erledigt gilt die Dokumentation oder Demonstration einer programmgesteuerten Möglichkeit, die URI_FOLDER-Dateien aufzulisten, abzurufen und herunterzuladen, nachdem der Job ivory_octopus_yd6by49kxf abgeschlossen ist.

Vom Indexierungsmodell aus dem Issue-Text verfasst.

Beschreibung

I have a training job that persists some files in an URI_FOLDER output.
How can I access those through the v2 SDK API after the job has finished?

1. job setup

The output is set up like this in the command:

job = command(
    # ...
    outputs=dict(
        outputs=Output(type=AssetTypes.URI_FOLDER, mode='rw_mount'),
    ),
    command="python training_script.py " + 
            "--outputs_dir ${{outputs.outputs}} " +
            # ...other arguments...
)

This seems to work fine, the corresponding folder is mounted correctly and accessible in the training script.

2. training script

In the training script, I persist a dataframe like this:

parser.add_argument("--outputs_dir", dest="outputs_dir", default=DEFAULT_MODEL_DIR)
# ...
some_dataframe.to_csv(os.path.join(args.outputs_dir, 'some_dataframe.csv'), index=True)

This works fine.

3. resulting dataset

After the job has finished, the outputs are available as a dataset.
This is what is shown in Azure ML Studio in the "Overview" tab for job ivory_octopus_yd6by49kxf:
image

The dataset is successfully stored in the workspaceblobstore datastore. I checked it in the Azure ML Studio and it looks fine.

4. accessing the persisted data

After the job has finished, I access the run using a MlflowClient()

MLFLOW_TRACKING_URI = ml_client.workspaces.get(name=ml_client.workspace_name).mlflow_tracking_uri
mlflow.set_tracking_uri(MLFLOW_TRACKING_URI)
mlflow_client = MlflowClient()

mlflow_run = mlflow_client.get_run("ivory_octopus_yd6by49kxf")

or

run = ml_client.jobs.get('ivory_octopus_yd6by49kxf')
# returns NodeOutput class

How can I programmatically list / get / download the outputs connected to the job?

Thanks!

Vorherrschende Sprache
Jupyter Notebook
Sterne
4.4k
Forks
2.6k
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beitragsleitfaden

Für dieses Repository ist kein Beitragsleitfaden indexiert

Erste Schritte

  1. Lesen Sie das ganze Issue und danach den Beitragsleitfaden des Projekts.
  2. Schreiben Sie ins Issue, dass Sie es übernehmen — das erspart doppelte Arbeit.
  3. Forken Sie das Repository und arbeiten Sie in einem Branch.
  4. Öffnen Sie einen Pull Request, der die Issue-Nummer nennt.

Mehr aus Azure/MachineLearningNotebooks

Alle Issues in Azure/MachineLearningNotebooks

Ähnliche Issues

Weitere Issues zu Data Engineering

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.