Lebenszyklus eines Trainingsjobs
Dasstatus-Feld eines Trainingsjobs durchläuft mehrere Zustände. Der Hauptpfad ist:
1
requested
Ihr Job wurde angenommen und ist zur Ausführung eingereiht. Pioneer allokiert Compute-Ressourcen.
2
running
Das Training wird aktiv beim Anbieter ausgeführt.
3
complete
Das GPU-Training wurde erfolgreich abgeschlossen. Loss-Metriken sind im Job-Record verfügbar (siehe Status abfragen und Metriken lesen), und Checkpoints sind zum Herunterladen oder Deployen bereit.
4
normalizing / artifact_ready
Post-Training-Zwischenschritte. Pioneer normalisiert und paketiert das trainierte Artefakt. Diese Zustände sehen Sie typischerweise nur kurz zwischen
complete und deployed.5
deployed
Der trainierte Adapter ist bei einem Inferenzanbieter live und bereit, Anfragen über
model_id zu bedienen.errored (ein Fehler ist während des Trainings aufgetreten), stopped (Sie haben ihn mit POST /felix/training-jobs/:id/stop sauber angehalten, Checkpoints bleiben erhalten), terminated (Sie haben POST /felix/training-jobs/:id/terminate aufgerufen, was den Job stoppt und seine Checkpoints permanent löscht, was unumkehrbar ist) oder paused enden.
Wichtige Parameter
base_model ist erforderlich und muss der Form einer Modell-ID oder UUID entsprechen, kein freier String. Wird der Parameter weggelassen oder ein fehlerhafter Wert gesendet, wird 422 zurückgegeben. Ein wohlgeformter Wert, der keinem für das Training verfügbaren Modell entspricht, gibt stattdessen 400 zurück.Einen Trainingsjob starten
id und des initialen Status:
id. Sie verwenden sie, um den Status abzufragen, Metriken abzurufen und Inferenz gegen Ihr trainiertes Modell auszuführen.
Status abfragen und Metriken lesen
Fragen Sie den Job-Endpunkt ab, bisstatus einen Endzustand erreicht: complete, deployed, errored, stopped oder terminated:
metrics-Feld enthält immer Loss-Werte, sobald das Training beginnt, sowie F1/Precision/Recall/Accuracy, wenn eine separate Evaluierung gegen das resultierende Modell durchgeführt wurde:
{id, timestamp, level, message, source}). Es handelt sich um einen zeitpunktbezogenen Abruf, nicht um einen Live-Stream. Fragen Sie ihn periodisch ab, während der Job running ist, um den Fortschritt zu verfolgen.
Einen Job stoppen oder beenden
Um einen laufenden Job sauber anzuhalten und dabei seine Checkpoints zu bewahren:stopped. Vor dem Stop gespeicherte Checkpoints bleiben für Deployment oder Download verfügbar.
Um einen Job permanent zu beenden und seine Checkpoints zu löschen, verwenden Sie stattdessen /terminate:
Checkpoints und das Herunterladen von Gewichten
Pioneer speichert während des Trainings Checkpoints. Sie können sie jederzeit nach dem Start des Jobs auflisten:is_best, is_final und is_deployable. Sie können jeden deploybaren Checkpoint auf einen Live-Inferenz-Endpunkt deployen, nicht nur den finalen:
403 zurück):
download_url, die nach 1 Stunde abläuft. Rufen Sie diese URL separat ab, um die eigentliche Datei zu erhalten:
base_model-Wert in einem neuen Trainingsjob verwenden, um das Training ausgehend von diesem Checkpoint fortzusetzen.