Skip to main content
Fine-Tuning in Pioneer passt ein Basismodell mithilfe Ihres gelabelten Datasets an Ihre spezifische Aufgabe und Domäne an. Sie senden einen Trainingsjob über die API, Pioneer übernimmt die Compute-Ressourcen, und Sie erhalten ein trainiertes Modell zurück, das Sie für Inferenz aufrufen oder herunterladen können. Der gesamte Prozess ist asynchron. Sie starten den Job und fragen dann ab, bis er abgeschlossen ist. Neue Trainingsjobs in Pioneer verwenden Supervised Fine-Tuning (SFT). Informationen zu Dataset-Formaten und Decoder-Trainingsbeispielen finden Sie im LLM-Fine-Tuning-Leitfaden.

Lebenszyklus eines Trainingsjobs

Das status-Feld eines Trainingsjobs durchläuft mehrere Zustände. Der Hauptpfad ist:
1

requested

Ihr Job wurde angenommen und ist zur Ausführung eingereiht. Pioneer allokiert Compute-Ressourcen.
2

running

Das Training wird aktiv beim Anbieter ausgeführt.
3

complete

Das GPU-Training wurde erfolgreich abgeschlossen. Loss-Metriken sind im Job-Record verfügbar (siehe Status abfragen und Metriken lesen), und Checkpoints sind zum Herunterladen oder Deployen bereit.
4

normalizing / artifact_ready

Post-Training-Zwischenschritte. Pioneer normalisiert und paketiert das trainierte Artefakt. Diese Zustände sehen Sie typischerweise nur kurz zwischen complete und deployed.
5

deployed

Der trainierte Adapter ist bei einem Inferenzanbieter live und bereit, Anfragen über model_id zu bedienen.
Ein Job kann auch in errored (ein Fehler ist während des Trainings aufgetreten), stopped (Sie haben ihn mit POST /felix/training-jobs/:id/stop sauber angehalten, Checkpoints bleiben erhalten), terminated (Sie haben POST /felix/training-jobs/:id/terminate aufgerufen, was den Job stoppt und seine Checkpoints permanent löscht, was unumkehrbar ist) oder paused enden.

Wichtige Parameter

base_model ist erforderlich und muss der Form einer Modell-ID oder UUID entsprechen, kein freier String. Wird der Parameter weggelassen oder ein fehlerhafter Wert gesendet, wird 422 zurückgegeben. Ein wohlgeformter Wert, der keinem für das Training verfügbaren Modell entspricht, gibt stattdessen 400 zurück.

Einen Trainingsjob starten

Die Antwort gibt den vollständigen Job-Record sofort zurück, einschließlich einer UUID id und des initialen Status:
Speichern Sie die id. Sie verwenden sie, um den Status abzufragen, Metriken abzurufen und Inferenz gegen Ihr trainiertes Modell auszuführen.

Status abfragen und Metriken lesen

Fragen Sie den Job-Endpunkt ab, bis status einen Endzustand erreicht: complete, deployed, errored, stopped oder terminated:
Das metrics-Feld enthält immer Loss-Werte, sobald das Training beginnt, sowie F1/Precision/Recall/Accuracy, wenn eine separate Evaluierung gegen das resultierende Modell durchgeführt wurde:
Um strukturierte stdout/stderr-Log-Zeilen für den Job abzurufen:
Dies gibt eine JSON-Liste von Log-Einträgen zurück ({id, timestamp, level, message, source}). Es handelt sich um einen zeitpunktbezogenen Abruf, nicht um einen Live-Stream. Fragen Sie ihn periodisch ab, während der Job running ist, um den Fortschritt zu verfolgen.

Einen Job stoppen oder beenden

Um einen laufenden Job sauber anzuhalten und dabei seine Checkpoints zu bewahren:
Der Job-Status wechselt zu stopped. Vor dem Stop gespeicherte Checkpoints bleiben für Deployment oder Download verfügbar. Um einen Job permanent zu beenden und seine Checkpoints zu löschen, verwenden Sie stattdessen /terminate:
/terminate stoppt den Anbieter-Job, falls er noch läuft, und löscht permanent alle seine Checkpoints. Dies ist unumkehrbar. Verwenden Sie stattdessen /stop, wenn Sie die bisher trainierten Checkpoints behalten möchten.

Checkpoints und das Herunterladen von Gewichten

Pioneer speichert während des Trainings Checkpoints. Sie können sie jederzeit nach dem Start des Jobs auflisten:
Jeder Checkpoint trägt die Flags is_best, is_final und is_deployable. Sie können jeden deploybaren Checkpoint auf einen Live-Inferenz-Endpunkt deployen, nicht nur den finalen:
Um stattdessen Gewichte herunterzuladen, fordern Sie eine Presigned-URL an (erfordert einen Pro-Plan oder höher; andernfalls gibt dieser Aufruf 403 zurück):
Die Antwort ist JSON mit einer download_url, die nach 1 Stunde abläuft. Rufen Sie diese URL separat ab, um die eigentliche Datei zu erhalten:
Sie können auch eine Checkpoint-UUID als base_model-Wert in einem neuen Trainingsjob verwenden, um das Training ausgehend von diesem Checkpoint fortzusetzen.

Übersicht der Trainings-Endpunkte