Wie Datasets erstellt werden
Sie erstellen Datasets auf zwei Arten: Synthetische Datengenerierung: Verwenden SiePOST /generate, damit Pioneer aus einer Beschreibung Ihrer Domäne und den für Sie relevanten Labels gelabelte Beispiele erzeugt. Dies ist der schnellste Weg, ein Dataset ohne bestehende gelabelte Daten aufzubauen.
POST /generate unterstützt auch andere Task-Typen als NER. Übergeben Sie einen anderen task_type und dessen erforderliches Feld:
Der Endpunkt gibt sofort
202 mit einer job_id zurück. Die Generierung selbst läuft asynchron. Nach der Generierung oder dem Labeling werden die Beispiele automatisch in Ihrem Dataset gespeichert. Fragen Sie GET /generate/jobs/:job_id ab, bis status ready ist (oder failed, in diesem Fall prüfen Sie das error-Feld), bevor Sie mit dem Training beginnen.
Ein eigenes Dataset hochladen
Wenn Sie bereits gelabelte Daten haben, verwenden SiePOST /felix/datasets/upload/url. Dies ist ein dreistufiger Prozess:
Schritt 1. Presigned-Upload-URL abrufen
dataset_name ist erforderlich. dataset_type ist standardmäßig "ner", wenn weggelassen, und akzeptiert "ner", "classification", "custom" oder "decoder" (das Feld type ist standardmäßig "training"; "benchmark" wird hier abgelehnt, da Benchmark-Datasets systemseitig verwaltet werden). Die Antwort enthält presigned_url, dataset_id und version_number.
Schritt 2. Datei direkt zu S3 hochladen
Schritt 3. Verarbeitung auslösen
202 und Status uploading zurück. Das Dataset durchläuft anschließend im Hintergrund die verbleibenden Status: initialized → uploading → converting → validating → ready
Fragen Sie GET /felix/datasets/{name}/{version} ab, bis status ready ist (oder failed, in diesem Fall prüfen Sie processing_error), bevor Sie einen Trainingsjob starten. Sie können statt einer Versionsnummer auch latest übergeben, um immer die neueste Version abzurufen.
Ihre Datasets auflisten
Alle Datasets in Ihrem Konto abrufen:failed werden standardmäßig ausgeschlossen. Übergeben Sie include_failed=true, um auch diese anzuzeigen.
Ein Dataset inspizieren
Um die Versionen und Details eines bestimmten Datasets zu sehen, übergeben Sie dessen Namen:Ein Dataset löschen
pending oder running gegen das Dataset läuft, wird das Löschen mit 409 Conflict abgelehnt, bis dieser Job abgeschlossen ist. Sobald das Löschen erfolgreich ist, bleiben bereits abgeschlossene Trainingsjobs und Evaluierungen abfragbar, aber Sie können keine neuen Jobs mehr starten, die darauf referenzieren.
Die Speicherung von Datasets ist kostenlos. Ihnen wird das Speichern von Datasets in Pioneer nicht berechnet, unabhängig von Größe oder Anzahl der Versionen.
Übersicht der Dataset-Endpunkte
Datenschutz: Wenn Sie sich abmelden möchten, dass Ihre Daten für das Modelltraining von Fastino verwendet werden, senden Sie bitte eine E-Mail an support@fastino.ai. Wir stellen dann sicher, dass Ihre Daten aus unseren Trainings-Pipelines ausgeschlossen werden.