Comment les datasets sont créés
Vous créez des datasets de deux manières : Génération de données synthétiques — UtilisezPOST /generate pour que Pioneer produise des exemples étiquetés à partir d’une description de votre domaine et des labels qui vous intéressent. C’est le moyen le plus rapide d’amorcer un dataset sans aucune donnée étiquetée existante.
POST /generate prend également en charge des types de tâches au-delà de la NER. Passez un task_type différent et le champ requis correspondant :
L’endpoint renvoie immédiatement
202 avec un job_id ; la génération elle-même s’exécute de manière asynchrone. Une fois générés ou étiquetés, les exemples sont stockés automatiquement dans votre dataset. Interrogez GET /generate/jobs/:job_id jusqu’à ce que status soit ready (ou failed, auquel cas consultez le champ error) avant de démarrer l’entraînement.
Charger votre propre dataset
Charger vos propres données : utilisezPOST/felix/datasets/upload/url si vous disposez déjà de données étiquetées. Le processus se déroule en trois étapes :
Étape 1. Obtenir une URL d’upload présignée
dataset_name est requis. dataset_type vaut "ner" par défaut si omis, et accepte "ner", "classification", "custom" ou "decoder" (le champ type vaut "training" par défaut ; "benchmark" est rejeté ici car les datasets de benchmark sont gérés par le système). La réponse inclut presigned_url, dataset_id et version_number.
Étape 2. Uploader le fichier directement vers S3
Étape 3. Déclencher le traitement
202) avec le statut uploading ; le dataset passe ensuite par les statuts restants en arrière-plan : initialized → uploading → converting → validating → ready
Interrogez GET /felix/datasets/{name}/{version} jusqu’à ce que status soit ready (ou failed, auquel cas consultez processing_error) avant de démarrer une tâche d’entraînement. Vous pouvez également passer latest à la place d’un numéro de version pour toujours récupérer la version la plus récente.
Lister vos datasets
Récupérez tous les datasets de votre compte :failed sont exclus par défaut. Passez include_failed=true pour les voir également.
Inspecter un dataset
Pour voir les versions et les détails d’un dataset spécifique, passez son nom :Supprimer un dataset
pending/running sur le dataset, la suppression est rejetée avec 409 Conflict jusqu’à la fin de cette tâche. Une fois la suppression réussie, les tâches d’entraînement et les évaluations déjà terminées restent interrogeables, mais vous ne pouvez plus démarrer de nouvelles tâches qui y font référence.
Le stockage des datasets est gratuit. Vous n’êtes pas facturé pour le stockage des datasets dans Pioneer, quelle que soit leur taille ou leur nombre de versions.
Récapitulatif des endpoints de datasets
Confidentialité des données : si vous souhaitez refuser que vos données soient utilisées dans l’entraînement des modèles de Fastino, veuillez écrire à support@fastino.ai et nous veillerons à ce que vos données soient exclues de nos pipelines d’entraînement.