Cómo se crean los datasets
Puedes crear datasets de dos maneras: Generación de datos sintéticos. UsaPOST /generate para que Pioneer produzca ejemplos etiquetados a partir de una descripción de tu dominio y las etiquetas que te interesan. Es la forma más rápida de arrancar un dataset cuando no tienes datos etiquetados previos.
POST /generate también admite tipos de tarea más allá de NER. Pasa un task_type distinto y su campo obligatorio:
El endpoint devuelve
202 de inmediato con un job_id; la generación en sí se ejecuta de forma asíncrona. Una vez generados o etiquetados, los ejemplos se almacenan automáticamente en tu dataset. Sondea GET /generate/jobs/:job_id hasta que status sea ready (o failed, en cuyo caso revisa el campo error) antes de iniciar el entrenamiento.
Subir tu propio dataset
Si ya tienes datos etiquetados, usaPOST /felix/datasets/upload/url. Es un proceso de tres pasos:
Paso 1. Obtener una URL de subida prefirmada
dataset_name es obligatorio. dataset_type toma por defecto "ner" si se omite y acepta "ner", "classification", "custom" o "decoder" (el campo type es "training" por defecto; "benchmark" se rechaza aquí porque los datasets de benchmark los gestiona el sistema). La respuesta incluye presigned_url, dataset_id y version_number.
Paso 2. Subir el archivo directamente a S3
Paso 3. Disparar el procesamiento
202) con estado uploading; el dataset pasa después por los estados restantes en segundo plano: initialized → uploading → converting → validating → ready
Sondea GET /felix/datasets/{name}/{version} hasta que status sea ready (o failed, en cuyo caso revisa processing_error) antes de iniciar un trabajo de entrenamiento. También puedes pasar latest en lugar de un número de versión para obtener siempre la más reciente.
Listar tus datasets
Recupera todos los datasets de tu cuenta:failed se excluyen por defecto. Pasa include_failed=true para verlos también.
Inspeccionar un dataset
Para ver las versiones y los detalles de un dataset concreto, pasa su nombre:Eliminar un dataset
pending/running sobre el dataset, la eliminación se rechaza con 409 Conflict hasta que ese trabajo termine. Una vez que la eliminación tiene éxito, los trabajos de entrenamiento y las evaluaciones ya completados siguen siendo consultables, pero ya no puedes iniciar nuevos trabajos que lo referencien.
El almacenamiento de datasets es gratuito. No se te cobra por almacenar datasets en Pioneer, sin importar su tamaño o el número de versiones.
Resumen de endpoints de datasets
Privacidad de los datos: si deseas excluir tus datos del entrenamiento de modelos de Fastino, escribe a support@fastino.ai y nos aseguraremos de excluir tus datos de nuestros pipelines de entrenamiento.