Skip to main content
Los datasets en Pioneer son colecciones de ejemplos etiquetados que se usan para entrenar y evaluar modelos. Cada dataset tiene un nombre que tú defines, y Pioneer lo versiona automáticamente a medida que añades o regeneras datos. Al iniciar un trabajo de entrenamiento o ejecutar una evaluación haces referencia al dataset por su nombre, así que el nombre que elijas es el identificador estable que usarás en todo tu flujo de trabajo.

Cómo se crean los datasets

Puedes crear datasets de dos maneras: Generación de datos sintéticos. Usa POST /generate para que Pioneer produzca ejemplos etiquetados a partir de una descripción de tu dominio y las etiquetas que te interesan. Es la forma más rápida de arrancar un dataset cuando no tienes datos etiquetados previos.
POST /generate también admite tipos de tarea más allá de NER. Pasa un task_type distinto y su campo obligatorio: El endpoint devuelve 202 de inmediato con un job_id; la generación en sí se ejecuta de forma asíncrona. Una vez generados o etiquetados, los ejemplos se almacenan automáticamente en tu dataset. Sondea GET /generate/jobs/:job_id hasta que status sea ready (o failed, en cuyo caso revisa el campo error) antes de iniciar el entrenamiento.

Subir tu propio dataset

Si ya tienes datos etiquetados, usa POST /felix/datasets/upload/url. Es un proceso de tres pasos:

Paso 1. Obtener una URL de subida prefirmada

Solo dataset_name es obligatorio. dataset_type toma por defecto "ner" si se omite y acepta "ner", "classification", "custom" o "decoder" (el campo type es "training" por defecto; "benchmark" se rechaza aquí porque los datasets de benchmark los gestiona el sistema). La respuesta incluye presigned_url, dataset_id y version_number.

Paso 2. Subir el archivo directamente a S3

Se trata de un HTTP PUT directo a S3. No incluyas aquí tu API key.

Paso 3. Disparar el procesamiento

Esta llamada devuelve de inmediato (202) con estado uploading; el dataset pasa después por los estados restantes en segundo plano: initialized → uploading → converting → validating → ready Sondea GET /felix/datasets/{name}/{version} hasta que status sea ready (o failed, en cuyo caso revisa processing_error) antes de iniciar un trabajo de entrenamiento. También puedes pasar latest en lugar de un número de versión para obtener siempre la más reciente.

Listar tus datasets

Recupera todos los datasets de tu cuenta:
La respuesta lista cada dataset por nombre junto con metadatos como la fecha de creación y el número de versiones. Los datasets con estado failed se excluyen por defecto. Pasa include_failed=true para verlos también.

Inspeccionar un dataset

Para ver las versiones y los detalles de un dataset concreto, pasa su nombre:
Esto devuelve el historial de versiones y los recuentos de ejemplos, útil para confirmar que el dataset está listo antes de entrenar.

Eliminar un dataset

Eliminar un dataset por nombre realiza un borrado lógico de él y de todas sus versiones. Los datos en S3 se conservan por si necesitas restaurarlo. Si algún trabajo de evaluación o entrenamiento está actualmente en estado pending/running sobre el dataset, la eliminación se rechaza con 409 Conflict hasta que ese trabajo termine. Una vez que la eliminación tiene éxito, los trabajos de entrenamiento y las evaluaciones ya completados siguen siendo consultables, pero ya no puedes iniciar nuevos trabajos que lo referencien.
El almacenamiento de datasets es gratuito. No se te cobra por almacenar datasets en Pioneer, sin importar su tamaño o el número de versiones.

Resumen de endpoints de datasets

Privacidad de los datos: si deseas excluir tus datos del entrenamiento de modelos de Fastino, escribe a support@fastino.ai y nos aseguraremos de excluir tus datos de nuestros pipelines de entrenamiento.