Skip to main content
Pioneer admite dos familias de modelos: modelos codificadores (GLiNER) para tareas de extracción estructurada como el reconocimiento de entidades nombradas, y modelos decodificadores (LLM) para generación de texto, clasificación y prompting abierto. Las tablas de abajo son una instantánea del catálogo actual — usa GET /base-models para consultar la lista en vivo, que siempre refleja la disponibilidad y las capacidades actuales. Algunos modelos en fase de lanzamiento están sujetos a activación de funciones. Aparecen en el catálogo en vivo solo para los espacios de trabajo que tienen habilitado el lanzamiento correspondiente.

Modelos codificadores (GLiNER)

Los modelos GLiNER realizan reconocimiento de entidades nombradas y extracción estructurada. La mayoría de los modelos base GLiNER admiten tanto entrenamiento como inferencia bajo demanda después del entrenamiento. Los precios son por 1M de tokens. fastino/gliner2-multi-v1 y fastino/gliner2-multi-large-v1 son variantes multilingües adecuadas para texto que no está en inglés.

Modelos decodificadores — entrenamiento

El fine-tuning con LoRA a través de POST /felix/training-jobs se limita a la familia Nemotron 3.5 Lightning: Junto con los modelos base GLiNER entrenables de arriba, estos son los únicos modelos base admitidos para nuevos trabajos de entrenamiento. Consulta GET /base-models?supports_training=true antes de enviar un trabajo; es la fuente de información en vivo sobre la disponibilidad.

Modelos decodificadores — inferencia serverless

Estas son las familias de inferencia predesplegadas admitidas. Consulta GET /base-models?supports_inference=true para conocer la disponibilidad, los límites de contexto y los precios en vivo.

Nemotron 3.5 Lightning

Anthropic

OpenAI

DeepSeek

Z.ai

Los modelos fuera de estas familias no se admiten como destinos de inferencia. Usa GET /base-models para consultar el catálogo en vivo y el estado del ciclo de vida antes de integrarlos.

Caché de prompts

Muchos modelos serverless facturan los tokens de entrada en caché con descuento, y algunos proveedores facturan un recargo único por escribir tokens en la caché. Pioneer traslada directamente las tarifas de caché publicadas por cada proveedor — son las mismas tarifas que GET /base-models devuelve como cache_read_price_per_million y cache_write_price_per_million, y las mismas tarifas que Pioneer te factura. Las tarifas de caché se derivan de la tarifa de entrada de cada modelo utilizando los multiplicadores de abajo. Cuando un proveedor no tiene una partida separada para escrituras en caché, las escrituras en caché se facturan a la tarifa de entrada estándar. Consulta el catálogo en vivo para conocer las tarifas de caché exactas. Cualquier modelo sin un descuento de caché explícito factura la entrada en caché a la tarifa de entrada estándar.

Inferencia bajo demanda vs. serverless

Pioneer ofrece dos formas de servir predicciones, y la elección correcta depende de tu flujo de trabajo. La inferencia serverless utiliza endpoints de modelos base predesplegados. No hay retardo de arranque y se te factura por token. Es ideal cuando quieres llamar a un modelo de frontera sin hacer fine-tuning. La inferencia bajo demanda aprovisiona una GPU dedicada después de que se complete el fine-tuning. Tu adaptador LoRA se carga en la GPU y se sirve exclusivamente para tus solicitudes. Pioneer enruta automáticamente las llamadas de inferencia a un despliegue bajo demanda cuando pasas un ID de trabajo de entrenamiento como model_id.

Consulta el catálogo en vivo

Las tablas de arriba pueden ir retrasadas respecto a los modelos añadidos recientemente. Usa GET /base-models para obtener el catálogo actual en tiempo de ejecución.
Cada entrada de la respuesta incluye el ID del modelo, su etiqueta visible, la longitud del contexto, las tarifas por 1M de tokens (input_price_per_million, output_price_per_million, cache_read_price_per_million, cache_write_price_per_million) y las banderas booleanas supports_training y supports_inference. Usa el valor del ID del modelo directamente en las solicitudes de trabajos de entrenamiento y en las llamadas de inferencia. Para listar cada modelo junto con sus tarifas de entrada, salida y caché: