GET /base-models para consultar la lista en vivo, que siempre refleja la disponibilidad y las capacidades actuales.
Algunos modelos en fase de lanzamiento están sujetos a activación de funciones. Aparecen en el catálogo en vivo solo para los espacios de trabajo que tienen habilitado el lanzamiento correspondiente.
Modelos codificadores (GLiNER)
Los modelos GLiNER realizan reconocimiento de entidades nombradas y extracción estructurada. La mayoría de los modelos base GLiNER admiten tanto entrenamiento como inferencia bajo demanda después del entrenamiento. Los precios son por 1M de tokens.fastino/gliner2-multi-v1 y fastino/gliner2-multi-large-v1 son variantes multilingües adecuadas para texto que no está en inglés.
Modelos decodificadores — entrenamiento
El fine-tuning con LoRA a través dePOST /felix/training-jobs se limita a la familia Nemotron 3.5 Lightning:
Junto con los modelos base GLiNER entrenables de arriba, estos son los únicos modelos base admitidos para nuevos trabajos de entrenamiento. Consulta
GET /base-models?supports_training=true antes de enviar un trabajo; es la fuente de información en vivo sobre la disponibilidad.
Modelos decodificadores — inferencia serverless
Estas son las familias de inferencia predesplegadas admitidas. ConsultaGET /base-models?supports_inference=true para conocer la disponibilidad, los límites de contexto y los precios en vivo.
Nemotron 3.5 Lightning
Anthropic
OpenAI
DeepSeek
Z.ai
Los modelos fuera de estas familias no se admiten como destinos de inferencia. Usa
GET /base-models para consultar el catálogo en vivo y el estado del ciclo de vida antes de integrarlos.Caché de prompts
Muchos modelos serverless facturan los tokens de entrada en caché con descuento, y algunos proveedores facturan un recargo único por escribir tokens en la caché. Pioneer traslada directamente las tarifas de caché publicadas por cada proveedor — son las mismas tarifas queGET /base-models devuelve como cache_read_price_per_million y cache_write_price_per_million, y las mismas tarifas que Pioneer te factura.
Las tarifas de caché se derivan de la tarifa de entrada de cada modelo utilizando los multiplicadores de abajo. Cuando un proveedor no tiene una partida separada para escrituras en caché, las escrituras en caché se facturan a la tarifa de entrada estándar.
Consulta el catálogo en vivo para conocer las tarifas de caché exactas. Cualquier modelo sin un descuento de caché explícito factura la entrada en caché a la tarifa de entrada estándar.
Inferencia bajo demanda vs. serverless
Pioneer ofrece dos formas de servir predicciones, y la elección correcta depende de tu flujo de trabajo. La inferencia serverless utiliza endpoints de modelos base predesplegados. No hay retardo de arranque y se te factura por token. Es ideal cuando quieres llamar a un modelo de frontera sin hacer fine-tuning. La inferencia bajo demanda aprovisiona una GPU dedicada después de que se complete el fine-tuning. Tu adaptador LoRA se carga en la GPU y se sirve exclusivamente para tus solicitudes. Pioneer enruta automáticamente las llamadas de inferencia a un despliegue bajo demanda cuando pasas un ID de trabajo de entrenamiento comomodel_id.
Consulta el catálogo en vivo
Las tablas de arriba pueden ir retrasadas respecto a los modelos añadidos recientemente. UsaGET /base-models para obtener el catálogo actual en tiempo de ejecución.
input_price_per_million, output_price_per_million, cache_read_price_per_million, cache_write_price_per_million) y las banderas booleanas supports_training y supports_inference. Usa el valor del ID del modelo directamente en las solicitudes de trabajos de entrenamiento y en las llamadas de inferencia.
Para listar cada modelo junto con sus tarifas de entrada, salida y caché: