> ## Documentation Index
> Fetch the complete documentation index at: https://docs.pioneer.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Catálogo de modelos Pioneer: encoders, decoders e inferencia

> Explora los modelos encoder (GLiNER) y decoder (LLM) de Pioneer para fine-tuning e inferencia. Cubre modos bajo demanda vs. serverless y el catálogo en vivo.

Pioneer admite dos familias de modelos: **modelos codificadores** (GLiNER) para tareas de extracción estructurada como el reconocimiento de entidades nombradas, y **modelos decodificadores** (LLM) para generación de texto, clasificación y prompting abierto. Las tablas de abajo son una instantánea del catálogo actual — usa `GET /base-models` para consultar la lista en vivo, que siempre refleja la disponibilidad y las capacidades actuales.

Algunos modelos en fase de lanzamiento están sujetos a activación de funciones. Aparecen en el catálogo en vivo solo para los espacios de trabajo que tienen habilitado el lanzamiento correspondiente.

## Modelos codificadores (GLiNER)

Los modelos GLiNER realizan reconocimiento de entidades nombradas y extracción estructurada. La mayoría de los modelos base GLiNER admiten tanto entrenamiento como inferencia bajo demanda después del entrenamiento. Los precios son por 1M de tokens.

| Model ID                                   | Etiqueta                           | Entrada | Salida | Entrenamiento | Inferencia            |
| :----------------------------------------- | :--------------------------------- | :------ | :----- | :------------ | :-------------------- |
| `fastino/gliner2-base-v1`                  | GLiNER2 Base                       | \$0.15  | \$0.15 | LoRA, Full    | Serverless, On-demand |
| `fastino/gliner2-large-v1`                 | GLiNER2 Large                      | \$0.15  | \$0.15 | LoRA, Full    | Serverless, On-demand |
| `fastino/gliner2-multi-v1`                 | GLiNER2 Multi                      | \$0.15  | \$0.15 | LoRA, Full    | Serverless, On-demand |
| `fastino/gliner2-multi-large-v1`           | GLiNER2 Multi Large                | \$0.15  | \$0.15 | LoRA, Full    | Serverless, On-demand |
| `fastino/gliguard-LLMGuardrails-300M`      | GLiGuard LLM Guardrails 300M       | \$0.15  | \$0.15 | —             | Serverless            |
| `fastino/gliner2-privacy-filter-PII-multi` | GLiNER2 Privacy Filter PII (Multi) | \$0.15  | \$0.15 | —             | Serverless            |
| `fastino/gliguard-PII-multi`               | GLiNER2-Guardrails-PII-Multi       | \$0.15  | \$0.15 | —             | Serverless            |

`fastino/gliner2-multi-v1` y `fastino/gliner2-multi-large-v1` son variantes multilingües adecuadas para texto que no está en inglés.

## Modelos decodificadores — entrenamiento

El fine-tuning con LoRA a través de `POST /felix/training-jobs` se limita a la familia Nemotron 3.5 Lightning:

| Model ID                                            | Etiqueta                                  | Entrenamiento |
| :-------------------------------------------------- | :---------------------------------------- | :------------ |
| `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16` | Nemotron 3.5 Lightning 30B-A3B            | LoRA          |
| `fastino/Fastino-Nemotron-3.5-Lightning-Finance`    | Fastino Nemotron 3.5 Lightning Finance    | LoRA          |
| `fastino/Fastino-Nemotron-3.5-Lightning-Healthcare` | Fastino Nemotron 3.5 Lightning Healthcare | LoRA          |

Junto con los modelos base GLiNER entrenables de arriba, estos son los únicos modelos base admitidos para nuevos trabajos de entrenamiento. Consulta `GET /base-models?supports_training=true` antes de enviar un trabajo; es la fuente de información en vivo sobre la disponibilidad.

## Modelos decodificadores — inferencia serverless

Estas son las familias de inferencia predesplegadas admitidas. Consulta `GET /base-models?supports_inference=true` para conocer la disponibilidad, los límites de contexto y los precios en vivo.

### Nemotron 3.5 Lightning

| Model ID                                            | Etiqueta                                  |
| --------------------------------------------------- | ----------------------------------------- |
| `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16` | Nemotron 3.5 Lightning 30B-A3B            |
| `fastino/Fastino-Nemotron-3.5-Lightning-Finance`    | Fastino Nemotron 3.5 Lightning Finance    |
| `fastino/Fastino-Nemotron-3.5-Lightning-Healthcare` | Fastino Nemotron 3.5 Lightning Healthcare |

### Anthropic

| Model ID          | Etiqueta        |
| ----------------- | --------------- |
| `claude-opus-5`   | Claude Opus 5   |
| `claude-sonnet-5` | Claude Sonnet 5 |
| `claude-haiku-5`  | Claude Haiku 5  |

### OpenAI

| Model ID        | Etiqueta      |
| --------------- | ------------- |
| `gpt-5.5`       | GPT-5.5       |
| `gpt-5.6-luna`  | GPT-5.6 Luna  |
| `gpt-5.6-terra` | GPT-5.6 Terra |
| `gpt-5.6-sol`   | GPT-5.6 Sol   |

### DeepSeek

| Model ID                        | Etiqueta          |
| ------------------------------- | ----------------- |
| `deepseek-ai/DeepSeek-V4-Flash` | DeepSeek V4 Flash |

### Z.ai

| Model ID               | Etiqueta     |
| ---------------------- | ------------ |
| `zai-org/GLM-5.2`      | GLM 5.2      |
| `zai-org/GLM-5.2-Fast` | GLM 5.2 Fast |

<Note>
  Los modelos fuera de estas familias no se admiten como destinos de inferencia. Usa `GET /base-models` para consultar el catálogo en vivo y el estado del ciclo de vida antes de integrarlos.
</Note>

## Caché de prompts

Muchos modelos serverless facturan los tokens de entrada en caché con descuento, y algunos proveedores facturan un recargo único por escribir tokens en la caché. Pioneer traslada directamente las tarifas de caché publicadas por cada proveedor — son las mismas tarifas que `GET /base-models` devuelve como `cache_read_price_per_million` y `cache_write_price_per_million`, y las mismas tarifas que Pioneer te factura.

Las tarifas de caché se derivan de la tarifa de entrada de cada modelo utilizando los multiplicadores de abajo. Cuando un proveedor no tiene una partida separada para escrituras en caché, las escrituras en caché se facturan a la tarifa de entrada estándar.

| Proveedor              | Lectura en caché | Escritura en caché                                  |
| ---------------------- | ---------------- | --------------------------------------------------- |
| Anthropic (Claude)     | 0.1× entrada     | 1.25× entrada                                       |
| OpenAI (familia GPT-5) | 0.1× entrada     | tarifa de entrada (1.25× en GPT-5.6 Luna/Sol/Terra) |

Consulta el catálogo en vivo para conocer las tarifas de caché exactas. Cualquier modelo sin un descuento de caché explícito factura la entrada en caché a la tarifa de entrada estándar.

## Inferencia bajo demanda vs. serverless

Pioneer ofrece dos formas de servir predicciones, y la elección correcta depende de tu flujo de trabajo.

La inferencia **serverless** utiliza endpoints de modelos base predesplegados. No hay retardo de arranque y se te factura por token. Es ideal cuando quieres llamar a un modelo de frontera sin hacer fine-tuning.

La inferencia **bajo demanda** aprovisiona una GPU dedicada después de que se complete el fine-tuning. Tu adaptador LoRA se carga en la GPU y se sirve exclusivamente para tus solicitudes. Pioneer enruta automáticamente las llamadas de inferencia a un despliegue bajo demanda cuando pasas un ID de trabajo de entrenamiento como `model_id`.

## Consulta el catálogo en vivo

Las tablas de arriba pueden ir retrasadas respecto a los modelos añadidos recientemente. Usa `GET /base-models` para obtener el catálogo actual en tiempo de ejecución.

```bash theme={null}
# Todos los modelos
curl https://api.pioneer.ai/base-models \
  -H "X-API-Key: YOUR_API_KEY"

# Solo modelos que admiten inferencia
curl "https://api.pioneer.ai/base-models?supports_inference=true" \
  -H "X-API-Key: YOUR_API_KEY"

# Solo modelos que admiten entrenamiento
curl "https://api.pioneer.ai/base-models?supports_training=true" \
  -H "X-API-Key: YOUR_API_KEY"

# Filtrar por familia de modelo
curl "https://api.pioneer.ai/base-models?task_type=encoder" \
  -H "X-API-Key: YOUR_API_KEY"

curl "https://api.pioneer.ai/base-models?task_type=decoder" \
  -H "X-API-Key: YOUR_API_KEY"
```

Cada entrada de la respuesta incluye el ID del modelo, su etiqueta visible, la longitud del contexto, las tarifas por 1M de tokens (`input_price_per_million`, `output_price_per_million`, `cache_read_price_per_million`, `cache_write_price_per_million`) y las banderas booleanas `supports_training` y `supports_inference`. Usa el valor del ID del modelo directamente en las solicitudes de trabajos de entrenamiento y en las llamadas de inferencia.

Para listar cada modelo junto con sus tarifas de entrada, salida y caché:

```bash theme={null}
curl -s "https://api.pioneer.ai/base-models?supports_inference=true" \
  -H "X-API-Key: YOUR_API_KEY" \
| jq -r '["model","input/M","output/M","cache_read/M","cache_write/M"],
    (.models[] | [.id, .input_price_per_million, .output_price_per_million,
      .cache_read_price_per_million, .cache_write_price_per_million]) | @tsv' \
| column -t -s $'\t'
```
