> ## Documentation Index
> Fetch the complete documentation index at: https://docs.pioneer.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Catalogue de modèles Pioneer : encodeurs et décodeurs

> Parcourez les modèles encodeurs (GLiNER) et décodeurs (LLM) de Pioneer pour le fine-tuning et l'inférence, en mode à la demande ou sans serveur.

Pioneer prend en charge deux familles de modèles : les **modèles encodeurs** (GLiNER) pour les tâches d'extraction structurée comme la reconnaissance d'entités nommées, et les **modèles décodeurs** (LLM) pour la génération de texte, la classification et le prompting ouvert. Les tableaux ci-dessous sont un instantané du catalogue actuel — utilisez `GET /base-models` pour interroger la liste en direct, qui reflète toujours la disponibilité et les capacités actuelles.

Certains modèles en phase de déploiement sont soumis à des feature gates. Ils n'apparaissent dans le catalogue en direct que pour les espaces de travail où le déploiement correspondant est activé.

## Modèles encodeurs (GLiNER)

Les modèles GLiNER effectuent la reconnaissance d'entités nommées et l'extraction structurée. La plupart des modèles de base GLiNER prennent en charge à la fois l'entraînement et l'inférence à la demande après entraînement. Les tarifs sont pour 1M de tokens.

| Model ID                                   | Libellé                            | Entrée | Sortie | Entraînement | Inférence             |
| :----------------------------------------- | :--------------------------------- | :----- | :----- | :----------- | :-------------------- |
| `fastino/gliner2-base-v1`                  | GLiNER2 Base                       | \$0.15 | \$0.15 | LoRA, Full   | Serverless, On-demand |
| `fastino/gliner2-large-v1`                 | GLiNER2 Large                      | \$0.15 | \$0.15 | LoRA, Full   | Serverless, On-demand |
| `fastino/gliner2-multi-v1`                 | GLiNER2 Multi                      | \$0.15 | \$0.15 | LoRA, Full   | Serverless, On-demand |
| `fastino/gliner2-multi-large-v1`           | GLiNER2 Multi Large                | \$0.15 | \$0.15 | LoRA, Full   | Serverless, On-demand |
| `fastino/gliguard-LLMGuardrails-300M`      | GLiGuard LLM Guardrails 300M       | \$0.15 | \$0.15 | —            | Serverless            |
| `fastino/gliner2-privacy-filter-PII-multi` | GLiNER2 Privacy Filter PII (Multi) | \$0.15 | \$0.15 | —            | Serverless            |
| `fastino/gliguard-PII-multi`               | GLiNER2-Guardrails-PII-Multi       | \$0.15 | \$0.15 | —            | Serverless            |

`fastino/gliner2-multi-v1` et `fastino/gliner2-multi-large-v1` sont des variantes multilingues adaptées aux textes non anglais.

## Modèles décodeurs — entraînement

Le fine-tuning LoRA via `POST /felix/training-jobs` est limité à la famille Nemotron 3.5 Lightning :

| Model ID                                            | Libellé                                   | Entraînement |
| :-------------------------------------------------- | :---------------------------------------- | :----------- |
| `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16` | Nemotron 3.5 Lightning 30B-A3B            | LoRA         |
| `fastino/Fastino-Nemotron-3.5-Lightning-Finance`    | Fastino Nemotron 3.5 Lightning Finance    | LoRA         |
| `fastino/Fastino-Nemotron-3.5-Lightning-Healthcare` | Fastino Nemotron 3.5 Lightning Healthcare | LoRA         |

Avec les cibles GLiNER entraînables du tableau ci-dessus, ce sont les seuls modèles de base pris en charge pour les nouvelles tâches d'entraînement. Interrogez `GET /base-models?supports_training=true` avant de soumettre une tâche : c'est la source de vérité en direct pour la disponibilité.

## Modèles décodeurs — inférence sans serveur

Voici les familles décodeurs pré-déployées prises en charge pour l'inférence. Interrogez `GET /base-models?supports_inference=true` pour la disponibilité, les limites de contexte et les tarifs en direct.

### Nemotron 3.5 Lightning

| Model ID                                            | Libellé                                   |
| --------------------------------------------------- | ----------------------------------------- |
| `nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16` | Nemotron 3.5 Lightning 30B-A3B            |
| `fastino/Fastino-Nemotron-3.5-Lightning-Finance`    | Fastino Nemotron 3.5 Lightning Finance    |
| `fastino/Fastino-Nemotron-3.5-Lightning-Healthcare` | Fastino Nemotron 3.5 Lightning Healthcare |

### Anthropic

| Model ID          | Libellé         |
| ----------------- | --------------- |
| `claude-opus-5`   | Claude Opus 5   |
| `claude-sonnet-5` | Claude Sonnet 5 |
| `claude-haiku-5`  | Claude Haiku 5  |

### OpenAI

| Model ID        | Libellé       |
| --------------- | ------------- |
| `gpt-5.5`       | GPT-5.5       |
| `gpt-5.6-luna`  | GPT-5.6 Luna  |
| `gpt-5.6-terra` | GPT-5.6 Terra |
| `gpt-5.6-sol`   | GPT-5.6 Sol   |

### DeepSeek

| Model ID                        | Libellé           |
| ------------------------------- | ----------------- |
| `deepseek-ai/DeepSeek-V4-Flash` | DeepSeek V4 Flash |

### Z.ai

| Model ID               | Libellé      |
| ---------------------- | ------------ |
| `zai-org/GLM-5.2`      | GLM 5.2      |
| `zai-org/GLM-5.2-Fast` | GLM 5.2 Fast |

<Note>
  Les modèles qui ne font pas partie de ces familles ne sont pas des cibles d'inférence prises en charge. Utilisez `GET /base-models` pour consulter le catalogue et l'état du cycle de vie en direct avant toute intégration.
</Note>

## Mise en cache des prompts

De nombreux modèles sans serveur facturent les tokens d'entrée mis en cache à tarif réduit, et certains fournisseurs facturent un surcoût unique pour écrire les tokens dans le cache. Pioneer relaie directement les tarifs de cache publiés par chaque fournisseur — ce sont les mêmes tarifs que `GET /base-models` renvoie sous `cache_read_price_per_million` et `cache_write_price_per_million`, et les mêmes tarifs que Pioneer vous facture.

Les tarifs de cache sont dérivés du tarif d'entrée de chaque modèle à l'aide des multiplicateurs ci-dessous. Lorsqu'un fournisseur n'a pas de ligne distincte pour l'écriture en cache, les écritures en cache sont facturées au tarif d'entrée standard.

| Fournisseur            | Lecture cache | Écriture cache                                    |
| ---------------------- | ------------- | ------------------------------------------------- |
| Anthropic (Claude)     | 0.1× entrée   | 1.25× entrée                                      |
| OpenAI (famille GPT-5) | 0.1× entrée   | tarif d'entrée (1.25× sur GPT-5.6 Luna/Sol/Terra) |

Interrogez le catalogue en direct pour les tarifs de cache exacts. Tout modèle sans réduction de cache explicite facture l'entrée mise en cache au tarif d'entrée standard.

Les tarifs de cache et les prix d'entrée peuvent évoluer ; consultez `GET /base-models` pour les valeurs actuelles.

## Inférence à la demande vs sans serveur

Pioneer propose deux façons de servir des prédictions, et le bon choix dépend de votre flux de travail.

L'inférence **sans serveur** utilise des endpoints de modèles de base pré-déployés. Il n'y a pas de délai de démarrage et vous êtes facturé par token. C'est idéal lorsque vous voulez appeler un modèle de pointe sans fine-tuning.

L'inférence **à la demande** provisionne un GPU dédié après la fin du fine-tuning. Votre adaptateur LoRA est chargé sur le GPU et servi exclusivement pour vos requêtes. Pioneer achemine automatiquement les appels d'inférence vers un déploiement à la demande lorsque vous passez un ID de tâche d'entraînement comme `model_id`.

## Interroger le catalogue en direct

Les tableaux ci-dessus peuvent être en retard par rapport aux modèles nouvellement ajoutés. Utilisez `GET /base-models` pour obtenir le catalogue actuel à l'exécution.

```bash theme={null}
# All models
curl https://api.pioneer.ai/base-models \
  -H "X-API-Key: YOUR_API_KEY"

# Only models that support inference
curl "https://api.pioneer.ai/base-models?supports_inference=true" \
  -H "X-API-Key: YOUR_API_KEY"

# Only models that support training
curl "https://api.pioneer.ai/base-models?supports_training=true" \
  -H "X-API-Key: YOUR_API_KEY"

# Filter by model family
curl "https://api.pioneer.ai/base-models?task_type=encoder" \
  -H "X-API-Key: YOUR_API_KEY"

curl "https://api.pioneer.ai/base-models?task_type=decoder" \
  -H "X-API-Key: YOUR_API_KEY"
```

Chaque entrée de la réponse inclut l'ID du modèle, son libellé d'affichage, la longueur de contexte, les tarifs par 1M de tokens (`input_price_per_million`, `output_price_per_million`, `cache_read_price_per_million`, `cache_write_price_per_million`), et les drapeaux booléens `supports_training` et `supports_inference`. Utilisez directement la valeur de l'ID de modèle dans les requêtes de tâches d'entraînement et les appels d'inférence.

Pour lister chaque modèle avec ses tarifs d'entrée, de sortie et de cache :

```bash theme={null}
curl -s "https://api.pioneer.ai/base-models?supports_inference=true" \
  -H "X-API-Key: YOUR_API_KEY" \
| jq -r '["model","input/M","output/M","cache_read/M","cache_write/M"],
    (.models[] | [.id, .input_price_per_million, .output_price_per_million,
      .cache_read_price_per_million, .cache_write_price_per_million]) | @tsv' \
| column -t -s $'\t'
```
