Skip to main content
Pioneer prend en charge deux familles de modèles : les modèles encodeurs (GLiNER) pour les tâches d’extraction structurée comme la reconnaissance d’entités nommées, et les modèles décodeurs (LLM) pour la génération de texte, la classification et le prompting ouvert. Les tableaux ci-dessous sont un instantané du catalogue actuel — utilisez GET /base-models pour interroger la liste en direct, qui reflète toujours la disponibilité et les capacités actuelles. Certains modèles en phase de déploiement sont soumis à des feature gates. Ils n’apparaissent dans le catalogue en direct que pour les espaces de travail où le déploiement correspondant est activé.

Modèles encodeurs (GLiNER)

Les modèles GLiNER effectuent la reconnaissance d’entités nommées et l’extraction structurée. La plupart des modèles de base GLiNER prennent en charge à la fois l’entraînement et l’inférence à la demande après entraînement. Les tarifs sont pour 1M de tokens. fastino/gliner2-multi-v1 et fastino/gliner2-multi-large-v1 sont des variantes multilingues adaptées aux textes non anglais.

Modèles décodeurs — entraînement

Le fine-tuning LoRA via POST /felix/training-jobs est limité à la famille Nemotron 3.5 Lightning : Avec les cibles GLiNER entraînables du tableau ci-dessus, ce sont les seuls modèles de base pris en charge pour les nouvelles tâches d’entraînement. Interrogez GET /base-models?supports_training=true avant de soumettre une tâche : c’est la source de vérité en direct pour la disponibilité.

Modèles décodeurs — inférence sans serveur

Voici les familles décodeurs pré-déployées prises en charge pour l’inférence. Interrogez GET /base-models?supports_inference=true pour la disponibilité, les limites de contexte et les tarifs en direct.

Nemotron 3.5 Lightning

Anthropic

OpenAI

DeepSeek

Z.ai

Les modèles qui ne font pas partie de ces familles ne sont pas des cibles d’inférence prises en charge. Utilisez GET /base-models pour consulter le catalogue et l’état du cycle de vie en direct avant toute intégration.

Mise en cache des prompts

De nombreux modèles sans serveur facturent les tokens d’entrée mis en cache à tarif réduit, et certains fournisseurs facturent un surcoût unique pour écrire les tokens dans le cache. Pioneer relaie directement les tarifs de cache publiés par chaque fournisseur — ce sont les mêmes tarifs que GET /base-models renvoie sous cache_read_price_per_million et cache_write_price_per_million, et les mêmes tarifs que Pioneer vous facture. Les tarifs de cache sont dérivés du tarif d’entrée de chaque modèle à l’aide des multiplicateurs ci-dessous. Lorsqu’un fournisseur n’a pas de ligne distincte pour l’écriture en cache, les écritures en cache sont facturées au tarif d’entrée standard. Interrogez le catalogue en direct pour les tarifs de cache exacts. Tout modèle sans réduction de cache explicite facture l’entrée mise en cache au tarif d’entrée standard. Les tarifs de cache et les prix d’entrée peuvent évoluer ; consultez GET /base-models pour les valeurs actuelles.

Inférence à la demande vs sans serveur

Pioneer propose deux façons de servir des prédictions, et le bon choix dépend de votre flux de travail. L’inférence sans serveur utilise des endpoints de modèles de base pré-déployés. Il n’y a pas de délai de démarrage et vous êtes facturé par token. C’est idéal lorsque vous voulez appeler un modèle de pointe sans fine-tuning. L’inférence à la demande provisionne un GPU dédié après la fin du fine-tuning. Votre adaptateur LoRA est chargé sur le GPU et servi exclusivement pour vos requêtes. Pioneer achemine automatiquement les appels d’inférence vers un déploiement à la demande lorsque vous passez un ID de tâche d’entraînement comme model_id.

Interroger le catalogue en direct

Les tableaux ci-dessus peuvent être en retard par rapport aux modèles nouvellement ajoutés. Utilisez GET /base-models pour obtenir le catalogue actuel à l’exécution.
Chaque entrée de la réponse inclut l’ID du modèle, son libellé d’affichage, la longueur de contexte, les tarifs par 1M de tokens (input_price_per_million, output_price_per_million, cache_read_price_per_million, cache_write_price_per_million), et les drapeaux booléens supports_training et supports_inference. Utilisez directement la valeur de l’ID de modèle dans les requêtes de tâches d’entraînement et les appels d’inférence. Pour lister chaque modèle avec ses tarifs d’entrée, de sortie et de cache :