GET /base-models pour interroger la liste en direct, qui reflète toujours la disponibilité et les capacités actuelles.
Certains modèles en phase de déploiement sont soumis à des feature gates. Ils n’apparaissent dans le catalogue en direct que pour les espaces de travail où le déploiement correspondant est activé.
Modèles encodeurs (GLiNER)
Les modèles GLiNER effectuent la reconnaissance d’entités nommées et l’extraction structurée. La plupart des modèles de base GLiNER prennent en charge à la fois l’entraînement et l’inférence à la demande après entraînement. Les tarifs sont pour 1M de tokens.fastino/gliner2-multi-v1 et fastino/gliner2-multi-large-v1 sont des variantes multilingues adaptées aux textes non anglais.
Modèles décodeurs — entraînement
Le fine-tuning LoRA viaPOST /felix/training-jobs est limité à la famille Nemotron 3.5 Lightning :
Avec les cibles GLiNER entraînables du tableau ci-dessus, ce sont les seuls modèles de base pris en charge pour les nouvelles tâches d’entraînement. Interrogez
GET /base-models?supports_training=true avant de soumettre une tâche : c’est la source de vérité en direct pour la disponibilité.
Modèles décodeurs — inférence sans serveur
Voici les familles décodeurs pré-déployées prises en charge pour l’inférence. InterrogezGET /base-models?supports_inference=true pour la disponibilité, les limites de contexte et les tarifs en direct.
Nemotron 3.5 Lightning
Anthropic
OpenAI
DeepSeek
Z.ai
Les modèles qui ne font pas partie de ces familles ne sont pas des cibles d’inférence prises en charge. Utilisez
GET /base-models pour consulter le catalogue et l’état du cycle de vie en direct avant toute intégration.Mise en cache des prompts
De nombreux modèles sans serveur facturent les tokens d’entrée mis en cache à tarif réduit, et certains fournisseurs facturent un surcoût unique pour écrire les tokens dans le cache. Pioneer relaie directement les tarifs de cache publiés par chaque fournisseur — ce sont les mêmes tarifs queGET /base-models renvoie sous cache_read_price_per_million et cache_write_price_per_million, et les mêmes tarifs que Pioneer vous facture.
Les tarifs de cache sont dérivés du tarif d’entrée de chaque modèle à l’aide des multiplicateurs ci-dessous. Lorsqu’un fournisseur n’a pas de ligne distincte pour l’écriture en cache, les écritures en cache sont facturées au tarif d’entrée standard.
Interrogez le catalogue en direct pour les tarifs de cache exacts. Tout modèle sans réduction de cache explicite facture l’entrée mise en cache au tarif d’entrée standard.
Les tarifs de cache et les prix d’entrée peuvent évoluer ; consultez
GET /base-models pour les valeurs actuelles.
Inférence à la demande vs sans serveur
Pioneer propose deux façons de servir des prédictions, et le bon choix dépend de votre flux de travail. L’inférence sans serveur utilise des endpoints de modèles de base pré-déployés. Il n’y a pas de délai de démarrage et vous êtes facturé par token. C’est idéal lorsque vous voulez appeler un modèle de pointe sans fine-tuning. L’inférence à la demande provisionne un GPU dédié après la fin du fine-tuning. Votre adaptateur LoRA est chargé sur le GPU et servi exclusivement pour vos requêtes. Pioneer achemine automatiquement les appels d’inférence vers un déploiement à la demande lorsque vous passez un ID de tâche d’entraînement commemodel_id.
Interroger le catalogue en direct
Les tableaux ci-dessus peuvent être en retard par rapport aux modèles nouvellement ajoutés. UtilisezGET /base-models pour obtenir le catalogue actuel à l’exécution.
input_price_per_million, output_price_per_million, cache_read_price_per_million, cache_write_price_per_million), et les drapeaux booléens supports_training et supports_inference. Utilisez directement la valeur de l’ID de modèle dans les requêtes de tâches d’entraînement et les appels d’inférence.
Pour lister chaque modèle avec ses tarifs d’entrée, de sortie et de cache :