GET /base-models 查询实时列表,它始终反映当前的可用性和能力。
一些处于灰度阶段的模型受功能开关控制。它们仅在启用了对应灰度的工作区中出现在实时目录里。
编码器模型 (GLiNER)
GLiNER 模型执行命名实体识别和结构化提取。大多数 GLiNER 基础模型在训练后同时支持训练和按需推理。价格按每 1M tokens 计。fastino/gliner2-multi-v1 和 fastino/gliner2-multi-large-v1 是多语言变体,适用于非英语文本。
解码器模型 — 训练
通过POST /felix/training-jobs 进行的 LoRA 微调仅限于 Nemotron 3.5 Lightning 系列:
加上上述可训练的 GLiNER2 Base、Large、Multi 和 Multi Large 编码器目标,这些是新训练任务唯一支持的基础模型。提交任务前请查询
GET /base-models?supports_training=true;它是可用性的实时来源。
解码器模型 — 无服务器推理
以下是受支持的预部署推理系列。请查询GET /base-models?supports_inference=true 以获取实时可用性、上下文限制和定价。
Nemotron 3.5 Lightning
Anthropic
OpenAI
DeepSeek
Z.ai
这些系列之外的模型不是受支持的推理目标。集成前请使用
GET /base-models 查询实时目录和生命周期状态。提示缓存
许多无服务器模型对缓存的输入 tokens 以折扣价计费,部分提供商会一次性额外收费用于将 tokens 写入缓存。Pioneer 直接透传每个提供商公布的缓存费率——这些与GET /base-models 返回的 cache_read_price_per_million 和 cache_write_price_per_million 相同,也是 Pioneer 对您的计费费率。
缓存费率由每个模型的输入费率乘以下面的系数得出。若某提供商没有单独的缓存写入项,缓存写入按标准输入费率计费。
请查询实时目录以获取确切的缓存费率。任何没有显式缓存折扣的模型,其缓存输入均按标准输入费率计费。
按需与无服务器推理对比
Pioneer 提供两种服务预测的方式,选择哪种取决于您的工作流。 无服务器 (Serverless) 推理使用预先部署的基础模型端点。没有启动延迟,按 token 计费。这非常适合您希望调用前沿模型而无需微调的场景。 按需 (On-demand) 推理在微调完成后配置专用 GPU。您的 LoRA 适配器被加载到 GPU 上,专门为您的请求提供服务。当您将训练任务 ID 作为model_id 传入时,Pioneer 会自动将推理调用路由到按需部署。
查询实时目录
上方表格可能落后于新增的模型。请使用GET /base-models 在运行时获取当前目录。
input_price_per_million、output_price_per_million、cache_read_price_per_million、cache_write_price_per_million),以及 supports_training 和 supports_inference 的布尔标志。请在训练任务请求和推理调用中直接使用模型 ID 值。
要列出每个模型及其输入、输出和缓存费率: