Skip to main content
Pioneer 支持两大模型系列:编码器模型(GLiNER),用于结构化提取任务,如命名实体识别;解码器模型(LLM),用于文本生成、分类和开放式提示。下方表格是当前目录的快照——请使用 GET /base-models 查询实时列表,它始终反映当前的可用性和能力。 一些处于灰度阶段的模型受功能开关控制。它们仅在启用了对应灰度的工作区中出现在实时目录里。

编码器模型 (GLiNER)

GLiNER 模型执行命名实体识别和结构化提取。大多数 GLiNER 基础模型在训练后同时支持训练和按需推理。价格按每 1M tokens 计。 fastino/gliner2-multi-v1fastino/gliner2-multi-large-v1 是多语言变体,适用于非英语文本。

解码器模型 — 训练

通过 POST /felix/training-jobs 进行的 LoRA 微调仅限于 Nemotron 3.5 Lightning 系列: 加上上述可训练的 GLiNER2 Base、Large、Multi 和 Multi Large 编码器目标,这些是新训练任务唯一支持的基础模型。提交任务前请查询 GET /base-models?supports_training=true;它是可用性的实时来源。

解码器模型 — 无服务器推理

以下是受支持的预部署推理系列。请查询 GET /base-models?supports_inference=true 以获取实时可用性、上下文限制和定价。

Nemotron 3.5 Lightning

Anthropic

OpenAI

DeepSeek

Z.ai

这些系列之外的模型不是受支持的推理目标。集成前请使用 GET /base-models 查询实时目录和生命周期状态。

提示缓存

许多无服务器模型对缓存的输入 tokens 以折扣价计费,部分提供商会一次性额外收费用于将 tokens 写入缓存。Pioneer 直接透传每个提供商公布的缓存费率——这些与 GET /base-models 返回的 cache_read_price_per_millioncache_write_price_per_million 相同,也是 Pioneer 对您的计费费率。 缓存费率由每个模型的输入费率乘以下面的系数得出。若某提供商没有单独的缓存写入项,缓存写入按标准输入费率计费。 请查询实时目录以获取确切的缓存费率。任何没有显式缓存折扣的模型,其缓存输入均按标准输入费率计费。

按需与无服务器推理对比

Pioneer 提供两种服务预测的方式,选择哪种取决于您的工作流。 无服务器 (Serverless) 推理使用预先部署的基础模型端点。没有启动延迟,按 token 计费。这非常适合您希望调用前沿模型而无需微调的场景。 按需 (On-demand) 推理在微调完成后配置专用 GPU。您的 LoRA 适配器被加载到 GPU 上,专门为您的请求提供服务。当您将训练任务 ID 作为 model_id 传入时,Pioneer 会自动将推理调用路由到按需部署。

查询实时目录

上方表格可能落后于新增的模型。请使用 GET /base-models 在运行时获取当前目录。
响应中的每一条目都包含模型 ID、其显示标签、上下文长度、按每 1M tokens 计的费率(input_price_per_millionoutput_price_per_millioncache_read_price_per_millioncache_write_price_per_million),以及 supports_trainingsupports_inference 的布尔标志。请在训练任务请求和推理调用中直接使用模型 ID 值。 要列出每个模型及其输入、输出和缓存费率: