端点
列出过往推理
GET /inferences 返回过往推理调用的分页列表。使用下方的查询参数过滤结果。
查询参数
number
每页返回结果的最大数量。
number
在返回结果前跳过的结果数量。与
limit 搭配使用可对结果进行分页。string
按模型 ID 过滤。接受训练任务 ID 或基础模型 ID。
string
按任务类型过滤(例如
ner、classification、generate)。string
按项目 ID 过滤,只查看归属于特定项目的推理。
string
按训练任务 ID 过滤,只查看针对特定微调模型运行的推理。
number
最小端到端延迟,单位为毫秒(含端点值)。必须 >= 0。
number
最大端到端延迟,单位为毫秒(含端点值)。必须 >= 0;若两者都设置,则必须 >=
latency_min。number
最小 LLM-as-Judge 分数(含端点值),范围为
0.0–1.0。number
最大 LLM-as-Judge 分数(含端点值),范围为
0.0–1.0。若两者都设置,则必须 >= llmaj_score_min。string
created_at 的包含下界,为 ISO 8601 UTC 时间戳。string
created_at 的不包含上界,为 ISO 8601 UTC 时间戳。对于
latency_min/latency_max 和 llmaj_score_min/llmaj_score_max,如果 min 值大于对应的 max 值,都会返回 422。示例
获取推理详情
GET /inferences/:id 返回单条过往推理的完整记录,包括输入文本、schema、模型响应和时间戳。
提交反馈
POST /inferences/:id/feedback 允许您将一条过往推理标记为正确或不正确,并可选择附上更正后的输出。带有更正内容的“不正确”判定会被用作 Adaptive Inference 的标注训练样本。
在此提交的反馈会驱动 Adaptive Inference。这是 Pioneer 的持续改进闭环,会基于从线上流量收集到的更正自动重新训练您的模型。有关工作原理的详情,请参阅 Adaptive Inference 指南。
请求参数
string
必填
对该推理的人工判定:
correct 或 incorrect。object
预期输出,其形状与原推理的输出相同(例如,对 NER 推理提供更正后的
entities 列表)。当 verdict 为 incorrect 时必填;当 verdict 为 correct 时必须省略或为 null。发送不正确的组合会返回 422。string
可选的自由文本审阅者备注。最多 5000 个字符。
示例
string
被标注的推理。
string
已存储的判定。
string
反馈提交时间的 ISO 8601 时间戳。
获取反馈
GET /inferences/:id/feedback 返回之前针对特定推理提交的反馈。如果尚未提交任何反馈,则返回 404。
相关内容
- Pioneer 原生推理:运行新的推理
- Adaptive Inference 指南:基于线上流量的持续模型改进