如何创建数据集
您可以通过两种方式创建数据集: 合成数据生成 — 使用POST /generate,让 Pioneer 根据您对领域和关注标签的描述生成带标签的样例。这是在没有任何现成带标签数据的情况下最快速地启动数据集的方式。
POST /generate 还支持 NER 以外的任务类型。传入不同的 task_type 及其必填字段:
端点会立即返回
202 和一个 job_id,生成本身在后台异步执行。生成或打标签完成后,样例会自动存入您的数据集。在启动训练之前,请轮询 GET /generate/jobs/:job_id,直到 status 为 ready(若为 failed,请查看 error 字段)。
上传自己的数据集
上传自有数据:如果您已有带标签的数据,请使用POST/felix/datasets/upload/url。这是一个三步流程:
第 1 步:获取预签名上传 URL
dataset_name 是必填的。dataset_type 若省略默认为 "ner",可取值 "ner"、"classification"、"custom" 或 "decoder"(type 字段默认为 "training";"benchmark" 在此处会被拒绝,因为基准数据集由系统托管)。响应中包含 ‘presigned_url’、‘dataset_id’ 和 ‘version_number’。
第 2 步:将文件直接上传到 S3
第 3 步:触发处理
202,状态为 uploading;数据集随后在后台依次经过其余状态:initialized → uploading → converting → validating → ready
在启动训练任务之前,请轮询 GET /felix/datasets/{name}/{version},直到 status 为 ready(若为 failed,请查看 processing_error)。您也可以传入 latest 代替版本号,以始终获取最新版本。
列出您的数据集
获取账户中的所有数据集:failed 的数据集,若要一并查看,请传入 include_failed=true。
查看数据集
要查看某个数据集的版本和详细信息,传入其名称:删除数据集
pending/running 状态并使用该数据集,删除会被拒绝并返回 409 Conflict,直到该任务结束。删除成功后,已完成的训练任务和评估仍可查询,但您将无法再启动引用该数据集的新任务。
数据集存储是免费的。无论体积或版本数量多少,Pioneer 都不会就存储数据集向您收费。
数据集端点汇总
数据隐私: 如果您希望不让您的数据用于 Fastino 的模型训练,请发送邮件至 support@fastino.ai,我们将确保将您的数据排除在训练流水线之外。