据科技媒体MarkTechPost报道,AI数据平台Adaption Labs本周发布“Invent a Dataset”功能。该功能可根据一段模型行为描述直接生成结构化的、可训练的数据集,用户无需提供种子语料、预定义模式或标注指南。
该功能现已在Adaption应用中通过Python SDK和REST API上线。生成的记录可下载为JSONL、JSON、CSV或Parquet格式,作为可携带文件供用户在任何环境训练。生成过程在Adaption托管平台上运行并消耗积分,目前没有自托管生成路径。Adaption研究团队认为,大多数数据集工作流从已有数据开始,团队花费数周标注、过滤与重塑,这会限制模型质量;而该功能希望从行为本身入手,解决专用与专业任务中信号难以转化为训练集的问题。
技术上,调用datasets.invent即可创建数据集并异步启动生成,随后轮询datasets.get查看状态。领域代码是主要控制参数,可获取当前代码后指定medical等值,也可限定子领域如medical.symptoms_diagnosis。至少需要一个领域,多个领域可同时贡献数据。支持两种输出格式:默认的instruction_dataset生成提示-回答对用于监督微调;preference_pairs生成“选中/拒绝”对用于基于偏好的训练。estimate=True可在不创建、不扣费的情况下估算花费;prompt最多可输入10000字符,用于引导生成内容;idempotency_key最多255字符,使网络重试时返回原数据集而不重复启动生成。每次启动的行数受套餐上限限制。
语言扩展提供translate和localize两种模式。translate为每个目标语言生成新行变体,localize则为每个国家和语言对生成符合当地习惯的表述,而非直接翻译。用户可用sample_rate参数控制扩展比例,积分按扩展后的行数而非原始行数计费。不支持的代码会返回400错误并附上有效值示例。生成的数据库ID可直接传入autoscientist.create,与自动训练系统AutoScientist共同优化数据和训练配方。该报道援引Adaption的内部评估称,AutoScientist配置的训练效果比其研究团队自行配置平均高出35%,胜率从48%升至64%,评估覆盖八个垂直领域,数据集规模从5000行到10万行不等。
MarkTechPost的报道指出,AutoScientist于2026年5月上线,是Adaption“自适应数据”支柱中的训练端工具。此次的Invent a Dataset与之联动,形成了从用户意图到训练模型的闭环。详细技术参数可在其官方文档中查询。