AI 数据与 Benchmark
把需求整理成制作规范,明确材料、输出和验收要求;组织领域专家参与制作,跟进审核、返修和交付。
≈ $5M USD
约 500 万美元400+
专家招募、分层与任务协作6 个领域
匹配专业背景与任务需求01 / FOCUS
生产、评测和工具实践,
各自有不同的工作重点。
把需求整理成制作规范,明确材料、输出和验收要求;组织领域专家参与制作,跟进审核、返修和交付。
参与评测维度和评分规则设计,核对答案依据,分析错误样本。遇到争议时,回到材料和规则中查找原因。
借助 AI 做工具原型,整理任务记录与上下文,观察执行过程,测试工作流是否成立,并记录使用方法。
02 / WORK MATERIALS
任务怎么做、结果怎么判、修改怎么追溯。
这些材料也是协作与交付的依据。
01 / TASK SPECIFICATION
把需求写成制作人员能执行、审核人员能检查的任务。
检查重点制作和审核,能否沿着同一套说明执行。
02 / SCORING CRITERIA
把专业判断拆成可以逐项复核的要求,让每个评分点有据可查。
检查重点参考答案与评分规则一致,关键错误不能被总分掩盖。
03 / QUALITY REVIEW
记录问题落在哪里、为什么需要修改,以及复核后是否解决。
检查重点修正一个样本之后,也检查生产规则是否需要调整。
04 / VERSION & ACCEPTANCE
把任务、答案、评分规则和审核结论对应起来,避免混用版本。
检查重点输入或规则改变后,不直接沿用旧的审核结论。
05 / TOOL PROTOTYPE
借助 AI 把工作想法做成可试用的原型,再检查流程是否成立。
检查重点原型能运行之后,还要检查修改、恢复和交接。
06 / CONTEXT & DOCUMENTATION
留下背景、来源和已经做过的决定,让下一次工作能够接着做。
检查重点保留能支持下一步工作的上下文,避免重复从头整理。
按工作材料类型概括历史实践,未展示具体项目名称、客户资料或原始数据。
03 / DELIVERY METHOD
明确每个阶段该留下什么,
再检查能不能进入下一步。
工作流程示意,阶段可切换查看。
04 / BACKGROUND
Aiden Liu
我在美国东北大学完成化学本科学习。现在是 Commorai Pte. Ltd. 的联合创始人兼交付负责人,自 2025 年 9 月起参与 AI 数据交付与专家社区运营,曾搭建覆盖 6 个领域、400 余人的专家资源池。
除数据与评测工作外,我也在整理面向初学者的 Agent 使用经验,内容围绕工作区、任务拆解和工具选择展开。
05 / CONTACT
关于 AI 数据、评测,或 Agent 的实际使用。