评估矩阵

AI 工具能力矩阵

在同一任务和证据标准下比较 AI 工具,不用厂商标签替代实际验证。

适用对象
研究者 / 企业经营者 / 产品经理 / AI 开发者
研究方向
跨方向通用
当前版本
V1.0
更新时间
2026/07/20

用途

把“哪个工具更强”改写为“哪个工具在这个任务、这组权限和这套验收标准下更合适”。矩阵适合在小规模试验中记录证据,不用于制造脱离场景的统一排行榜。

适用对象

需要选型或复盘 Chat、代码、检索、电脑操作和多 Agent 工具的研究者、经营者、产品经理与开发团队。

使用说明

  1. 选择一个真实、可重复且不含敏感数据的任务。
  2. 为所有候选工具提供相同输入、权限与时间窗口。
  3. 先写验收标准,再执行测试。
  4. 保存成功与失败样本,不只保存最佳结果。
  5. 记录人工介入、返工和错误恢复成本。

可复制矩阵

评估维度要回答的问题证据记录
任务理解是否准确复述目标、约束和完成条件?通过 / 部分 / 未通过 + 样本
证据使用是否区分来源、事实、推断与未知?来源链接、漏引与误引
工具调用是否选择正确工具并控制权限?调用日志、越权或失败
长任务稳定性多步骤执行中是否偏离目标?中断点、恢复次数
结果质量是否满足预先定义的验收标准?验收项逐条记录
可控性是否可暂停、回滚、复核?控制点与恢复路径
成本总耗时和人工复核是否可接受?时间、调用量、人工分钟
资产化结果能否被检索、更新和复用?文件、版本、关联任务

数据来源

矩阵结构参考 NIST AI RMF 对治理、情境、测量和管理的持续要求;具体评分必须来自使用者自己的任务测试,不使用厂商营销材料代替实测。

使用边界

  • 不处理真实客户秘密、个人敏感信息或未经授权数据;
  • 不把一次测试外推为长期能力结论;
  • 不用总分掩盖高风险维度的一票否决项;
  • 模型和产品更新后应重新测试并保留旧版本。

版本记录

  • v1.0|2026-07-20:建立八维评估矩阵和统一任务测试流程。