评估矩阵
AI 工具能力矩阵
在同一任务和证据标准下比较 AI 工具,不用厂商标签替代实际验证。
- 适用对象
- 研究者 / 企业经营者 / 产品经理 / AI 开发者
- 研究方向
- 跨方向通用
- 当前版本
- V1.0
- 更新时间
- 2026/07/20
用途
把“哪个工具更强”改写为“哪个工具在这个任务、这组权限和这套验收标准下更合适”。矩阵适合在小规模试验中记录证据,不用于制造脱离场景的统一排行榜。
适用对象
需要选型或复盘 Chat、代码、检索、电脑操作和多 Agent 工具的研究者、经营者、产品经理与开发团队。
使用说明
- 选择一个真实、可重复且不含敏感数据的任务。
- 为所有候选工具提供相同输入、权限与时间窗口。
- 先写验收标准,再执行测试。
- 保存成功与失败样本,不只保存最佳结果。
- 记录人工介入、返工和错误恢复成本。
可复制矩阵
| 评估维度 | 要回答的问题 | 证据记录 |
|---|---|---|
| 任务理解 | 是否准确复述目标、约束和完成条件? | 通过 / 部分 / 未通过 + 样本 |
| 证据使用 | 是否区分来源、事实、推断与未知? | 来源链接、漏引与误引 |
| 工具调用 | 是否选择正确工具并控制权限? | 调用日志、越权或失败 |
| 长任务稳定性 | 多步骤执行中是否偏离目标? | 中断点、恢复次数 |
| 结果质量 | 是否满足预先定义的验收标准? | 验收项逐条记录 |
| 可控性 | 是否可暂停、回滚、复核? | 控制点与恢复路径 |
| 成本 | 总耗时和人工复核是否可接受? | 时间、调用量、人工分钟 |
| 资产化 | 结果能否被检索、更新和复用? | 文件、版本、关联任务 |
数据来源
矩阵结构参考 NIST AI RMF 对治理、情境、测量和管理的持续要求;具体评分必须来自使用者自己的任务测试,不使用厂商营销材料代替实测。
使用边界
- 不处理真实客户秘密、个人敏感信息或未经授权数据;
- 不把一次测试外推为长期能力结论;
- 不用总分掩盖高风险维度的一票否决项;
- 模型和产品更新后应重新测试并保留旧版本。
版本记录
- v1.0|2026-07-20:建立八维评估矩阵和统一任务测试流程。