17 款顶尖 AI Agent 参与量子工程测试 多数表现不佳差距悬殊
4 小时前
当下 AI Agent 已开始接入真实量子硬件操作场景,但仅靠单次正确结果不足以支撑其可靠运行,幻觉可能引发严重物理损失。针对这一痛点,相关团队提出验证自治概念,搭建带真实物理动态反馈的虚拟量子实验室 Quantum-Harbor,配套覆盖多维度量子工程任务的 QIQCBench 评测集,采用全新的证据绑定评分机制,核查 AI 结论的证据支撑性、资源使用合理性与结果物理鲁棒性。团队对 17 个主流顶尖 AI Agent 开展压力测试,结果显示不同模型表现差距极大,多数模型在资源约束、未知物理场景推断等场景下暴露诸多不可靠问题,仅头部模型展现出自主量子工程的可行性。目前相关虚拟实验环境与评测套件已开放,同步启动相关挑战赛,推动 AI 在精密科学领域的自主能力进一步进化。
体验专业版特色功能,拓展更丰富、更全面的相关内容。