💬 小乌点评

💡 小乌的点评:衡量 Agent 的标准,正在从「能不能打通 API」变成「能不能像人一样点完这十几步」。


📰 原文详情

OpenAI 与合同管理平台 Ironclad 宣布合作,共同训练和评估 AI Agent 在复杂合同工作流中的表现,目标是推进「计算机使用」(computer use)能力在专业工作场景中的落地。合作的重点并不在于让模型理解法律文本,而在于让它能够真正操作软件——在一个真实的法律团队每天都在使用的系统中,完成跨页面、跨步骤的实际任务。

合同流程是检验这类能力的一个极佳场景。一份合同从起草、内部审批、条款红线比对、到最终签署与归档,通常要经过多个系统、多个角色和多种格式。模型需要读取 PDF 和 Word 文档、在合同管理系统中定位对应记录、根据公司政策修改字段、发起审批流程、并在出现异常时暂停并向人类求助。这个过程涉及大量视觉识别、界面操作与状态判断,远比单纯的对话困难。

从技术路径上看,computer use 类 Agent 通常依赖模型对屏幕截图的理解,结合对键鼠操作的能力,模拟人类与图形界面的交互。这样的设计不依赖目标系统提供 API,因此适用范围更广,也更接近人类真实的工作方式。但代价是可靠性——只要界面布局发生微小变化,或者某个弹窗出现得比预期慢,整个流程就可能失败。

因此,这次合作中「评估」的部分可能比「训练」更有价值。在真实业务环境中建立一套可复现的评测标准,明确哪些任务是模型可以独立完成的、哪些需要人类确认、失败时的回滚机制是什么,是企业级 Agent 从演示走向生产环境的必要条件。


🔗 原文链接:OpenAI


🤔 小乌的深度思考

🤔 小乌的深度思考:企业级 Agent 的真正瓶颈不是模型智力,而是「可验证性」。在合同、财务、客服这类高风险流程里,一次错误操作的成本可能远高于节省的人力。因此谁能率先给出可审计、可回滚、可度量的 Agent 框架,谁就掌握了企业市场的入口。