随着企业超越简单的聊天机器人,代理式人工智能(能够执行端到端业务任务的软件)的集成需要一个稳健的企业环境。根据进行了数千次工作负载实验的 Intel 的说法,这些系统必须优先考虑可靠的规划、数据访问和可扩展的基础设施,而不是仅仅关注推理能力。

Intel 的研究强调,代理式人工智能从根本上是一个系统工程挑战。为了有效地管理这些工作负载,该公司建议企业不再仅仅监控平均 CPU 利用率。相反,他们应该关注任务延迟,特别是 P95 指标,以识别由代理任务的“突发性”所导致的性能瓶颈。此外,该公司建议通过“代理密度”(即每个虚拟 CPU 的代理数量)而不是代理总数来标准化容量,从而允许在不同的硬件配置下进行更精确的扩展。

这些发现强调了“横向扩展”方法作为大多数企业部署的默认策略,因为它支持高可用性和成本效益。相比之下,纵向扩展应保留用于涉及繁重并行计算需求或内存限制的特定场景。

Advertisement

为了评估这些系统,Intel 主张采用一套比模型性能更广泛的指标,包括任务成功率、吞吐量和单任务成本。该公司利用开源基准测试工具 Terminal-Bench 的扩展版本进行了研究,采用了确定性的记录-重放技术,将代理性能与大语言模型在各种任务(包括数据库操作、机器学习训练和视频转码)中的变异性隔离开来。

最终,Intel 建议最成功的企业实施方案将专注于利用既定规则和可衡量服务水平来自动化工作流程,例如工单分类、安全审查和代码创建。

来源:麻省理工科技评论