如何选择Agent Harness?南洋理工大学新研究提供指导
在开发Agent应用时,选择合适的Harness常常令人困惑。不同的Harness会影响工具调用、上下文管理和错误恢复,导致模型的实际表现存在显著差异。有些Harness在特定任务上表现优异,但在其他任务中未必合适。因此,怎样针对不同任务选择合适的Harness?是否存在一种通用的解决方案能够适配多种任务?来自新加坡南洋理工大学的安波教授团队在其研究报告《Finding the Right Fit: Model–Harness Interactions across Agent Tasks》中深入探讨了这些问题。
该报告不仅仅是对Harness的简单排行,而是将模型与Harness看作一个整体进行比较。研究使用了四种可配置的Harness:OpenHands、DSH、PI和openJiuwen,并将其与Codex–GPT和Claude Code–Claude这两组原生搭配进行了对照。研究得出一个重要的结论:Harness的表现并非固定,具体效果取决于它与模型和任务的结合。与其寻求一种普适的Harness,更应关注特定任务,以便对模型与Harness进行联合评估。
为了评估Harness对Agent表现的影响,研究选择了四种可配置的Harness,并对接入多个型号的模型进行实验。这种交叉设计不仅能展示同一模型在不同Harness下的表现变化,还能比较相同Harness在不同模型和任务下的稳定性。此外,实验涉及三个不同任务集:TUA-Bench、ALE-CLI和Terminal-Bench 4,并根据任务集的构成与评分标准分别进行了对比分析,最终形成包含66项结果的比较矩阵。 乐玩国际官网
在实验配置和数据方面,使用的Harness均通过OpenRouter来调用模型,并保持其他设置的默认值。为确保不同组合的计分方式统一,研究对任务集采用了固定的分母,使得比较结果更具可比性。在整个实验中,涉及四种可配置Harness及两个原生Harness,涵盖多个模型与不同任务集,为Harness选择提供了系统的依据。