智能客服
你问我答,随时在线为你解决问题
当前Coding Agent领域已形成多款主流标准化评测基准,通用软件工程场景主要采用 SWE‑Bench、LiveCodeBench等评测集开展能力验证;移动端与前端开发方向,现有评测以 Android Bench、SWE‑Bench Mobile 为代表,重点针对移动应用开发、前端工程化等专项场景进行代码智能体能力测试。但面向以ArkTS语言为主要语言的鸿蒙应用开发评测基准依旧缺失,难以精准衡量Coding Agent在鸿蒙原生开发环境下的实际适配与工程落地能力。针对上述研究现状,本章节提供了多种应用开发场景下的鸿蒙基准评测集。
本章节对比分析了开源OpenCode与DevEco Code配合多种主流大模型在鸿蒙基准评测集的表现,结合过程指标与结果指标综合研判各类智能体在鸿蒙ArkTS开发场景下的综合性能。下文将依次从实验方案、数据集构建、评测指标及评测结果分析展开详细阐述。
