模型越来越多,入口却不一定越来越好用。

7月29日,Agnes AI正式启用全新国内官网域名:https://file.tonglife.net/images/b3/094327e7f1f0204775054049f8a9fd.jpg

同一时间,API访问入口完成换挡,Agnes 2.5 Pro Alpha杀入Artificial Analysis综合能力榜单前列,2.5 Flash继续不限期免费开放。

一场围绕模型能力、开发者入口和多模态落地的抢位战,已经打响。

国内访问入口升级

API服务同步调整

随着AI应用生态不断扩大,模型服务的稳定访问和开发体验成为开发者关注的重要环节。

此次Agnes国内官网上线,是其进一步完善国内用户服务体系的重要一步。为了配合国内访问入口调整,Agnes还同步提供了新的API服务地址。

原国际站注册用户无需前往国内站重新注册,也无需更换原有API Key。

中国大陆用户如需继续使用原国际站账户及原有API Key,只需将原接口 Endpoint修改为以下地址,由

除了API地址,原有的API Key、模型名称、请求参数和调用方式均无需修改。完成地址替换后,根据运行环境重新启动应用或服务即可。

API平台:https://file.tonglife.net/images/87/bab545bbcbe724e88dec09dbc052f1.jpg

Artificial Analysis测试中

Agnes 2.5 Pro Alpha进入综合能力榜单前列

伴随国内官网上线,Agnes-2.5-Pro Alpha在Artificial Analysis上的首轮评测成绩也正式公布。

根据Artificial Analysis公开榜单,模型在综合智能、Coding和终端任务相关指标表现较为突出。

Agnes 2.5 Pro Alpha的Intelligence Index得分为39,在153个参评模型中排名第9。

该指数综合了真实职业任务、Agent工具使用、终端Coding、科学编程、复杂推理和长上下文等多个维度,更接近模型在实际工作环境中的综合表现,而非单一知识问答能力。

Coding Index得分为58.8,Terminal-Bench v2.1得分为67.0%。

榜单链接:https://file.tonglife.net/images/44/d6cc9625c69b39381c1dd413be3225.jpg

其中,Terminal-Bench v2.1要求模型进入真实终端环境,执行命令、读取和修改文件,并完成软件工程与系统任务,与当前AI Coding Agent的实际使用方式高度接近。

Flash 免费开放

Pro面向复杂开发场景

跑分之外,Agnes-2.5系列的定位也更加清晰。

Agnes 2.5 Flash面向日常Coding、Agent和高频开发任务,适合处理文档、生成代码、修复Bug和修改项目,更关键的是,Agnes 2.5 Flash将继续不限期免费开放。

这意味着大量日常开发需求,可以继续通过Agnes的模型完成,而不必先被成本门槛拦住。

而Agnes 2.5 Pro Alpha,则定位更高复杂度场景。作为Pro系列的早期版本,它已具备旗舰模型的核心能力方向,瞄准的是复杂Agent、专业Coding 和高难度工程任务。

相比Flash,Pro Alpha更强调复杂问题的理解与推理、长链路任务执行、大型项目协作,以及复杂代码分析和工程开发。

同时,Agnes 2.5 Pro Alpha支持1M超长上下文窗口,可以处理更大规模的代码仓库和业务资料。

两个任务

从互动游戏到单文件网页工具

为了观察Agnes-2.5-Pro Alpha在实际开发任务中的表现,我们设置了两个测试,第一个测试考验的是内容生成和交互组织,第二个测试则更偏具体的算法与工具开发。

第一个任务,是让Agnes 2.5 Pro Alpha生成一个文字剧情互动游戏网页。

提示词没有提供完整剧本,也没有详细规定人物、剧情和技术结构,只要求模型参考文字互动游戏的常见玩法,自行设计故事与交互。

为了快速验证玩法,人物形象和视频素材暂时只预留位置,优先完成能够运行的游戏原型,后续再逐步补充正式美术资源。

在这条相对宽泛的需求下,Agnes-2.5-Pro Alpha补充了故事主题、人物设定、场景安排、视觉小说界面、属性系统、剧情分支和结局页面,并将这些模块整合成一个可以直接在浏览器中运行的网页原型。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8v9wZcXmW3u