智东西

作者 | ZeR0

编辑 | 漠影

智东西7月21日报道,7月20日,世界人工智能大会WAIC 2026期间,无问芯穹联合创始人兼CEO夏立雪提出,从Pre-training(预训练)到Post-training(后训练)、从Test-time(推理时扩展)到Agentic scaling(智能体扩展),在四条Scaling Law的作用下,模型训练和推理的超级市场正在互相孕育,当下的AI基础设施(AI Infra)“必须以极致的效率服务更大规模”。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

基于规模与效率两大锚点,夏立雪从无问芯穹的AI生产力公式(AI生产力 = 智能资源规模 × Token转化效率 × AI生产力转化效率)出发,首次公布无问芯穹Agentic Infra的“前店后厂一中心”战略布局,涵盖三大核心技术能力与产品服务体系:

“算力集散中心”:Agentic Infra自主式基础设施平台

“Token工厂”:Agentic MaaS大模型服务平台

“AI生产力商店”: Agentic Infra行业解决方案

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

这套Agentic Infra产品与服务体系立足基础设施,向下汇聚能源和芯片,向上支撑模型和应用,不仅极致提升底层资源向AI生产力转化的规模和效率,更有着Agentic AI时代的AI原生能力——用基础设施智能体蜂群赋能资源规模扩展、提效Token生产,并支持Agentic AI的持续进化。

一、Agentic Infra自主式基础设施平台,追求智能资源规模最大化

无问芯穹Agentic Infra自主式基础设施平台的核心目标,是实现智能资源规模最大化。它就像一座“算力集散中心”,把散落的、异构的算力资源统一汇聚、弹性调度、按需分发,为模型与应用层筑牢充足、稳定、可扩展的算力底座。

夏立雪认为:“算力的异质化、碎片化问题是全球性的,如何把不同的、跨区域的算力资源,高效聚合协同起来,是扩大智能资源规模的关键。”

无问芯穹自成立以来一直致力于通过“多元异构、软硬协同”技术破解异质算力聚合的难题,打造了面向异构集群的大模型跨域训练系统,并集成于Agentic Infra自主式基础设施平台软件中,通过计算通信重叠的流水编排、自适应的通信流调度和异构算力调度机制,三位一体全栈协同优化,能够系统性地破解算力聚合的行业难题。

该系统已经受过三大类跨域算力聚合训练实践的生产级考验:

第一是超远距离聚合。无问芯穹已联合中国电信,完成了国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间,实现联合训练性能提升165%,验证了超远距离跨域集群协同训练的可行性。

第二是多数据中心聚合。打通4个不同代际、不同型号的GPU集群,联合训练近百亿参数大模型,四集群协同性能提升41%,有效盘活了不同批次的存量异构算力。

第三是混合云算力聚合。实现本地私有集群与公有云算力的安全互通混训,整体性能提升68%,帮助众多企业客户解决本地算力不足、云上资源却闲置的错配痛点。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

目前这套跨域训练系统已在全国部署触达超37000P算力、覆盖16种主流芯片,盘活了广域分散的异质算力,使之成为Agentic AI时代的坚实底座。

当下,强化学习成为下一代AI进步的重要手段。但相较传统预训练,强化学习“多角色协同”的特性使其对硬件的种类需求更加复杂,规模量级也更加庞大,基于异构和超大算力规模的双重刚需,跨集群强化学习因此成为智能规模化及持续进化的新锚点,这也是无问芯穹Agentic Infra自主式基础设施平台重点布局与攻克的核心场景。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

该场景存在两大重要问题:一是跨集群之后,不同角色之间的等待时间将被拉长;二是当规模扩大到万卡级后,从显卡到服务器、网络、存储,故障将以小时级的频率存在,而重新拉起任务耗时长达数十分钟,任务难以持续稳定运行。

因此,针对跨域强化学习场景,无问芯穹把全栈协同的技术思路贯穿到底——从网络、平台到框架做一体式深度优化,打通分散的异构集群,实现全局资源一盘棋调度。

在此之上,无问芯穹进一步将优化渗透进全链路的每一个环节,尤其是在跨域通信和容错这两个层面:通过优化计算通信重叠技术,让跨域通信效率直接提升3-4倍,实现通信开销100%全掩盖,训练不再因跨域通信产生额外耗时损耗;同时搭建了故障无感的训练机制,成功实现了跨域强化学习训练连续一周0中断稳定运行。让大规模跨域强化学习不仅可以“跑得通”,还能“跑得快、跑得稳”。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

“这只是一个起点。”夏立雪谈道,伴随着大规模跨集群强化学习训练技术的持续成熟突破,无问芯穹还将持续深耕并行策略、通信融合、智能算子、极致容错等核心技术,“未来,我们能够将跨域计算资源的支撑规模,持续拓展至十万卡级以上,支撑下一代Agentic AI的在线进化。”

二、Agentic MaaS大模型服务平台,Token工厂以“效”搏大

Token经济时代,无问芯穹早在2023年初就提前布局的Agentic MaaS大模型服务平台,目前正在迎来高速且持续的增长曲线。该平台就像一座“Token工厂”,核心目标是用极致效率服务Token的规模化、高质量生产。

发布会现场,夏立雪用千卡至万卡规模下完整推理服务技术栈揭示了一座Token工厂内部的可优化空间,“从网关、路由,到底层推理实例,Token工厂层层可优化、处处有增量。”

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

随后,夏立雪披露了无问芯穹首创的新一代推理系统优化成果——跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode, PDD)

智能体推理需求的特征有“三极”:上下文极长、交互轮次极多、缓存命中率极高,对吞吐、时延、缓存复用的要求,远高于传统对话场景。

同时,从实测数据中能直观看到,不同芯片在Prefill、Decode阶段的性能差异极大。而眼下,这些散落在不同地区的存量集群几乎都是同构的,且几乎每个集群都“偏科”。

因此,该架构首先用高性价比的广域网以太网把分布在各地的、已经建好的同构数据中心连起来,让算力强的集群做Prefill任务,让显存带宽高的集群做Decode任务。

这一架构设计相当于让“偏科”的硬件只刷自己最擅长的题,可以极大提升大模型推理系统效率,是每座Token工厂都必备的“超级管线”。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

然而,基于以太网的KV Cache跨集群传输,存在带宽和延迟瓶颈,这根“超级管线”既要能扛住智能体业务的巨大“流量”,也要能跟得上用户对“流速”的极致要求。

基于Agentic MaaS线上业务长期的大规模实践积淀,无问芯穹推理团队首先把为了Decode实例重复前缀存储去重而设计的Decode Radix Cache技术,创新性地迁移至跨集群异构PD分离架构之中,实现跨集群KV Cache传输数据量降低一个数量级, 让“流量过载”的难题迎刃而解。

其次,更大的挑战在于“流速”——智能体的响应速度,是最直观的产品体验底线。

PDD将传统的PD分离链路“P-D”创新解构为“P-RLD-MD”的三级分离式推理架构,就像是为这条“超级管线”加装了一个“精密增压阀”。

对于高传输延迟的请求,RelayDecode先行输出Token给用户,从而让用户侧完全感受不到这一实际上长达数十秒的传输延迟;当传输完成后,输Token给用户的任务被无缝切换给MainDecode来处理,避免了RelayDecode被长期占用。

通过这一设计,仅需极少量机器承担RelayDecode ,就能掩盖以太网KV Cache传输延迟。

实测显示,该架构在实现了首Token延迟(TTFT)降低51.5%的同时,单Token成本可降低37.5%。这不仅意味着用户端速度体验的显著提升,更意味着,每一个集群都能被充分利用起来,最大化释放全域异构算力的产业应用价值。

过去一年里,无问芯穹的Token工厂已通过一系列原始技术创新,推动了推理成本的大降90%。夏立雪判断,随着跨集群异构PD分离架构的规模化落地,推理成本依然有10倍的下降空间。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

“目前无问芯穹的Agentic MaaS大模型服务平台的增长飞轮已经全面转起来了!”夏立雪说。

技术迭代驱动成本下降,业务规模加速技术创新。通过与Kimi、智谱、Minimax、阶跃星辰等头部大模型企业的密切合作,无问芯穹在真实业务场景中持续打磨、积累了大量优化经验。

截至7月,其平台单日Token调用量较去年12月,已实现了40倍的爆发增长,而海量业务经验又能反哺技术快速迭代,催动平台性能与可靠性的同步跃升,形成“业务带技术,技术提效率,效率促增长”的正向循环。

夏立雪总结:“6月的GTC 上,黄仁勋展示了英伟达的 ‘算力即收入’曲线。无问芯穹的Token工厂,则希望用这个‘优化即利润’的增长飞轮,向推理时代交出Token效率的答卷。”

无问芯穹已携手上海移动联合打造了 “沪芯沪产服务沪客”的“天问”模型服务门户,也与AI原生新世代社区“观猹”联合打造了“中国版OpenRouter” TokenDance(词元跳动) 平台。

未来,无问芯穹将持续携手优秀的行业伙伴,以这套高效的“Token工厂”赋能更多产业领域、服务更广泛客用户。

三、Agentic Infra行业解决方案,把Token转化成实际AI生产力

依托“算力集散中心”与“Token工厂”,无问芯穹可以将计算资源高效转换成高质量Token。

然而相同的业务效果,基于不同的推理路径、模型规模和芯片,Token的成本天差地别,深度影响其在真实生产环境中的商业化潜力。

为此,无问芯穹正通过Agentic Infra行业解决方案,携手多行业伙伴把Token高效转化为产业真正认可的高质量AI生产力,它就像一个“AI生产力商店”,持续赋能千行百业降本提效。

现场,夏立雪带来了覆盖文娱游戏、医疗健康、法律终端、能源电力等多个垂直行业的 Agentic Infra 行业解决方案。

在文娱游戏场景,无问芯穹联手VAST的Tripo 3D大模型联合打造了AGENTIC 3D GAME GEN解决方案,把分散的创意输入转化为可执行、可比较、可细化的3D模型输出,高效释放游戏内容生产力。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

在医疗健康场景,无问芯穹服务上海瑞金医院算力及模型管理,助力医疗大模型及智能应用在运营管理、临床诊疗辅助、医学教育培训等场景的探索落地。

在法律终端场景,无问芯穹打造律师事务所专属AI合伙人——”律盾芯人“,与“段和段律师事务所、君合律师事务所、竞天公诚律师事务所、通商律师事务所”等行业私有化AI终端合作伙伴,以及“法义经纬、图灵法思”等生态合作伙伴一起,共同推动法律行业的智能化安全升级。

在能源电力场景,无问芯穹也正与南网能源一起深度探索基于智能体技术的智算中心能耗智能预测与协同调度解决方案。

基础设施自己本身也是个行业,无问芯穹已经在这个行业深耕多年,既积累了丰富的实践经验与技术,也拥有足够多的应用场景与需求。

因此在支撑千行百业智能升级的另一面,无问芯穹也持续将智能体的能力应用到AI Infra本身,打造了一套基础设施智能体蜂群。

遵循“用智能体赋能基础设施,提升计算规模和智能效率”的核心目标,无问芯穹基础设施智能体蜂群目前已包含三个子集,对应在AI生产力转化、智能资源规模、Token生产效率的三方面:面向用户的平台管家智能体系统、面向集群的运维智能体系统、以及面向芯片的算子生成智能体系统。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

夏立雪提到:“我们不仅用Agent赋能资源规模扩展、提效Token生产,更致力于以Agent能力驱动整套AI Infra形成自主迭代、自我优化的闭环,让基础设施越用越强。”

平台管家智能体系统是整个基础设施智能体蜂群协同场景下的全局统筹者与用户入口,它有效降低了用户驾驭复杂系统的学习成本,通过自然语言交互,就能让智能体主动帮助用户操作平台、统筹AI基座,轻松高效完成复杂的资源运营、管理和答疑排障等工作,能够独立解决80%日常问题,剩下20%深度问题再转交对应垂类Agent。

智算集群运维智能体系统是一个能够端到端地解决实际生产场景中的运维难题的7×24小时全天候值守的“运维专家团”,系统以运维主智能体为核心大脑,与故障排查智能体、环境部署智能体、故障处理智能体等协作运行,不仅可以完整执行一个集群的告警自动闭环处置任务,还能够“防患于未然”地规划周期性巡检任务,提前识别潜在隐患。让智算集群的运维从“人找问题”转变为“问题找人”和“问题自己解决”。

经过大规模生产环境验证,这套系统的价值正在逐渐凸显:可实现运维人效提升5倍以上,关键故障处理效率提升6倍,不仅为大规模GPU训练与推理业务提供了更加稳定、高效的基础设施保障,也让运维人力能够被真正解放出来,聚焦更有价值的技术创新。

算子,是释放AI硬件性能的最后一公里,同时也是拉开基础设施效率差距的关键变量。

目前,大模型已经能够快速产出算子,但“能跑通”不等于“能用好” —— 要在生产环境中实现性能超越成熟推理引擎、达到工业级落地标准,难度依然极大。

无问芯穹高性能算子生成智能体系统KernelMind,以算子生成主控智能体为调度中枢,联动多类专用智能体,通过 “需求分析 — 智能调度 — 内核生成 — 沙箱验证 — 评审沉淀”五步闭环工作流,可在真实编译试错与知识沉淀中持续自迭代,稳定交付可直接落地的高质量工业级算子。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

在GLM-5.2模型的实测中,对比行业基线该系统在NVIDIA旗舰卡中实现了端到端7.3%的性能提升,在AMD旗舰卡中更是带来了39%的整体性能跃升,GEMM、Attention、Router等各类核心算子性能均实现全面超越。

早在2025年,无问芯穹就已经在业内率先提出了Agentic Infra的范式变革。

如今,Agentic Infra支撑智能体规模化运行与持续进化的产业价值正在被不断验证。从概念到落地,无问芯穹始终坚持以硬核技术推动Agentic Infra走向真实业务场景。

夏立雪提到:“我们的愿景始终清晰而坚定:通过Agentic Infra,实现 ‘用智能进化智能,用生产力加速生产力’ 。”

四、One More Thing:迈向物理世界

演讲最后,夏立雪将视野从云端的数字世界延伸至真实的物理世界。他提出:“在物理世界中,具身智能的Scaling Law同样需要高效率、大规模的基础设施支持。”

现场,无问芯穹公布了在具身智能领域的全新探索——首个面向大规模具身任务的云边端一体化管理与调度平台

该平台首次把云端GPU集群、边缘算力节点和机器人真机设备统一接入到一个平台中,支持训练、数据采集、评测和真机执行等多种具身任务统一编排运行,有效解决了具身训练中资源分散、跨集群协同困难、任务角色复杂、真机状态不可见、启动链路长的问题。

同时,针对具身智能的训练与推理部署两大核心环节,夏立雪宣布了无问芯穹两项重磅技术升级:面向具身智能的大规模真机强化学习训练框架 RLinf V0.3,以及面向机器人与端侧AI场景的全栈的推理优化体系 Mizar-Robo

RLinf在V0.1版本中实现了在仿真环境下渲训推一体化的强化学习;在 V0.2版本中实现了像管理GPU一样管理真机设备;而V0.3版本的升级则新增支撑具身智能大规模真机、跨域端云协同的强化学习训练,支持具身智能的持续进化。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

从实验室到产业,无问芯穹也与智元、清华大学携手深度探索了真机强化学习训练的技术与实践,攻克阻碍真机强化学习训练大规模落地的核心痛点与难点。

通过首创的HotSwarm与端云协同训练模式,RLinf V0.3可以支持真机设备1000+次在线上下线,训练0中断,并成功实现近百台真机规模专线需求降至2Gbps以下,大幅拉低具身智能规模化训练的成本门槛。

Mizar-Robo则依托流水线调度、算子内核、量化压缩、计算图四层协同优化,全方位释放端侧硬件潜力,大幅提升具身模型的部署效率,让具身智能即便在低功耗硬件上,也能实现连贯流畅、低延迟、长续航的高精动作交互。

无问芯穹在WAIC发布“前店后厂一中心”Agentic Infra战略,用AI提效Token生产

在无问芯穹与自变量机器人WALL-OSS系列模型的联合优化部署中,在保持WALL-OSS原有任务成功率的前提下,实现了7.14倍的推理性能提升,经Thor平台实测,端侧推理时延从500ms压缩至70ms,降幅达86%,不仅保障了实时交互的流畅度与稳定性,也有效延长作业续航。

结语:锚定“规模与效率”两大支点,为AI生产力运行构筑基础设施

“让智能无所不能,是AGI,而让智能无处不在,是AGI Infra。”夏立雪在发布会尾声中说道,“AI无疑是目前世界上发展变化最快的行业,但我们的初心从未改变,就是做AGI时代最需要的AI Infra。”

从“算力集散中心”做大资源总盘,到“Token工厂”深挖效率红利,再到“AI生产力商店”循环造血向产业输出价值,乃至向物理世界AI的探索与实践,无问芯穹始终锚定“规模与效率” 两大支点稳步向前。

“前店后厂一中心”的Agentic Infra体系 ,既是无问芯穹积淀多年的战略蓝图系统性落地,也代表着无问芯穹锚定AGI时代的长期方向:为未来数字与物理世界的所有AI生产力的运行构筑基础设施。

本文转自:凤凰网科技

原文地址: https://tech.ifeng.com/c/8uwv0WEuivp