对话无问芯穹CTO李伯勋:AI进入推理时代,优化即利润

原创来源:半导体产业纵横发布时间:2026-09-18 19:42
作者:立言
无问芯穹
AI叠变
生成海报
算力褪去硬件堆砌,Token 锚定 AI 产业价值。

北京五道口,无问芯穹的办公室离清华南门步行不到十分钟,周围聚集着智谱、面壁等一批AI公司。这家脱胎于清华大学电子工程系的AI基础设施公司,成立刚满三年。一个来自他们的数据值得关注:截至2026年7月底,无问芯穹Agentic MaaS平台的日均Token调用量比2025年底增长了40多倍,从1月底开始平均每两周翻一番。

近日半导体产业纵横对话无问芯穹CTO李伯勋,想要了解为什么AI产业的竞争焦点正在从芯片转向Token,他表示:“Token正在从一个技术计量单位变成一个真实的经济变量。”有人还在拼芯片,无问芯穹已经开始拼Token了。


01 技术即利润

过去几年,AI产业的竞争焦点一直很清晰:谁有更好的芯片、更大的模型。但无问芯穹CTO李伯勋观察到,这个逻辑正在发生根本性变化。他把AI的发展抽象成一个简单的公式:规模乘以效率,并进一步解读到“此前,行业聚焦于如何提升模型能力,彼时推理任务尚未起量,算力资源规模能够支撑需求。现在模型能力跃升,推理需求爆发,规模成为瓶颈,效率问题变得更加突出。”

国家数据局的数据印证了这个趋势。截至2026年3月,国内日均Token调用量已突破140万亿,比2025年底增长了40%以上。IDC预测2026年中国MaaS市场的Token消耗量将达到40000万亿。Token经济正在从概念走向现实。

这就解释了为什么“Token工厂”这个概念突然火了起来。在算力规模有限的情况下,谁能用更少的资源产出更多的Token,谁就能在成本上建立优势。无问芯穹过去一年通过全栈技术优化将推理成本下降了超过10倍。用李伯勋的话说,“你能把成本压到足够低,才能产生利润,技术即利润。”

无问芯穹提出的AI生产力公式:AI生产力=智能资源规模×Token转化效率×AI生产力转化效率,正是对这个逻辑的量化表达。在2026世界人工智能大会上,无问芯穹联合创始人、CEO夏立雪正式发布了“前店、后厂、一中心”的战略布局。三个落点清晰对应AI生产力公式的三个因子:算力集散中心解决智能资源规模最大化,目前已触达超37000P算力、覆盖16种主流芯片;Token工厂解决Token转化效率,实现推理成本10倍下降;AI生产力商店打通Token到产业价值的通道,在医疗、法律、能源、游戏等行业落地Infra解决方案。从芯片到Token,无问芯穹完成了产业逻辑的切换。

图片

02 从为人服务到为机器服务

如果说Token成本的下降是产业当前的主线,那么Agent带来的变化则指向更远的未来。当Agent进入真实生产环境,Token的消耗模式彻底变了。一个银行信贷审批场景,传统AI聊天消耗不到1万Token,Agent多轮工具调用后能飙到47万。消耗从“单次、短链路、可预测”变成“连续、长链路、不可预测”,传统云基础设施的设计前提被颠覆了。

李伯勋认为这背后是一个更深层的范式转移:“我们现在的计算机协议、编程语言,都是过去人为定义的,为了人能写、人能监督。但当AI发展足够强的时候,基础设施的定位要从为人服务,变成为机器服务。”无问芯穹提出的Agentic Infra正是为此而生:新一代专为智能体打造的基础设施。传统架构是为人类交互设计的,而Agent的消耗模式完全不同,底层架构必须跟着变。

我们也看到7月,无问芯穹发布了行业首创的跨集群异构PD分离架构(Prefill-RelayDecode-MainDecode,PDD),将传统“P-D”两级分离创新解构为“P-RLD-MD”三级分离式推理架构,能够将国产芯片的各自优势发挥出来,追求组合的最优解。实测显示,该架构实现首Token延迟降低51.5%,单Token生产成本下降37.5%。

至于Agent之后的下一个爆发点,李伯勋的判断是:“它在于能不能诞生新的生产力,并且带来新的生产价值。”他描绘了一个场景:未来可能APP都不存在了,来了一个新任务,模型直接现场写一个应用,跑完就结束了。表现形式不太确定,但生产力的爆发是确定的。产业界有一个大致的判断:从人类用户驱动,到人与智能体共存,再到智能体主导,全球Token需求量会沿着从人到机器的路径指数级跃迁。2027年之后,机器自主消耗的Token规模将远超人类。

03 在芯片的“巴别塔”上架桥

无问芯穹最早锚定的核心价值之一,可以用一个简单的公式概括:M种模型×N种芯片的高效协同。不同厂商的芯片接口不同、架构不同、标准不同,各说各的方言,且算力资源散落各地。无问芯穹做的事情,就是在这堆方言之间建一个同声传译,让不同芯片能听懂彼此,也让不同模型能高效地部署到不同硬件上。

2025年,无问芯穹在行业率先实现了基于多元异构芯片的大规模混合训练商用落地。完成全球首次“4+2”六种芯片(包括华为昇腾、天数智芯、沐曦、摩尔线程、AMD、英伟达)700亿参数大模型混合训练,千卡集群算力利用率最高达到97.6%。2026年,公司在跨域协同训练上进一步突破,联合中国电信完成国内首例超4000公里的大模型跨域通信训练,打通新疆哈密和广东深圳两地异构集群,联合训练性能提升165%。目前,无问芯穹的Agentic Infra自主式基础设施平台已触达37000P算力和16种芯片,新推出芯片适配时间缩短至2天,国产芯片适配成本降低70%以上。

无问芯穹做的事,本质上是在芯片和模型之间重新定义算力的组织方式。客户名单也在佐证这一点,平台已服务Kimi、智谱、百川智能、联想、理想汽车、中国移动等头部企业,模型精度对齐率超过99.9%,企业级高可用率达到99.95%。

04 清华底色与全栈思维

无问芯穹这支队伍,底色是清华。

公司发起人汪玉是清华大学电子工程系长聘教授,曾发起创立深鉴科技,后被全球最大的FPGA厂商赛灵思收购,具有丰富的科研创新、成果产业化经验。无问芯穹的创始团队也几乎全部来自清华电子系NICS-EFC实验室,包括CEO夏立雪、首席科学家戴国浩以及CTO李伯勋。汪玉此前曾表示:“指数级的需求和线性的供给之间差距越来越大,而且会越拉越大。这个优化目标必须靠合作,只有合作起来,才有可能把线性的供给能力往上抬。”在他看来,无问芯穹要做的事情不只是解决算力调度的问题,而是为数字世界和物理世界的所有智能运行构筑基础设施。

这种学术与产业的深度绑定,直接反映在无问芯穹的人才培养逻辑上。李伯勋本人就是清华电子系出身,对人才培养有切身体会。当被问到今天产业界最缺什么样的人时,他的回答很直接:“有全栈思维的人。”传统的计算机体系结构是分层解耦的:做指令集的人、做芯片设计的人、做算法的人,彼此之间交叉很少,通过标准协议和中间层配合。但AI对技术栈的深度要求完全不同。除了全栈能力,李伯勋还提到了另一个关键变化:AI正在改变电子信息类学生的能力结构。过去需要专精解决某一个核心问题,现在很多问题可以被AI解决。“AI放大了电子信息类同学宽口径和工程思维的价值,”他说,但新的挑战在于,学生是否能形成独立的能力闭环,是否能判断AI执行任务的方向,然后把它执行到闭环。无问芯穹本身就在尝试搭建从学术到产业的桥梁。他提到,无问芯穹很早就参与中国研究生电子设计竞赛并设置企业命题,把产业界看到的真问题提炼出来,让更多的学生能够参与进来,很多最有意思的想法、最先进的idea,都诞生于高校,所以一定要跟高校保持很好的互动。

图片

05 结语

97.6%的异构集群算力利用率、40倍增长的Token调用量、10倍推理成本优化……这一系列数字勾勒出的是无问芯穹在AI基础设施版图上的初步坐标。当算力竞赛的焦点从芯片转向系统、从硬件堆砌转向效率优化时,它已经在这个新战场的前排占据了一个位置。

但对无问芯穹而言,这还不是故事的全部。在中国,算力的议题从来不只是造出更好的芯片。这里有全球最复杂的异构算力格局,有华为昇腾、天数智芯、沐曦、摩尔线程、海光……有散落在各地亟需被唤醒的智算中心,也有全世界最丰富的AI应用场景。把这些碎片化的算力组织起来,让它们像水电一样被调度、被计量、被使用,这本身就是一个时代级的命题。当国产芯片开始在Infra平台上跑通大模型,当越来越多的开发者通过Token工厂按需调用模型能力,当年轻学子把产业真问题变成自己的课题,无问芯穹正在做的,不只是搭建一家公司的商业壁垒,而是在为中国的AI产业铺设一条从算力到生产力的通路。正如李伯勋所说:我们最大的理想之一,是让中国在未来的AI时代中,始终拥有全世界最先进的AI基础设施。

【AI叠变】第十七期:无问芯穹。2023年成立,总部坐落上海,发起人汪玉为清华大学电子工程系长聘教授,具备丰富的科研创新和产业化经验,创始团队均源自清华大学电子工程系。企业致力于以自主式人工智能基础设施底座,助力AI时代各行各业的智能革命。依托软硬协同、多元异构、自主式AI等核心技术优势,无问芯穹以核心产品Agentic Infra自主式基础设施平台与Agentic MaaS大模型服务平台,支持十万卡级的超大规模人工智能高效稳定训练、推理及强化学习等任务,正以数千亿级的日均Token调用量,服务千余家AI企业与科研机构,赋能大模型开发运行的全生命周期,持续输出高质量、大规模、高效率的AI生产力。

此内容为平台原创,著作权归平台所有。未经允许不得转载,如需转载请联系平台。

评论
暂无用户评论