曦望董事长徐冰:为新数字生命造房子,Token经济迎来机会

潮新闻 记者 王静

数贸会前夜,一场无人机灯光秀在钱塘江畔上演。光影以“新八骏”为意象,勾勒出骏马轮廓,“曦望”跃然马背。

“本质上是在为新的数字生命造房子,它们持续运行催生的海量算力需求,将带来人类历史上前所未有的机遇。” 曦望Sunrise董事长徐冰表示:“我们专注推理,从Agent的原生需求出发,我们重新定义了一颗为Token生产而生的芯片,希望把生产Token的成本大幅降下来。”

9月23日-27日,第五届全球数字贸易博览会在杭州正式举办。本届展会主题为“在数贸会遇见AI未来”,集中展示从算力芯片、大模型到具身智能的全产业链创新生态,吸引超2000家企业参展。在“数字贸易与人工智能对话”上,徐冰解读智能体浪潮下算力需求的全新变局,分享一线产业洞察。

从人到Agent,Token经济迎来新机会

“Token经济正迎来一个拐点,”徐冰说,“Token消耗结构发生根本性变化,人类不再是消耗Token的主力。”真正的消耗主力,正在数字世界和物理世界成形。

仅在数字世界里,同等任务下,Agent(智能体)完成一条人类指令所消耗的Token数量,已达人类的百倍乃至千倍级别。当具身智能的模型能力突破边界,作为物理世界的Agent,将7*24小时不间断烧Token。他判断,未来3至5年内,数字和物理世界的Agent对Token消耗总量将超过全人类。

但Token需求的爆发,正遭遇供给侧的刚性约束。Token消耗量以指数级速度逐年攀升,但受限于并非为Agent设计的旧算力架构、存储扩产周期、AIDC建设与电力供应,算力供给只能以线性速度缓慢爬坡。其中,算力架构与存储供应构成AI产业两大核心卡点。

供需格局的失衡之中,Token经济迎来发展机遇。徐冰表示,芯片技术路线持续创新,国产存储崛起,国产模型能力快速迭代,叠加电力成本的传统优势,正在为中国构建Token全产业链竞争力提供支撑。


启望S3原型首秀,“推理巨兽” 256卡超节点同步亮相

“Agent融入业务流程后,Token成本压力日渐突出,希望在数贸会上能找到高性价比的国产推理算力解决方案。”曦望展台人潮涌动,不少来自企业的观众与开发者驻足交流。

专为大模型和Agent打造的原生推理GPU启望S3,成为展台现场问询热度最高展品。

作为本届数贸会亮点之一,启望S3围绕降低Token推理成本作出多项创新:在产品定义上,启望S3不追求训推一体,精简训练模块,节省的晶体管和功耗预算全部投入推理;舍弃HBM路线,国内率先采用LPDDR6内存(兼容LPDDR5X),不仅大幅压低存储成本,还能搭载更大容量显存,适配更大参数量大模型;同时原生支持FP4低精度。相比上一代S2,启望S3推理性能提升约5倍,单位Token推理成本下降约90%。


在单卡之外,曦望还给出了系统级算力解法。搭载S3的“推理巨兽”超节点是现场另一款人气产品。它依托高速互联架构,让256张卡实现一级互联,不再 “各自为战”,像一台超大GPU一样协同工作。它可支持万亿乃至更大参数量的多模态MoE模型,在大EP部署下吞吐率可提升20倍以上,为用户交付强大的系统级算力。

曦望展台上,同时亮相的还有计算卡、计算模组、服务器、液冷工作站、一体机等多样化的硬件产品,以及自研的SIRE软件栈,面向金融、制造、公共事业等不同领域的行业推理解决方案。

“观众来自各行各业,使用大模型与Agent的场景丰富多元,既要求算力高效,对使用成本十分敏感,亟需算力产品精准匹配自身业务需求。”曦望工作人员表示。

曦望要做的就是以推理GPU为支点,携手伙伴共建算力生态体系,一芯带百业,合力降低推理算力成本,让推理算力如水电般普惠可得,为持续生长的数字生命筑牢算力家园。徐冰表示,AI的下一场仗,不是比谁更聪明,是比谁能稳定、便宜地交付智能。

“转载请注明出处”

责任编辑:祝瑶