
2026 世界人工智能大会(WAIC)在上海拉开帷幕。作为国内领先的全功能GPU企业,摩尔线程以“词元时代 万物智能”为主题参展,系统展示了“模型训练工厂、词元生产工厂、智能体生产工厂”三大AI工厂。在本次大会上,摩尔线程首次公开展示了其创新的MTT C256超节点,为万卡乃至十万卡级智算中心提供了全新的系统架构与算力底座。
期间,由摩尔线程举办的“词元时代 万物智能论坛”上,趋境科技创始人、CEO艾智远作《异构协同,打造国产高效Token工厂》主题分享。
趋境科技专注于大模型推理应用的极致效能。艾智远介绍,目前每天能够供应高质量的Token达上万亿的量级,并与摩尔线程深度合作,预计到下半年,每天可以达到数万亿Token的产量。
艾智远提到,在推理时代,算力基建的核心瓶颈点一是希望Token的价格变低,Token消耗量几亿时,成本能否降低到几元钱;二是国产卡到底什么时候能够真正用到生产环境中来。
所谓“生产环境”,即供给的Token是服务于日常的,比如客服、智能决策、辅助决策等等相关的,而不是纯粹的娱乐。今年年初,用户还普遍在租算力,出现了很多算力厂商;春节之后,“Token工厂”一词热度走高,从原来交付算力,转化为交付Token结果,这也带动了B系列卡大幅度上涨,几乎是以每周100万的价格上涨,“这让我们非常痛苦,因为做Token要赚钱的,但成本又比较高”。
艾智远注意到,大的制造业或互联网客户,用于提升生产效率的AI Coding的场景,才是真正有购买力的场景,即高品质Token。
与此同时,Token也会分级,比如当前市面上比较饱和的是做L1-L3级别的Token,即一些中转站,还包括MaaS平台上做的Token,面向C端和开发者,但也会面临Token速度不够快、服务稳定性不强等“吐槽”,趋境科技供应的多是L4、L5级的Token,对性能要求极高。
上半年,趋境科技选择的是国外H系列和B系列的加速卡,但涨价太快了,产能供应也跟不上。在测了市面上各种各样的卡后,趋境科技选择了摩尔线程的S5000。通过摩尔线程的加速卡再加上国际上的产品,形成异构分离,支撑了很大的Token产能。
他解释,首先,需要一个能够支持超大计算量的卡。其次,需要能够支持超长上下文的卡,再次,需要高稳定、高并发性的卡,而摩尔线程的卡是能满足需求,首先它拥有FP8精度1P以上的计算能力,其次能够稳定支持超长上下文的整体吞吐量。再次,生态迁移比较好,在一些N卡上做的一些事情,可以很快迁移到摩尔线程的卡上。此外,有一个稳定可靠的国产和供应链的支持。这款卡成为当前最好的方案。
在DeepSeek很火时,大家还处在能否把模型跑起来的阶段,而今年就变成了是否能够稳定生产的阶段,“Token工厂”的工程化能力要求非常高。
艾智远提到,4台摩尔的S5000的Prefill性能,已经能超越一台英伟达AI加速芯B300整体性能的——后者的价格已经涨到了1000多万元,相比之下,摩尔线程的产品能够达到投资回报率回正。
但他也指出,这当中还有很多事情要做,比如“以存换算”,主要解决的是不同卡之间怎么做高效的KV Cache传输;能不能在上海的摩尔线程卡中心,在另外一个地区的卡中心,两者之间做高速专线互连,达成两地算力任务。
此外,还有虚实同构,当几万张卡在跑一个大模型任务时,很容易会出现某几台机器“木桶效应”,如何通过智能CPU模拟GPU的方式,提升到50%甚至100%的资源利用率。
目前,趋境科技也在共同打造更高产量的“Token工厂”,不仅和国外的卡,也和摩尔共同构建日均万亿级的“Token工厂”,目前已建设了几个这样的“Token工厂”,对算力和Token的需求量是非常大的。
面向未来,艾智远说,更愿意和摩尔线程等国产加速卡深度合作,相信未来将会是国产卡主导大模型整体推理的生态,但当下国产卡最大的阻塞点并不是算力和制程能力,而是HBM。HBM是一个工艺问题而不是技术问题,英伟达基本上包圆了HBM3E以上的大部分的产能,而通过一些灵活的方案,可以把自己核心技术的算力竞争力发挥出来,构建高稳定性、低延迟、高吞吐整体的Token服务。
炒股配资网南方+记者 郜小平配资是否长期可用
配资公司网提示:本文来自互联网,不代表本网站观点。