海绵宝宝

Token不够用了!AI时代最火“新生意”|WAIC观察_我的网站

风车

A |     K图 GOOGL_0K图 GOOG_0  当地时间8月20日,谷歌宣布,其开源端侧模型家族Gemma的总下载量已突破10亿次。

B | 这款由谷歌DeepMind推出的开源大模型,自发布以来,全球开发者基于它衍生出超10万个定制变体,形成名为“Gemmaverse”的开源生态。    Token不够用了!AI时代最火“新生意”|WAIC 2026现场观察          作者/ IT时报 毛宇          编辑/ 郝俊慧 孙妍          Token不够用,已经成为当下AI创业者的第一焦虑。                   7月的上海世博展览馆,2026世界人工智能大会(以下简称WAIC 2026)上,除了忙忙碌碌的机器人、排布密集的炫酷超节点机柜,记者听到最多的话题便是“Token”。
  谷歌列举了多个Gemma家族应用场景:从太空本地图像分析、医疗报告标准数字化、癌症创新治疗方案再到动物语言识别,Gemma家族模型正实实在在地应用到各个垂直行业。  其中,以Gemma为基座的模型在生物医药科研领域产出了多项标志性成果。                   一位来自杨浦的个人创业者站在展馆门口,跟《IT时报》记者算了一笔账:他做AI短漫剧应用,每月在Seedance上的API调用费要花掉上千元。谷歌一方面推出面向医疗场景的垂直模型MedGemma,支撑医疗报告结构化、医学影像辅助分析等应用;另一方面联合科研机构,依托Gemma底座攻坚癌症机制研究。“身边真正做开发的,很少用便宜的方案。  其中最受行业关注的是谷歌DeepMind、谷歌研究院与耶鲁大学合作开发的Cell2Sentence-Scale 27B(C2S-Scale)模型。

C | ”他表示,无论国内外的模型,只要好用,创业者都愿意咬牙付费。  传统的癌症疫苗治疗思路,是让免疫系统通过识别身份标签来识别敌人。                   就在创业者抱怨Token价格昂贵的同时,展馆另一头,厂商们正热火朝天地讨论如何把Token做成“工厂”,大规模、标准化、像印钞票一样输出Token。但这面临一个“瞄准困境”:一般来说,肿瘤的“身份标签”取自肿瘤本身,但很多肿瘤细胞表面缺少能被免疫T细胞识别的、独特的“身份标签”(即肿瘤特异性抗原),同时,它们还主动穿上“防护服”(如高表达PD-L1蛋白),成为所谓的“冷肿瘤”。                   Token告急之下,Token工厂正加速赶来。                   启明创投主管合伙人周志峰在WAIC“启明创投·创业与投资论坛——从算力原点到应用落地的进化征程”上感慨,AI产业的“速度、强度、烈度,是人类在这几百年工业革命、信息革命中没见过的超高水准”。结果就是,对于“冷肿瘤”,免疫系统即使大军压境,也像得了“脸盲症”,看不见敌人,或者看见了也被强行抑制,导致治疗无效。  针对免疫治疗难以起效的“冷肿瘤”难题,C2S-Scale按活跃程度排序,将单细胞基因表达数据转化为类文本的“基因句子”,让大语言模型能直接“读”懂细胞。

D | 他同时抛出一组基于全球最大AI聚合平台OpenRouter的数据:美国企业使用中国模型构建AI应用的Token占比,从2025年上半年的4.5%上升至2026年年中的46%,自2026年2月8日以来,美国公司每周调用中国AI模型的比重更是持续保持在30%以上。“也就是说美国企业将近一半的Token是跑在中国模型上的”。随后,该模型完成4000余种药物的虚拟筛选,预测出silmitasertib联合低剂量干扰素的用药组合。                   Token,是贯穿这条路径的“燃料”。  C2S-Scale锁定的候选药物中,仅10%-30%在过往文献中被提及,其余与筛选目标无已知关联。         展馆里的高频词          Token工厂是什么?简单说,就是把底层的算力、模型、推理引擎打包成标准化的Token服务,按量售卖,按需交付。最终被选中的是silmitasertib(CX-4945),一种CK2激酶抑制剂。

E | 它不再是卖硬件、卖算力,而是直接卖“智能输出”,你付多少钱,我就给你多少Token,用完即止。  这一AI提出的全新治疗假说,后续在人源活细胞实验中得到验证,研究团队用模型训练时从未见过的人类神经内分泌细胞进行实验,结果是单独用药无效果,单用低剂量干扰素只有轻微提升,两者联用后抗原呈递提升约50%,证实联用方案可显著提升抗原呈递水平,属于少数AI产出全新癌症治疗机制并获得实验室验证的案例,有望提升肿瘤细胞抗原呈递能力,把冷肿瘤转化为对免疫治疗敏感的热肿瘤。                   “客户只要结果,那我直接打包给他就行了。”在WAIC 2026的另一个会场——张江科学会堂,来自天津的融科联创信息技术有限公司工作人员告诉记者,他们正在考虑往Token工厂方向转型,“既要做服务器,也要卖Token,现在的趋势就是这样”。

F |   该模型相关成果已对外开源,可供全球科研团队继续拓展研究。

G | 需要注意的是,该发现目前仅停留在体外细胞实验阶段,尚未进入临床。

H | 他解释,很多中小客户不懂算力调配,也不关心底层架构,“客户可能连GPU和CPU都分不清,但清楚自己需要Token。”                    于是,一套“简单粗暴”的解决方案应运而生——一台预装模型、推理引擎与计费系统的服务器,插电即可启用,按Token计费。  随着下载量冲高,Gemma证明开源大模型不再局限对话生成,能够直接介入原始生物数据挖掘,深度探索癌症治疗新机制,为AI医药科研提供低成本的技术底座。“卖给中小企业,一台就够了,”他说,“顶多两三台”。                   不仅是服务器厂商,“Token工厂”的概念正在席卷整个算力产业链。清华大学背景的清程极智在展区提出了Token“前店后厂”模式,后厂是标准化的算力集群,前店是Token商店;PPIO发布了面向Agent时代的“智能Token工厂”;范式智能则把展台做成了“AI 2.0 Token工厂”的全景展示,创始人戴文渊在采访中透露,2026年一季度的Token收入已超过去年全年。(文章来源:科创板日报)。                   这个模式的诱惑力在哪儿?戴文渊在大会期间算了一笔账:如果集群利用率能做到极致,Token工厂的毛利率可能达到70%~80%。                   周志峰在演讲中给出一个更宏观的判断:未来12到24个月,AI应用的商业模式将加速脱离互联网时代的Freemium(免费增值)逻辑,转向以结果和价值定价。                   同时,原本被业界戏称为“AI水电煤”的Token付费模式也正在发生变化,一批AI产品开始把价签上的计量单位,从“Token”换成了“任务完成数”甚至“有效交付件”。衡量AI公司的核心指标,将从用户规模转向单位智能成本创造的商业价值。

I |                    这一趋势已在多个领域显现,比如Zendesk在2025年初推出了基于AI解决方案的定价模式——按“成功解决的工单数”收费,而非按客服座席数;Intercom将AI客服Fin的定价锚定在“自动解决率”上;Salesforce的Agentforce平台直接以“每次AI对话”为计费单元,法律科技公司Harvey则按“成功完成的法律研究任务”定价。         Token依然没有统一定价          尽管当下AI行业内人人言必称Token工厂,但至今仍未形成统一的行业标准。这里的“标准”指的是Token从生产到交付全链条的质量、计费、计量、服务等级等一整套规则体系。                   Token与Token并不等值。中国工程院院士郑纬民在商汤主办的“算创·无限——Agentic时代AI基础设施创新发展论坛”上指出,Token的实际商业价值由首字延迟、生成速度、并发承载能力、服务稳定性四大指标共同决定。不同业务场景需要不同等级的服务标准,只有高等级、高品质的Token才能支撑复杂智能体的规模化落地。                   “行业普遍存在模型虚标、算力质量不透明、计费模式粗放等问题,压缩模型沿用原品名报价、节点缓存命中率差异,导致同等算力调用成本悬殊”。不同的Token工厂、不同的模型厂商,定价方式五花八门,折扣力度差距明显,且“根据用量大小,给的折扣不一样。”山海引擎COO彭璐向《IT时报》记者坦言,“每家公司套餐价格都不一样,目前没办法统一定价”。                   在张江科学会堂展区,博思芯宇展台打出了一张“Token成本拆解”牌:单位Token成本 = Token总成本÷有效Token产出,Token总成本由三部分构成——CAPEX(资本性支出,算力设备折旧)、OPEX(企业的日常运营开支,包括电费、散热、运维等)、有效产出保障成本(故障防控、容错调度),它试图用这套公式,帮算力运营商把每一分钱算清楚。         启明创投也在论坛上发布了“2026 AI十大展望”。其中,将安全可信与产品效果、Token成本并列为影响企业AI大规模落地的三大关键变量。在周志峰看来,AI基础设施的竞争正在进入系统级阶段——“竞争维度覆盖芯片、互联、散热、供电等关键环节,未来两年内有望涌现基于新架构的算力芯片及超节点大集群,以实现低成本、高效率的Token生产”。         Token炼就“新石油”          Token工厂,是被现实逼出来的生意。                   在H2算力展区,记者遇到了一位正在咨询Token工厂产品的创业者。他做的是医疗影像AI,每天处理大量CT图片,上个月光API调用费就烧掉了上万元,“想来大会看看有没有更便宜的Token,”他说。                   Token的消耗量,已经膨胀到了一个令人咋舌的地步。                   周志峰在论坛上透露,中国日均消耗大模型Token,从2024年1月到现在上涨了超千倍。有数据显示,截至2026年3月,中国日均Token调用量已从2024年初的约1000亿增长至140万亿,但据阶跃星辰联合创始人、首席技术官朱亦博在启明创投论坛上指出,在Token需求快速增长的同时,算力供给增幅相对有限,这也进一步凸显了 AI 基础设施创新的价值。面向 Agent 时代,行业不能只依赖算力规模扩张,还需要通过模型、系统与芯片的协同设计,持续提升单位算力的智能产出和任务交付效率。“如果Token继续翻倍,加上模型的尺寸越来越大,对Infra的挑战将持续增加。”          然而,在供需之间,依旧有着结构性的失衡。一边是创业者喊着“不够用,价格贵”,一边是算力厂商喊着“赚钱难、跑通累”,中间的鸿沟,恰恰是Token工厂想要填补的空白。                   一位深耕企业级智能体领域的创业者告诉《IT时报》记者,他们今年帮客户落地智能体项目,客户最关心的问题已经从“能做什么”变成了“Token要花多少钱”,“以前谈AI,大家兴奋的是能力,现在热潮褪去,开始算账了”。                   大模型领域的“杰文斯悖论”还在持续,Token越来越便宜,需求规模反而爆发式增长,算力总支出还在持续增加。

J |                    WAIC 2026上,Token工厂正从概念展示落地为实体产品。谁能在Token这个“新石油”的炼化链条上跑得最快,谁就可能成为AI时代最大的赢家。         排版/ 季嘉颖          图片/ IT时报 采访对象          来源/《IT时报》公众号vittimes                    E N D。

Current article:http://23z.shuosongzoutunchutao.cfd/2vwr5/5glj6.html

Published on:12:41:06


我的网站最近更新

我的网站热门资讯