成立九年,中科类脑把积累装进Token工厂
乔不迟 发自 凹非寺
量子位 | 公众号 QbitAI
卡数、算力规模和PUE(电能利用效率)。
大模型进入规模化推理阶段后,这套标准开始转向产出端。
同样一批芯片、同样一度电,最终能生成多少满足质量、时延和稳定性要求的Token(词元)。
芯片通电,只代表生产开始。
计算、存储、网络、模型部署和任务调度,只要有一个环节卡住,昂贵的芯片仍可能低效空转。
中科类脑瞄准的,正是这段从资源到智能产出的转化过程,让同样的芯片、同样的电,产出更多、成本更低、质量更稳定的Token。
它将自己的体系称为“算电协同型Token工厂”,把异构芯片、模型、用户任务和电力放进同一套系统调度,用更少的资源产出更多有效Token。
对外,这套能力落在BitaHub彼塔云平台;
对内,由一个决策大脑统筹,电力、算力、Token三个子系统共同驱动。
算力之上,交付Token
中科类脑合伙人、副总经理常峰,给我们算了一笔价值账,来解释“Token工厂”。
一度工业用电的采购价通常只有几毛钱,转化成算力后,价值可能达到几十元;
进一步形成Token后,部分模型每百万Token的价格可以超过百元。
这里的关键并非简单涨价。
算力是生产设备,电力只是原料,用户提交的提示词和任务进入Token生产线,模型负责完成智能转换。
调度系统决定任务在什么时间、什么地点、使用哪类芯片和哪个模型运行。
客户最终购买的是能够完成任务、符合指标的Token服务。
这也确定了中科类脑在产业链中的位置。
传统IDC交付机柜、电力、网络和空间,云厂商提供算力实例与模型接口;中科类脑向上再走一层,即Token生产运营层,试图对Token的生产效率、成本和任务结果负责。

△图片由AI生成
常峰将这套商业逻辑概括为两件事:效能和场景化。
效能决定每颗芯片、每度电能生产多少Token;场景化则决定这些Token能够产生多大价值。
在常峰的规划里,效能和场景同样重要,集中研发资源解决效能问题,组织业务资源解决高价值场景问题,再把产生的高质量token结合业务场景,实现应用价值的最大化,目前已经在AI4S及能源领域形成了可规模化的商业闭环。
BitaHub承担前台角色。
它统一纳管英伟达、昇腾等不同架构的算力,聚合模型API和Token服务,并连接企业私有算力池与公共资源池。
以平均30张、峰值100张芯片的需求为例,企业按日常负载自建,高峰缺口由平台补齐70张芯片,相当于获得了一条可以弹性扩缩的Token生产线。
据中科类脑介绍,截至目前平台已接入逾3000个算力节点,总规模超过5000P,累计服务超8万企业及科研用户。
后台则是公司与中国科大团队联合研发的决策大脑,负责电算Token一体化系统从监控、预测到调度、运营的闭环运转。
因此,中科类脑的核心产品并非某一座机房、某一款芯片或某一个模型。
它提供的是一套跨域生产组织能力:在满足安全、时延和稳定性的前提下,把分散的算力与模型资源组合成可以持续高质量交付的Token。
产业链上并不缺资源供给者,稀缺的是把多种资源转化为稳定高质量产出的运营者。
先把异构算力跑起来,再叠加电力优化
中科类脑最核心的技术落在AI系统软件层:把算力资源、芯片、模型、电价和任务纳入同一套决策系统,基于电力条件对算力、模型和任务进行柔性调度。
这套系统被概括为“1+3”架构:一个决策大脑连接算力、Token和电力三个子系统,先匹配算力、模型与任务,再把电力信号加入全局优化。
首先,它是一套预测与决策模型。
中科类脑CTO、研究院院长丁海松将这套系统的工作节奏拆成三步。
第一步是监控,实时监测Token需求、集群负载、新能源的发电功率、电价以及每份算力的Token产出效率;
第二步是预测,判断未来15分钟、1小时甚至更长时间内绿电出力、电价和任务需求的变化;
第三步才是决策,调整三个子系统的运行方式。
所有决策都以用户体验、结果质量和系统稳定性为边界。
同时,它也是能真正执行调度的工程系统。
调度的核心,是从算力任务中找出“柔性负荷”。
对首Token时延敏感的实时任务留在原地;可排队、可断续的批处理任务,则可以转移到电价低谷时段异地运行。
任务可以选择地点,芯片也要重新分工。
常峰将异构芯片调度比作管理一群说着不同语言的员工。
每类芯片的计算能力、显存大小、互联带宽和软件栈各不相同,直接放在一起很难协作。
因此,中科类脑为每种芯片配置了一个“包工头”式插件,调度层只负责分发任务,插件负责指挥同类芯片;
同时插件给每张芯片建立能力画像,记录它擅长什么任务、和谁组合效率更高。
△图片由AI生成
解决不同芯片“能否协同”之后,系统还要进一步拆解推理流水线,解决“怎样协同效率更高”。
在大模型推理中,系统还可以把Prefill和Decode拆开,并通过KV Cache迁移把两个阶段连接起来。
Prefill阶段计算密集,交给计算能力更强的芯片;
Decode更依赖显存和带宽,交给大显存、高吞吐芯片。
两阶段之间的KV Cache必须高效迁移,否则长上下文需要重算,时延和吞吐都会受影响。
高端芯片不必包办整条推理链,新旧芯片、国产芯片和海外芯片都能在同一座Token工厂中各司其职。
对长上下文任务,KV Cache相当于模型已读内容的“工作记忆”。让它随任务跨节点迁移,可以减少重算。
另外,训练作业跨集群调度还要同步检查点、优化器状态和数据进度,并控制任务中断时间。
这套系统真正接受检验,是在一次跨上海、芜湖和乌鲁木齐的调度测试中。
整个跨三地调度的控制响应保持在200秒以内,跨域迁移成功率达到100%,能耗预测精度达到98%。
这次测试验证的不只是搬运:而是把异构适配、跨域迁移、长上下文KV跨节点协同、绿电预测和SLA约束放进同一条生产链联动,电力信号让任务按电网压力和绿电供给调整运行地点。
测试体现了系统跨经营主体的调度能力,还额外带来了电力成本的下降。
这也是全国首个跨三地算电协同智能调度测试。
现在,这套调度能力有了常态化运营的实体载体。
9月17日,皖疆人工智能科技产业园在乌鲁木齐正式开园。园区按照“三中心一平台”布局规划建设,首个突破千P的融合算力中心已经建成投运。
对中科类脑来说,比区域布局更根本的问题,是壁垒在哪里。
丁海松的回答很直接:核心壁垒是对算电Token一体化的运营能力和理解。
“算力、电力单看,我们可能都在第一梯队。但真正的壁垒不是单项能力,而是叠加之后的系统级能力。”
他进一步表示,异构调度和推理优化等算侧能力,也可以追赶,绿电出力预测等电侧能力,竞争对手可以补上;
真正困难的部分,是把两套技术语言、两批工程经验和两类运行数据装进同一个系统,并让它在真实业务中长期稳定运行。
针对这套核心壁垒,中科类脑进一步升级系统调度与运营能力,在刚刚结束的世界制造大会上,正式推出算电词元一体化平台。
平台是面向AI基础设施(Token工厂)推出的操作系统,延续“1+3”核心架构,以博弈智能决策大脑为中枢,打通算力、Token、电力三大子系统,构建“电-算-Token”全链路闭环。
对于Token工厂终局,常峰将其比喻为一座“黑灯工厂”:
未来数据中心建成后无需人工干预,算力智能体负责芯片适配、任务切分和KVCache协同搬运;电力智能体负责电价预测、绿电出力预测,控制储能充放电,再由一个控制中枢统筹整座工厂。
更远一步,则是算电芯模一体化。
系统按模型运行效率反推芯片设计,让芯片从设计阶段就服务于Token生产。
从算到Token、再回到芯片的全链路一旦打通,才是难以复制的壁垒。
Token越便宜,系统级能力越值钱
Token越卖越便宜,这家公司靠什么赚钱?
国家数据局披露,我国日均Token调用量从2024年初的1000亿增至2026年3月的140万亿,两年增长超过千倍。
据统计,部分主流模型API累计降价超过90%。量在暴涨,通用Token的利润却被迅速压薄。
以度电智能(有效Token/kWh)作为统一优化目标,中科类脑的解法分三层。
第一层是算力与Token优化,通过异构调度与推理加速技术,提升每度电产出的有效Token数量;
第二层是算电协同增益,在算力优化的基础上叠加电力协同,进一步压低单位Token成本;
第三层则是把通用Token组织成场景结果,按价值计价。
度电智能由此成为顶层结果指标,底层硬核仍由异构调度、KV迁移和任务编排引擎提供。
Token工厂是新鲜词,中科类脑的积累不是。
算力调度始于2019年BitaHub上线,持续做异构算力纳管与调度;
与此同时,公司成立9年,已经在电力智能化领域深耕七年多,变电站智能巡检覆盖十余省市、上百座站点,沉淀出新能源预测、储能和微网控制能力。
2024年,两条技术线汇入算电协同。
这一路径决定了它的技术定位:AI集群调度内核是可独立交付的底座,电力域是建立在底座之上的跨域增量。
在场景价值端,常峰判断,Token会因模型能力和任务价值不同拉开价格差距。
同样数量的Token,用于普通对话与专业任务,客户愿意支付的价格可能完全不同。
如在科研场景,科研智能体可以串起读论文、实验设计、验证和论文生成,把通用Token组织成完整的科研工作流;
在能源场景,公司深耕多年的央国企市场存在天然的业务门槛,行业数据和业务理解本身就把大部分竞争者挡在门外。
前者提升Token的价值高点,后者形成难以复制的供给壁垒,让场景化Token获得区别于通用的定价空间。
这些积累与优势在竞争中意味着什么?
行业竞争已经走过“有算力”“模型数量”“API价格”,正在第四级“系统效率”开战,第五级“场景结果”刚刚开始。
在AI Infra方面,中科类脑的技术坐标首先是异构调度与KV迁移,电力域再把优化边界向外延伸。
系统级的竞争,具体落在五个方向上:
- 价格战将转向每瓦Token产出;
- Kimi K3等超大MoE模型推动PD分离、KVCache分层和超节点普及;
- 多类芯片长期异构;
- 轻量任务转向端侧;
- 算电协同进入国家新基建。
中科类脑把异构芯片、模型和任务装进同一套跨域融合体系,核算吞吐、时延、迁移稳定性和任务质量;
度电智能则衡量叠加电力协同后的最终产出。
资本持续押注这个方向。中移基金2025年独家投资B轮,中车资本2026年领投数亿元B+轮,银杏谷、水木、启迪等跟投。
这些信号仍需规模化收入和长期运营验证,这恰恰说明竞争坐标正靠近中科类脑提前投入的位置。
Token需求越大、价格越低,能够同时调度芯片、模型、电和任务的生产控制层就越稀缺。
模型决定智能上限,Token生产效率决定智能可否规模化。
中科类脑要守住的,是能源通向智能产出的关键链路。
- 对话它石智航丁文超:2025最火具身智能,2个自动驾驶第一人带队,1.2亿美元天使融资震动江湖2025-03-26
- WebArena作者Shuyan Zhou入职Meta超级智能实验室2026-09-22
- 图形学宗师童欣加盟Meshy,要做“AI for Fun”的头号玩家2026-09-08
- Manus重生第17天,估值居然就翻倍了2026-09-18




