快科技 9 月 13 日消息,2026 中国算力大会在河北廊坊举办。在大会 " 算力首创首发 " 专场上,国内首个国产 GPU+类脑芯片大模型异构混合推理系统正式发布。
该系统由移动云(中移苏州软件技术有限公司)联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学共同研发,目标是让国产芯片高效支撑大模型推理。
其技术思路是将大模型拆解分工。团队对 Transformer 结构做 PD/AF 分离:Prefill 预处理阶段与 Attention 注意力计算交给国产 GPU,FFN 模块交给类脑芯片。类脑芯片的存算一体和片上大容量 SRAM 架构,正好承接对带宽敏感的部分。
研发团队同时自研了模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合。这套方案对标英伟达下一代 Vera Rubin with Groq 异构推理架构。
实测数据落在硬件配置上:3 台天数智芯 GPU 服务器搭配 3 台类脑机柜,运行 DeepSeek V4 Flash 模型,相较同等投入规模的纯 GPU 集群,推理输出和推理能效均提升 1 倍以上,业务运营成本下降 40% 以上。
项目累计形成 15 项授权发明专利、6 项软件著作权,覆盖异构调度、类脑芯片架构、编译工具链等环节,目前已进入小批量试产阶段。
该方案面向 Token 工厂、AI 代码生成、多智能体协同等场景,也可用于金融、安防、通信等安全敏感行业。



登录后才可以发布评论哦
打开小程序可以发布评论哦