白鲸出海—让中国互联网服务世界

{{user_info.user_name}}
您当前是白鲸会员
开通VIP,享受更多服务
会员到期时间:{{user_info.expire_date*1000 | formatDatebyDay}}
合作查看次数: {{users_vip_equities.view_cooperation || 0}}次
合作发布次数: {{users_vip_equities.release_cooperation || 0}}次
公司查看次数: {{users_vip_equities.view_company || 0}}次
报告下载次数: {{users_vip_equities.download_book || 0}}次
鲸币数量:{{user_info.jingbi}}
发布
当前位置:白鲸出海 > 资讯 > 正文

想看AI芯片下一步往哪里走?没来上海峰会的人,看这篇就够了

ice  • 

图片1.png

芯东西 9 月 21 日报道,2026 全球 AI 芯片峰会近日在上海圆满落幕。

本届大会由智东西发起,旗下智猩猩主办,芯东西协办,以“芯路求索 聚力致远”为主题,全景透视从 TOPS 到 Token 的 AI 算力关键链路。

整整两天,超过 60 位重磅嘉宾,在 1 场开幕式、3 场论坛、5 场闭门研讨会上密集输送技术创新、落地实践与产业趋势干货。多位演讲嘉宾还在会上预告重磅新品。

大会直击 AI 芯片前沿,涵盖架构创新、3D 堆叠、超节点、KV Cache、新型存储、Token 工厂异构混训混推、大模型推理、智能体推理、具身智能推理等焦点议题。来自超百家 AI 芯片生态企业的专业观众来到现场参会交流。

图片2.png

在展区,奎芯科技、芯来科技、Imagination、进迭时空、奇异摩尔、星融元、启芯宸光、科华数据、博伦智汇、硅芯科技、先进编译、恒瀚微电子、焱融科技等企业带来最新的技术产品方案展示。

“九年前,我们在上海举办了首场全球 AI 芯片峰会。九年来,全球 AI 芯片峰会的足迹已遍布北京、深圳和上海。”智东西联合创始人兼 CEO 龚伦常在发表致辞时谈道,“这是我们持续关注整个 AI 领域的一个缩影。” 

图片3.png

▲智东西联合创始人兼CEO龚伦常

我们对开幕式及 3 场高峰论坛(大模型 AI 芯片、Agent 推理芯片、具身智能芯片)中 30 位嘉宾分享内容做了梳理总结,重点如下:

一、云端 AI 芯片论剑!高效算力呼唤新架构 CPU 杀回智能体时代焦点

随着智能体爆发,全球 AI 芯片产业格局持续演变,头部模型厂商深度参与芯片架构定制,几乎每家云计算巨头都在自研 AI 芯片,国产 AI 加速卡持续放量,算力运营重心从不计成本抢占高端算力,转向以 token 成本和算力利用率为核心的精细化运营。

如何通过技术创新提高大模型训推效率?为什么智能体时代呼唤“六边形”CPU?突破算力、内存、网络瓶颈有哪些新解法?大模型怎么辅助提高芯片设计效率?5 位演讲嘉宾在开幕式上妙语连珠,畅谈他们的成果与思考。

1、中山大学王中风:把 AI 芯片算力用满,让大模型参与芯片设计

中山大学集成电路学院院长、IEEE/AAIA Fellow 王中风分享了大模型时代下 AI 芯片的设计挑战与演进方向。当前如何将硬件峰值算力转化为模型部署的有效算力成为关键问题,为了实现高效部署,其团队通过压缩与量化技术创新降低数据开销,基于软硬件协同提升推理效率。

模型驱动芯片设计方面,王中风团队通过视觉 Mamba 高效加速器、超低 BitLLM 推理加速器、多层次稀疏 Transformer 加速器设计,解决算子适配、存储调度、稀疏利用等挑战;面向大模型辅助芯片设计自动化,提出性能感知 GEMM Verilog 生成设计、GEMM 图-码转换多模态框架等创新。

王中风认为,提升 AI 有效算力的演进方向将是模型、硬件与系统设计的协同创新,包括探索更低比特的模型压缩与精度适配、联合优化算子融合与数据重用、用部署反馈驱动模型迭代。

图片4.png

▲中山大学集成电路学院院长、IEEE/AAIA Fellow王中风

2、英特尔高宇:智能体时代,CPU 重回 C 位

英特尔中国区技术部总经理高宇说,智能体爆发带动 CPU、内存、SSD 和隐私需求,让 CPU 告别过去给 GPU“打辅助”的角色,重回 AI 算力体系的 C 位。

智能体的运行是一个循环过程,其主线程主要运行在 CPU 上。CPU 需要负责上下文处理、调用大模型、权限检查、工具调用以及结果处理等环节。

适合智能体的 CPU 不能只追求单点性能,而要成为“六边形战士”,同时具备更高的沙箱并发度、IPC 和频率、更大的内存容量,以及硬件加速和安全能力。

高宇预告说,英特尔将在两天后的英特尔技术创新与产业生态大会(Intel Connection)大会上展示内置 128 张或 192 张 Granite Rapids 处理器的高密度 CPU 机柜设计,单机柜可承载 5 万个 Agent 同时并发运行。 

图片5.png

▲英特尔中国区技术部总经理高宇

3、清华大学胡杨:以晶圆级协同设计提升 Token 经济性

清华大学集成电路学院副教授胡杨指出,AI 基础设施的价值不能仅以单芯片峰值算力衡量,还应同时考虑有效 Token 产出与设备、网络、供电冷却等全生命周期投入。其团队围绕 Token 经济性,开展从计算芯粒、晶圆级芯片到集群的全系统协同设计。

针对通信、功耗和集成密度三大瓶颈,团队根据任务需求与面积、功耗约束,优化计算、存储和通信资源配比。在系统层面,将高带宽通信转入晶圆内部,联合设计晶圆内外互连及供电冷却,减少通信等待与外围设备投入。

报告介绍了模型部署、专家布局和集群组网等研究进展。通过协同优化Token映射与专家负载均衡,MoE 推理方案在 4 毫秒输出 Token 间隔约束下,单芯粒吞吐达到对照方案的 1.84 倍。晶圆间组网方案在所评估配置中的电力成本较基线降低 46%。相关研究分别从提高有效产出和减少系统投入两方面探索晶圆级的经济性。

胡杨强调,性能收益需要与制造、运行代价共同评估。团队已将热致翘曲、制造与装配良率、容错和散热约束纳入设计,联合清微智能研制了国产晶圆级芯片样机,形成大尺寸硅基板设计 PDK、芯粒集成与系统验证能力。并联合清微智能与浦江实验室构建了软件基础设施。

图片6.png 

▲清华大学集成电路学院副教授胡杨

4、后摩智能信晓旭:M50 已定点 150+产品,3D CIM 架构取得阶段性成果

据后摩智能联合创始人、产品副总裁信晓旭分享,应对 AI 芯片提升算力和访存的两大挑战,后摩智能作为存算一体的先行者,过去六年沿着基于 SRAM 的存算一体路线迭代,成功将存算一体架构从学术界带入产业界。其旗舰产品 M50 量产半年,产品定点已达到 150+,形成商业闭环。

针对行业主流 3D 堆叠技术算力受限、散热不佳等难题,后摩智能自研 3D CIM 架构,实现同等面积下算力翻倍,功耗与散热压力显著优化。信晓旭表示,后摩智能将围绕端侧 AI 对算力、能效和存储带宽提出的新需求进行技术演进,并加速推进 3D CIM 架构的芯片产业化探索。 

图片7.png

▲后摩智能联合创始人、产品副总裁信晓旭

5、奎芯科技王晓阳:未来 AI 芯片或采用定制内存(HBM+HBF)+标准互联新架构

在奎芯科技联合创始人兼副总裁王晓阳看来,AI 芯片设计逐渐走向定制化、异构化、专用化,给内存架构创新带来新机会,HBM Base Die 定制化和 HBF 分层存储成为新趋势。

HBM 内存已从标准单品发展成小型子系统,需针对不同工作负载深度定制。HBF 采用 NAND Flash定制化堆叠,达到 HBM 级带宽但容量高一个数量级。未来 AI 芯片可能采用 NAND Flash(HBF)+HBM 混合架构,将 KV Cache、Attention 等延迟敏感数据留 HBM,可预测的专家权重卸到 HBF。

奎芯科技拥有全栈内存与接口 IP,在UCIe,HBM,LPDDR,ONFI/NAND 等接口方面积累深厚,能够为定制内存+标准互联架构提供接口底座技术。目前奎芯 M2 UCIe:接口底座的标准封装 32G 已完成硅验证,其打造的 Chiplet 产品 ML100 IO Di e能实现 HBM 与 xPU 解耦,已流片交付客户。 

图片8.png

▲奎芯科技联合创始人兼副总裁王晓阳

二、经纬圆桌:AI 的平民化及端侧模拟计算的未来

经纬圆桌由经纬创投合伙人童倜主持,晰见科技创始人杨哲宇、安纳智芯首席科学家孙仲、芯词元创始人詹翊、后摩智能 AI 系统总工陈仲铭四位嘉宾围绕“AI 的平民化及端侧模拟计算的未来”主题进行分享。

经纬创投合伙人童倜给本场圆桌划出两大重点:一是 AI 平民化,AI 服务面向富人是阶段性的中间过程,未来肯定会有大量产品和服务面向普通人;二是在端侧,传统 GPU、数字 NPU 是“老登”,未来需要用更多新技术解决现在的问题。

计算芯片公司有了水,还需要配套的管子,这里的水管代表芯片能够支撑的模型规格能力。童倜认为,企业具备核心计算能力是前提,而存储架构的选型,则是根据不同应用场景,基于对应模型的参数规模及系统需要,来决定。 

图片9.png

▲从左到右:经纬创投合伙人童倜,晰见科技创始人杨哲宇,安纳智芯首席科学家孙仲,芯词元创始人詹翊,后摩智能AI系统总工陈仲铭

1、晰见科技杨哲宇:天眸芯成果荣登 Nature 封面,实现物理通用智能(Physical AGI)

晰见科技创始人杨哲宇说,端侧智能或者更大的范畴 Physical AGI 是比肩 AI Coding 的下一个机会,晰见科技要让 AI 拥有看世界的眼睛。其感存算传一体的 3D IC 芯片天眸芯是一颗能直接输出 token 的芯片,相关论文登上国际顶刊Nature封面。

天眸芯的结构是基于 3D 堆叠技术,在感光阵列下方堆叠高密度存储阵列与运算单元,通过模拟计算降低 ADC 的转换频次,功耗仅为对应同规格芯片的几十分之一。

据杨哲宇透露,目前头部具身智能企业打网球、踢足球、打乒乓球的视觉方案都直接来自天眸或进入深度评估阶段,具身运动人形机器人未来都会在 3-6 个月内,采用晰见科技的天眸芯或 Token Camera。

今年 11 月,晰见科技将发布基于天眸芯的多模态大模型。内部测试显示,基于天眸芯的稀疏 Token 该模型的首 token 延迟(TTFT)仅为传统基础模型的二十分之一,性能可直接对标国内外头部多模态大模型,且率先支持主动感知与视觉注意力,是未来 Physical AGI 时刻的基座模型。

2、安纳智芯孙仲:用模拟计算芯片把机器人时延压到几毫秒

安纳智芯成立不到一年,专注于模拟计算芯片设计。安纳智芯首席科学家孙仲谈道,模拟计算芯片有希望将相关应用的时延从百毫秒级降到几毫秒,人可感知的延迟为几十毫秒,机器人延迟在几毫秒运动会更流畅。

端侧大模型的数据量很大,处理这一问题的自然方法是做 3D 堆叠。安纳智芯擅长做矩阵计算,在面对如端侧设备微调等具体应用时,数据存储就可以使用 DRAM 或 HBM,再利用模拟计算芯片进行数据处理、微调,这也是安纳智芯将后续探索的方向。

孙仲透露说,其工程样片即将回片,下一步会联合银河通用等具身智能公司做运动规划和实时控制 Demo,与科大讯飞等端侧 AI 企业打造信号处理、大模型微调等相关应用。

3、芯词元詹翊:庖丁解牛式拆解 AI 平民化三道坎,正联合小米打磨超高速 AI 推理终端产品

芯词元创始人詹翊认为,AI 平民化分为 AI 是否值得用、用不用得起、能否显著提高生产力三个维度:第一个维度和基座模型有关,第二、第三个维度反映在硬件上,就是降成本和提升推理速度。

芯词元将基于全新一代存算架构打造速度更快、成本更低的 AI 推理芯片与推理算力集群,预计明年上半年发布 MO-I1,展示近万 tokens/s 的端到端推理速度,联合小米等产业伙伴实现超高速 AI 推理硬件在现实应用场景中的实际落地。

詹翊判断,未来 AI 推理硬件会是集各种存储介质所长的综合系统。其中芯词元的 eDRAM 负责片内高带宽和高速计算需求;片外 3D DRAM 和 HBF 互有带宽和密度优势,都会有他们各自适配的场景。所以 AI 推理硬件会在不同场景下采用不同的搭配方案,但芯词元的 eDRAM 存算一定是片内方案的最优解。

4、后摩智能陈仲铭:M50 芯片 10W 功耗跑 122B 大模型,下一代旗舰芯片已流片

在后摩智能 AI 系统总工陈仲铭看来,3D 堆叠能把内存带宽做大,实现极高的数据吞吐,尤其在物理 AI 场景下,有机会实现实时交互,不过现阶段相关供应链还未成熟。

HBF 是应对 HBM 高昂成本的一条技术思路。陈仲铭认为,HBF 无法完全替代 HBM,更多是作为互补方案,未来 3D 堆叠技术可能将出现 HBM+HBF 等混合堆叠架构。

后摩智能采用 3D CIM(存算+3D DRAM)的下一代旗舰芯片 A20 已流片,具备端测超实时思考和互动能力。

该公司也在关注模拟存算,可能会在下一代或下下一代产品实现大规模生产。

三、大模型 AI 芯片狂奔 3D 堆叠、新型存储、模拟计算风起云涌

随着大模型参数向万亿级膨胀,峰值算力不再是衡量 AI 芯片能力的唯一标尺,制约系统效率的要素还包括数据搬得动、存得下、连得快,以及芯片能否以可接受的功耗和成本真正落地。访存带宽、互联效率、软件生态和工程化能力,正在共同影响一颗AI芯片的有效算力。

AI 芯片创新正从单点提升计算性能,转向计算、存储、互联、软件与设计工具的系统级重构。如何打通从架构创新到规模量产、从理论性能到真实应用的漫长链条?在大模型 AI 芯片高峰论坛上,8 位嘉宾给出了他们的答案。有人以软件定义、3D 堆叠和近存计算突破内存墙,有人押注存算一体、HBF 与现代模拟计算,也有人将战场推向融合 GPU、STCO 和 AI 赋能 EDA。

1、东方算芯彭贵强:用“软件定义+3D 堆叠”创新绕过系统瓶颈

东方算芯董事长特别助理彭贵强谈道,“更聪明的模型”需要大算力和高访存带宽,“更低成本的应用”需要高访存带宽和低成本推理,算力评价标尺正从峰值算力变为有效算力。芯片性能不仅取决于计算单元本身,更受限于访存带宽、互联延迟、调度效率等系统因素。

东方算芯聚焦软件定义芯片,从计算、存储和互联架构三大方面进行创新:(1)软件定义 Tile,提升硬件利用率,降低编程复杂度;(2)采用逻辑-存储三维匹配的 3D IC 设计,提供极致带宽并突破内存墙,这一过程需要应对应力与晶圆翘曲控制、热管理和良率成本损失三大工程化挑战;(3)通过 Infinity Chiplet 3.5D,实现更强算力和更大互连规模。 

图片10.png

▲东方算芯董事长特别助理彭贵强

2、亿铸科技熊大鹏:三大定律,指引通用存算一体

亿铸科技创始人、董事长兼 CEO 熊大鹏认为,通用存算一体是突破 AI 芯片算力与内存瓶颈的关键。对此,他提出三大核心定律,为行业落地提供理论支撑。

(1)搬运代价定律:AI 数据搬运功耗与延时远高于计算本身,存算一体核心是尽可能消除数据搬运频次与距离。

(2)通用边界定律:通用存算一体需兼容 CUDA 主流生态,全覆盖通用 GPU 算力,适配各类模型迭代。

(3)异构终局定律:存算一体与 GPU 架构逻辑不同,二者融合能力直接决定芯片商业化成败。

熊大鹏强调,存算一体的核心在于存储,亿铸科技选定大容量、高成熟度、低成本的 3D DRAM 技术路线,未来将推出多形态全栈算力产品,覆盖云边端各类算力场景。

图片11.png 

▲亿铸科技创始人、董事长兼CEO熊大鹏

3、迈特芯李凯博士:端侧模型有“三座大山”,3D 近存计算可破局

深圳迈特芯科技芯片产品经理李凯博士分享了横亘在端侧大模型推理面前的“三座大山”:一是功耗、算力与成本的“不可能三角”,二是内存墙限制,三是通用方案与专用芯片之间的场景适配难题。

迈特芯采用张量脉动架构叠加 3D 近存计算来打破“内存墙”,将带宽利用率提升至 80% 左右。经测算,同样实现 600GB/s 带宽,传统 2D 方案功耗约为 30~50W,而 3D 方案可将功耗降至 3~7W。

据李凯博士透露,迈特芯 3D TPU 芯片已于今年流片,预计今年 11 月回片并点亮,首批将适配 2B 至 9B 模型,平均功耗约 6W,预计推理速度可达 80tokens/s。

图片12.png

▲深圳迈特芯科技芯片产品经理李凯博士

4、Imagination 艾克:端侧芯片需要融合 GPU

Imagination 应用工程总监艾克观察到,端侧芯片已经开始同时承担感知、计算、推理与图形渲染等任务,传统异构架构暴露出数据搬运、内存吞吐、任务调度与软件适配等短板,如何应对 5-10 年生命周期中不断变化的模型与应用需求,成为端侧芯片设计的新挑战。

产业正探索更灵活的异构融合计算架构,趋势是让 GPU 从单纯的图形处理向通用计算与 AI 计算中心演进。ImaginationE 系列 GPU IP 通过矩阵乘法直接嵌入 GPU 核心来提高 GPU 利用率,AI 计算、通用计算与图形处理由固件统一调度并隔离多任务,再通过算子库、图优化与多格式量化支持轻量化部署,减少计算单元间的数据搬运与调度成本。 

图片13.png

▲Imagination 应用工程总监艾克

5、硅芯科技赵毅:3D 芯片 EDA 是“无人区”,需要 STCO+AI 开路

硅芯科技创始人兼总经理赵毅博士指出,3D IC EDA 领域被视为"无人区"——2D 时代积累的设计方法学与工具链在三维堆叠场景下面临比较大的变革,需要重构工具链与设计范式。当前 3D DRAM 多层堆叠与存算芯片企业亟需一套全新工具链,信号、电源、热等多物理场仿真也需从单点后置转向协同前置。

芯片设计正从传统单芯片时代的 DTCO(芯片设计与硅工艺协同),向端到端深度协同的 STCO(系统-工艺协同优化)升级。硅芯科技 STCO 闭环协同流程贯通架构、设计、工艺与制造,将翘曲、电源完整性等量产风险前置管控。

同时,AI 将赋能 EDA 新范式。硅芯科技推出了 3Sheng Integration 平台,核心 AI Agent“Chips Z”实现自动迭代、闭环寻优等功能,显著压缩研发周期,加速芯片产品推向市场。 

图片14.png

▲硅芯科技创始人兼总经理赵毅博士

6、启芯宸光陈文超:以 DeepChip 平台推动 AI 赋能芯片设计全流程

启芯宸光副总裁、EDA 智算平台首席架构师陈文超介绍了 DeepChip 平台的技术布局与应用实践,分享了通过 AI 智能体、行业知识库与 EDA 工具协同,提升芯片设计、验证及测试效率的探索。

启芯宸光  DeepChip 平台涵盖 DeepEDA、DeepIP、DeepATE 与 DeepEDU 四大业务模块。DeepEDA 融合 EDA 智算平台与 AI²C 智能体平台,通过算力调度、参数优化和流程自动化提升设计仿真效率;DeepIP 接入本地或云端大模型,结合企业知识库与 EDA 工具,覆盖系统设计、RTL 生成、功能验证和调试优化;DeepATE 聚焦测试程序生成、测试向量转换与引脚自动匹配,提升芯片测试自动化水平;DeepEDU 则将产业级AI工具与真实项目引入教学实训,培养 AI 与芯片设计复合型人才。

通过演示搭建测试平台、完成指定驱动代码生成与验证的案例,呈现了 AI 辅助工程师减少重复工作、加快研发迭代的应用价值。 

图片15.png

▲启芯宸光副总裁、EDA 智算平台首席架构师陈文超

7、九天睿芯刘铮:HBF AI 芯片国内外研发竞速中

九天睿芯副总裁刘铮谈道,MoE 模型参数量越来越大,存储容量的重要性越来越高,基于 HBF 高带宽闪存的解决方案愈发重要,预计国内外厂商将在 2027 年上半年完成计算、存储层流片,HBF AI 芯片有望在 2027 年下半年推出。

在先进“存算+近存”的技术路线上,国内厂商探索出三维堆叠芯片设计方案,能够把 TB 级大模型权重置于超高容量存储层;结合 SRAM 存算一体技术,解决存储墙、功耗墙。该方案可支持超高参数量 MoE 大模型在云端推理场景和 AI 手机等智能终端场景落地应用,给用户带来更优的智能体验。

据刘铮分享,九天睿芯云端推理芯片可高效支持 FFN 阶段的计算,可独立或搭配其他 GPU 方案完成 Attention(注意力机制)阶段的处理,在系统层级形成 A/F 分离的高效异构计算方案。 

图片16.png

▲九天睿芯副总裁刘铮

8、安纳智芯向锐:现代模拟计算“一步”解矩阵方程,AI 训练少走弯路

安纳智芯联合创始人兼 CEO 向锐认为,矩阵方程求解是 AI 训练的重要数学基础,但数字芯片直接求解效率较低,工程上需将其转化为一系列矩阵乘法。同等精度下,现代模拟计算方案在运算速度和能效比上大幅超越先进数字芯片,为广泛的矩阵方程求解需求,提供了颠覆性的解决方案。

对此,安纳智芯提出“现代模拟计算”,利用天然并行的物理法则,将计算压缩至一步操作。2025 年,其方案实现 24 位定点精度,向锐称,这是世界首个全模拟高精度矩阵方程求解方案。

其芯片在应用上,面向云端,计划支持二阶优化器—现在几乎所有开源大模型厂商开始采用这类训练方法,降低大模型训练成本;面向端侧,则希望凭借近百倍能效优势支持后训练,并探索具身智能采训推一体化和在线自进化。 

图片17.png

▲安纳智芯联合创始人兼CEO向锐

四、Agent 推理需求爆发!AI 算力告别单一芯片 CPU、异构算力、RISCV 成下一程关键

随着智能体走向规模化落地,AI 产业正式迈入推理算力主导的全新发展阶段。区别于传统 AI 模型的交互模式,智能体具备自主决策、持续运行、长任务处理的特征,催生了指数级增长的推理算力需求,也让行业长期面临的 Token 供给不足、推理成本高昂、端云适配脱节等痛点愈发凸显。

在此产业变革关键节点,6 位嘉宾在 Agent 推理芯片高峰论坛上,聚焦推理芯片的落地痛点与产业未来路径,亮出了自家的前沿技术方案与实战经验。

1、光羽芯辰张晴:异构算力替代单一结构,公布端云协作和云端推理新路线

光羽芯辰联合创始人、董秘张晴称,AI 推理需求正迎来指数级增长,但推理侧的 Token 供给严重受限。为此,光羽芯辰提出通过 3D 堆叠、异构计算和存储分层,大幅增强端侧推理能力并推动能落地的端云协同,同时在云端通过 PD 分离大幅降低云端推理成本。

作为光羽芯辰解决方案的第一步,TC1000 系列芯片已量产部署,可在低功耗下高性能运行 35B MoE 模型。第二代 TC2000 系列将于明年量产,以更低的功耗服务于 AI 手机登手持式设备;第三代 TC3000 系列将专门面向超大规模模型的端侧部署和云端 PD 分离市场,目标是单芯片支持万亿参数模型,并降低 HBM 需求及云端推理成本。 

图片18.png

▲光羽芯辰联合创始人、董秘张晴

2、博伦智汇张磊:从“有卡”到“用好卡”,异构算力调度成关键一环

国内算力需求快速增长,但算力供给和需求之间存在大量缺口,存在大量 CPU 闲置问题。博伦智汇技术架构师、资深算力架构专家张磊认为主要原因在于异构 GPU 规模化部署后,软件生态和调度能力在国产芯片上的适配仍不完善。

对此,博伦智汇通过 DRA Proxy 连接厂商设备插件与 K8S,统一转换、补全设备信息并上报,实现异构GPU的资源发现与调度。同时,其自研 TOLD 架构面向 Token,以低时延、高吞吐、低成本为目标,进一步串联资源规划、资源管理与推理服务部署。

在此基础上,博伦智汇的 MIX调 度平台通过复用厂商设备插件,降低芯片接入成本,让不同厂商的 GPU 释放算力价值。 

图片19.png

▲博伦智汇技术架构师、资深算力架构专家张磊

3、灵睿智芯李华庆:智能体时代,CPU 将扛起 Agent Harness 大旗

灵睿智芯联合创始人兼副总裁李华庆认为,Agentic AI 正推动计算范式从以 GPU 为中心的计算密集型,转向以 CPU 为中心的控制密集型和 I/O 密集型。模型推理主要由 GPU 或其他 AI 芯片完成,长短期记忆管理、工具调用、多智能体调度和安全隔离等 Harness 环节则主要依赖 CPU。

在他看来,智能体的爆发会给 CPU 带来巨大机会。未来业务将越来越长尾化、碎片化,底层芯片需求也会千差万别。随着摩尔定律放缓、工艺红利变薄及能耗约束加剧,芯片仅靠工艺演进已不足以继续提升计算效率和能效,需要结合不同业务特性定制芯片。因此,智能体时代的 CPU 需要具备高性能、高并发、高可靠、AI 增强与可扩展性,而 RISC-V 则是最适合的指令集选择。

图片20.png 

▲灵睿智芯联合创始人兼副总裁李华庆

4、芯来科技胡振波:RISCV 是 AI 芯片时代最好的 ISA,NI 系列 IP 赋能 AI 芯片

芯来科技创始人、董事长胡振波提到,AI 芯片对通用辅助算力的需求日益增长,RISC-V 凭借开放、灵活的架构,可在 AI 芯片中承担主控核、算力核及启动核三类角色。其中,算力核的重要性正日益凸显。

今年,芯来科技推出面向 AI 推理的 NI1000 系列 RISC-V 处理器 IP,支持 1024 至 4096 位向量宽度,融合算力内核,以 RWV、VME、SFU 全域加速 AI 芯片发展。

相比仅传统 RVV 架构,RVV+VME 仅增加约 15% 的芯片面积,即可带来约 2.5 倍的矩阵运算性能提升,对比纯标量计算提升 100 多倍以上,NI 系列同时兼容现有 RVV 软件生态。胡振波认为,RISC-V 的开放性及自定义扩展能力,有助于 AI 芯片企业在共享软件生态的基础上实现差异化创新,降低开发和学习成本。

图片21.png 

▲芯来科技创始人、董事长胡振波

5、沨呵智慧丁阔:Token 工厂进入精益运营阶段,两大指标形成飞轮效应

沨呵智慧智算产品总监丁阔提到,围绕能耗、产能和售卖效率等维度,他们基于两大指标建立了 Token 工厂的运营指标体系。

其中 TEF(Token 效率因子)用来衡量 GPU 集群生产 Token 的效率,由 GPU 可用率、算力占用率和有效计算效率共同决定;TFI(Token 工厂指数)用于评估商用 Token 平台的售卖情况,将 TEF 与服务交付率、Token 售出率、价格实现率进行结合。

通过 TEF 和 TFI,Token 工厂可以形成飞轮效应,企业能够凭借对两大指标中参数的诊断和调整,从而改善 Token 业务的利润,满足企业经营的目标。沨呵智慧如今的产品交付形态已经从底层算力资源逐步走向标准化的 Token 产能。

图片22.png 

▲沨呵智慧智算产品总监丁阔

6、IO 资本俞枫:芯片创业机会相对平权,硬件公司需要懂模型、懂芯片、懂系统

IO 资本联合创始人俞枫对 AI 芯片及半导体创业比较乐观。他认为,Agentic AI 正处于指数级膨胀的过程,旧的生态壁垒正在加速瓦解。模型快速迭代的同时,AI 芯片的需求也走向差异化,大公司无法垄断所有创新场景,市场正在充分奖励创新带来的效能提升,创业公司获得了与大公司相对平权的机会。

随着机会增加,创业门槛比以前高得多,团队不仅要懂芯片,还要懂模型、懂工艺、懂系统。他谈道:“没有模型公司能预测未来两年会发生什么变化,但硬件公司却要提前下注,这对创业公司管理层判断提出了更高要求。” 

图片23.png

▲IO资本联合创始人俞枫

五、不止堆算力!具身智能产业还要拼架构与生态

具身智能正逐步从实验研究走向工业制造、家庭服务等实际应用,然而机器人端仍旧需要同时处理高维视觉信息、动态三维场景以及生成式的动作策略。面临计算量大、数据翻译频繁以及存储开销高、实时性要求严格和功耗受限等多重挑战,传统通用计算平台难以兼顾性能、能效和持续运行能力。

围绕AI芯片在具身智能赛道的落地,在具身智能芯片高峰论坛上,6 位嘉宾分享了各自的最新实践与思考。

1、复旦大学朱浩哲:具身智能的核心是物理世界下“理解行动”的实时闭环

复旦大学芯片与系统前沿技术研究院助理教授朱浩哲提出,具身智能的关键性能指标通常不是平均的 TOPS 或者吞吐率,专用芯片最终要服务机器人的端到端闭环。

报告从“感知—建模—决策—行动”闭环出发,分析三维场景表示、实时定位建图和视觉—语言—动作模型的计算特点。他介绍了三维高斯泼溅的训练、渲染与硬件加速方法,并讨论 VLA 模型的推理流程、实时性需求及部署挑战。结合团队在 3DGS、SLAM 和 VLA 芯片架构方面的研究,报告说明算法与体系结构协同设计的必要性,并就具身智能专用计算平台的发展方向展开交流。 

图片24.png

▲复旦大学芯片与系统前沿技术研究院助理教授朱浩哲

2、迈特芯谢齐家:以 3D-IC 芯片破解端侧 VLA 落地难题

迈特芯科技具身智能产品经理谢齐家分享了公司为解决端侧 VLA 模型落地而设计的 3D 芯片方案。他认为,目前 VLA 模型正在经历三大趋势:数据飞轮推动模型参数规模持续变大、快慢系统协同提升动作流畅度、Few-shot 模型将率先落地。在此背景下,端侧算力需在实时性、功耗、带宽之间实现平衡。

迈特芯核心技术为 3D-IC。在等带宽条件下,传统 2D 方案功耗最高约 40 多瓦,难以满足端侧要求,而 3D-IC 方案最高仅需约 7W。在 PPA 微架构上,传统 3D/2D IC 共用统一总线,数据需要先经总线 traffic 再分发至各 PE,耗时明显。迈特芯采用 3D 直连架构,让上层 IO 直接对应下层 PE,显著缩短带宽访问路径,带宽利用率可提升至80%以上。

此外,谢齐家还提到,针对 Transformer 的算术特性进行优化、避免算子间的 reshape overhead,是 PPA 提升的关键贡献点。 

图片25.png

▲迈特芯科技具身智能产品经理谢齐家

3、天数智芯夏广武:具身智能主控芯片下一步是“大小脑”融合

天数智芯边端产品线副总裁夏广武提出,后续大模型需要从数字世界走向物理世界,具身智能就是物理AI的具象化,而主控芯片就是物理AI的核心引擎。

在技术特点上,他提到当前是算力分层对应模型分层,大脑负责规划,小脑负责运控,大小脑在物理上是分离的,下一步会首先在物理上将二者合一;并简介了天数智芯在具身智能领域的产品布局和方案特点。就如何推进具身智能产业发展和落地,他总结了四个抓手:开放的软件栈平台及工具链、开发者生态社区、产业链协同发展、具身落地的工程化思考,并指出产业发展需小步快跑,重在跑通某一具体场景的端到端业务,积小成至大成。同时还需各方合作,建立人才培养资源池,夯实具身智能发展的基础。

图片26.png

▲天数智芯边端产品线副总裁夏广武

4、进迭时空陈俭东:RISCV 同构融合计算,打造机器人软硬同构算力平台

进迭时空芯片产品总监陈俭东认为,行业正迈入机器人计算机的新时代。当前具身机器人普遍采用多异构计算方案,存在软件生态割裂、数据反复搬运、硬件冗余、开发门槛高等痛点。

团队针对这些痛点,基于 RISCV 架构推进同构融合计算,依靠统一架构、内存和软件系统实现 CPU 算力、AI 算力和实时算力的按需分配。

目前,进迭时空两代芯片已量产发布。K1 为第一代,AI 算力为 2T;第二代 K3 为八核 CPU,主频达到 2.4G,AI 算力达 60T,支持部署 30B 模型。陈俭东透露,后续将开发更高平台算力的大小脑融合芯片。 

图片27.png

▲进迭时空芯片产品总监陈俭东

5、维泛智能殷积磊:不只拼算力,还要构建具身算力生态

维泛智能创始人兼 CEO 殷积磊指出,“大脑”芯片当前面临算力不足、能效失衡痛点,百 TOPS 算力只是具身大模型端侧运行的起步门槛,同时还需要兼顾 FP8、BF16、FP16 等混合精度计算,以及实时响应和 7×24 小时稳定运行。

为此,他提出仿生类脑芯片 BiGPU 架构,引入新的计算范式减少数据搬运和存储带来的能耗,并原生支持 FP8 及脉冲神经网络,适配具身场景下不同模型和计算任务。

殷积磊称,目前规划的芯片算力为 100~1000TOPS,但机器人芯片的竞争不只看峰值算力,还要看有效算力、能效和部署效率。未来,维泛智能将探索构建面向机器人的“Brain OS”,推动多方生态协同发展。 

图片28.png

▲维泛智能创始人兼CEO殷积磊

6、肇观电子周骥:降低视觉处理功耗和成本,有利于具身智能更快落地

具身智能落地的关键在于低功耗、低价格,而降低视觉处理的功耗和复杂度是其中关键的一环。作为生物进化的顶端,人类视觉给具身智能的视觉系统的设计提供了参考和启发。肇观电子 CTO 周骥认为,未来视觉芯片不应一味追求大吞吐与大分辨率,应利用时域信息与生成式模型提升性能。视觉系统和语言/运动之间以高度压缩的 Token 传递信息,用生成式模型来取代传统 ISP(传统信号处理),大分辨率图像只在需要对智能体行为进行解释时输出。

现阶段的视觉芯片有四大问题待解决:需补全机器人感知能力,缺失其他感官输入不利于降功耗;需要业界共同努力改变软硬件架构;VLM 在端上运行仍然很吃力;目前现有 Token 压缩效率相比人脑差距较大。

图片29.png

▲肇观电子CTO周骥

六、结语:奔赴智能体时代 AI 算力开启精细化、场景化新周期

从芯片架构革新、3D 堆叠先进制程,到 KV Cache 优化、异构混训混推等算法算力协同技术,再到智能体、具身智能全新推理场景的探索,2026 全球 AI 芯片峰会全方位覆盖当下 AI 算力产业的热点、难点与痛点议题。

当前,智能体技术的全面爆发,正在倒逼全球 AI 芯片产业格局迎来重构。过往单一的峰值算力指标,已无法适配大模型时代复杂的算力需求,数据存储、传输、交互、互联的全链条效率,以及功耗控制、成本可控性、工程化落地能力,共同定义了新时代 AI 芯片的“有效算力”。

随着架构创新持续深化、软硬件生态不断完善、场景落地持续渗透,AI芯片或进一步摆脱“重参数、高消耗、低效能”的发展瓶颈,实现算力、功耗、成本、场景的更优匹配。

放眼未来,AI 算力作为AI产业的核心底座,其迭代进化将持续牵引整个 AI 产业的发展走向。


文章信息来自于智东西,不代表白鲸出海官方立场,内容仅供网友参考学习。对于因本网站内容所引起的纠纷、损失等,白鲸出海均不承担侵权行为的连带责任。如若转载请联系原出处。

友情提醒:白鲸出海目前仅有微信群与QQ群,并无在Telegram等其他社交软件创建群,请白鲸的广大用户、合作伙伴警惕他人冒充我们,向您索要费用、骗取钱财!


分享文章

扫一扫 在手机阅读、分享本文

4596
{{votes}}
分享文章

扫一扫 在手机阅读、分享本文

4596
{{votes}}

要回复文章请先登录或注册

与CEO聊合作

(备注姓名、公司及职位)