WAIC 2026 的信号:AI 的下半场不再是比模型大小,而是比工程化能力
乌鸦小编 发表于:2026-8-4 20:21 复制链接 发表新帖
阅读数:289
7 月刚结束的 WAIC 2026 释放了一个再明确不过的信号:AI 的竞赛,已经从「比谁模型大」转向「比谁落地深」。其中大会六大核心议题,从超节点算力、具身智能、大模型演进,再到端侧 AI、AI 治理、Token 经济,彰显了国内 AI 技术在四个领域的重要突破:

第三,模型方面聚焦真实场景落地,AI 竞赛从模型参数转向价值落地;

第四,前沿技术方面脑机接口推动三元智能发展,量子计算迈向工程化交付拐点。

在 WAIC 大会上,「算力有效利用率」被反复提及 — 芯片买了一堆,实际利用率却低得可怜,这是几乎所有企业的痛点。算力的下半场,拼的不是谁芯片多,是谁能把每一张卡的价值榨干。

在 AICon 深圳站「AI Infra、推理工程与异构计算」专题,这场会议讲者的演讲主题揭示了 AI 落地的真实路径:腾讯分享《从 LLM RL 到 Diffusion RL:统一多模态 RL 基础设施实践》,完整呈现 UniRL 从架构设计、自研算子、训推一致性到异步引擎的全链路工程实践。

范式智能分享《从 HAMi 到 HAMi-DRA:异构环境的算力资源管理实践》,从 Kubernetes 设备资源模型演进的视角出发,介绍范式以及 HAMi 社区在异构设备管理的面临的挑战和实践,展示如何基于 DRA 构建面向 AI 工作负载的可扩展 GPU 调度方案。

阿里巴巴 Qwen 团队分享《面向 Qwen 系列模型线性注意力的高性能优化实践》,详细介绍 Qwen 团队提出的 FlashQLA — 基于 TileLang 的高性能线性注意力算子库,如何实现前向 2-3 倍加速、反向 2 倍加速。

华为 2012 实验室分享《盘古训练与推理通信优化实践:亲和昇腾平台的性能探索》,围绕昇腾平台的两类通信优化展开,展望如何通过昇腾亲和实现最优的通算掩盖。

这些演讲主题透露的信号是:国内 AI 公司已经从「参数竞赛」转向「推理工程 + 训练基础设施 + 异构资源调度」的工程化深水区。在新的竞争维度里,谁能把每一张卡的价值榨干、谁能解决多模态 RL 的训推一致性、谁能做好昇腾的通算掩盖,谁就能在 AI 下半场占据优势。

从企业层面看,AI 下半场的赢家将不再是模型层的「独角兽」,而是「AI 工具店」型公司 — 为大模型厂商提供 GPU 调度、推理优化、训练框架、监控告警、安全审计等基础设施。这些是大模型能够稳定运行的基石,也是大模型厂商不愿意自己做的脏活累活。

反常识的判断是:AI 下半场最大的机会不在新模型,而在推理优化 — 一个 100% 利用率的 GPU 集群,比一个跑不满的 10 倍规模集群更有商业价值。模型层差距在缩小,工程层的差距在拉大。

另一个反常识观察是:国内 AI 厂商的工程能力已经接近或超越国际同行。腾讯 UniRL、阿里 FlashQLA、华为盘古通信优化、范式 HAMi-DRA,这些项目的工程深度已经不输 PyTorch / vLLM 主线开发,国内 AI Infra 的下一步是「开源反哺国际」。

对国内 AI 创业者的启示是:2026 年的 AI 创业不要只盯模型层,要在 Infra / 推理 / 调度 / 通信优化上找差异化。每一篇 WAIC 演讲主题背后都是一个值得深挖的产品方向 — GPU 调度、线性注意力算子、多模态 RL 框架、Agent 推理引擎,这些都是「卖水人」赛道。以 GPU 调度为例,国内每年新增上百亿 AI 算力采购,但平均利用率不到 40%,这中间的缺口等于数百亿的潜在市场。

创业找资源,上乌鸦部落
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落