业界

从夏令营到算子实战营,沐曦股份正在补上国产算力生态的“人才底座”

AI行业这两年最不缺的是什么?

模型、Agent、应用,甚至GPU本身。

但如果把视线再往下挪一层,会发现一个容易被忽略的问题:

越来越多的人会“调用”GPU,却未必真的会“开发”GPU。

尤其进入推理时代之后,模型规模、Token数量不断增长,算力成本越来越成为AI产业绕不开的问题。很多时候,决定一张GPU到底能跑多快的,并不只是芯片本身,还包括编译器、算子、框架以及整个软件栈。

这也是为什么,最近国产算力圈里,“算子开发”开始越来越频繁地出现在开发者培训、开源项目和人才培养活动中。

而沐曦最近一连串的动作,似乎也在释放一个比较明确的信号:

国产GPU生态的下一场竞争,可能不仅是芯片性能的竞争,更是开发者和底层软件人才的竞争。

从夏令营到训练营,国产GPU正在“卷”开发者

今年以来,沐曦在开源和开发者生态上的动作明显密集了起来。

3月,沐曦北京AI研究院暨“企业开源中心”启动,释放出进一步强化开源生态建设的信号。

随后,围绕国产GPU底层开发,沐曦又陆续参与了TileLang Puzzle开源训练营、与魔搭社区开展开源实战挑战赛,并推出面向青年开发者的算子优化赛事。

其中,今年6月结束的首期TileLang Puzzle开源训练营,吸引了551名开发者参与,线上实践累计超过3万小时。

到了8月,这种“培训+实战+开源”的模式又进一步向高校人才延伸。

首届开源英才夏令营共有117所高校、317名学生报名,最终40名学生入营。5天时间里,学员围绕真实的国产GPU算子任务,从开发适配、测试验证、性能分析一路做到代码优化和成果答辩。

如果把这些活动串起来看,就会发现一个有意思的变化:

沐曦做的似乎已经不只是“教开发者怎么用GPU”,而是在尝试把开发者进一步带到GPU软件栈更底层。

而这次新推出的“多范式算子开发实战营”,则把目标进一步指向了一个更具体的能力——算子开发。

为什么偏偏是算子?

对于普通AI应用开发者来说,“算子”可能是一个有点陌生的词。

但对于AI Infra工程师来说,它几乎就是绕不开的底层能力。

以GEMM、FlashAttention这类核心算子为例,它们直接参与大模型训练和推理过程。理论上的芯片峰值性能,并不意味着实际业务就能跑到这个水平,中间还隔着大量的软件优化工作。

简单说:

芯片决定“能跑多快”,算子决定“能不能把这份性能真正跑出来”。

过去,开发者可能更多是在成熟框架里调用已有算子。

但随着国产GPU生态逐渐丰富,问题开始发生变化。

不同GPU架构、编译器和软件栈之间存在差异,一个算子如何实现、如何迁移、如何调优,正在成为越来越实际的工程问题。

这也意味着,未来真正稀缺的可能不是“会调用PyTorch”的人,而是能够理解硬件执行逻辑、掌握算子开发、进行性能分析,并且能够在不同异构平台之间完成适配的人。

换句话说:

AI Infra的人才需求正在从“会用”向“会造”往下走。

这次实战营,重点其实不是“再学一个工具”

即刻报名,锁定你的实战营席位:

https://developer.metax-tech.com/activities/29

从课程设计来看,这次实战营有一个比较值得注意的地方:

它没有把重点放在单一工具的教学上。

课程会横向涉及九齿、Triton、TileLang等不同算子开发范式,让开发者去理解不同工具背后的编程逻辑和适用边界。

这和传统的“XX工具入门课”其实不太一样。

后者解决的是:

这个工具怎么用?

而多范式学习真正想解决的问题是:

面对不同硬件、不同算子、不同性能目标,我应该选择什么样的开发方式?

这也是算子开发真正难的地方。

毕竟,学会一套API不等于掌握算子开发。

如果只会一种工具,换一个平台可能就得重新开始;如果理解的是算子背后的计算逻辑、硬件执行机制和性能优化方法,那么迁移到另一套异构环境时,才真正有“举一反三”的能力。

更有意思的是:这次直接把国产GPU放进了训练环境

这次实战营还有一个比较现实的设计:

不让学员自己解决“算力从哪里来”的问题。

课程会提供沐曦C系列GPU环境和免费算力券,开发者可以直接在线完成代码开发、编译和性能测试。

对于想进入AI Infra领域的人来说,这其实解决了一个很现实的门槛。

很多底层开发学习的第一步往往不是写代码,而是:

找GPU、配环境、装驱动、配软件栈……

最后还没开始写算子,半天时间已经过去了。

把这些基础设施直接准备好之后,开发者可以把更多时间放在真正的技术问题上:

一个算子为什么这么写?

为什么这个版本跑得更快?

性能瓶颈究竟在哪里?

换一套GPU架构之后,应该怎么适配?

这才是这类训练营真正有价值的地方。

从“写出来”到“跑得快”,才是算子开发的完整闭环

从课程安排来看,这次实战营大致可以理解成四个阶段:

第一阶段,是建立底层认知。

先理解国产GPU的软件栈和开发环境,而不是一上来就写代码。

第二阶段,是多范式实践。

从向量加法、ReLU等基础算子入手,体验不同开发范式的差异。

第三阶段,是进入真正的大模型算子。

GEMM、FlashAttention等复杂算子将成为重点,同时结合性能分析工具进行瓶颈定位和优化。

第四阶段,则是AI Agent加入算子开发。

从代码生成、正确性验证到性能优化,把Agent放进算子开发流程中。

最终,学员还需要完成实际的开源项目任务,而不是停留在课程Demo层面。

这套路径背后的逻辑其实很清楚:

理解原理 → 写出算子 → 跑通算子 → 找到瓶颈 → 优化算子 → 集成到真实项目。

这比单纯学一套语法,更接近真正的工程实践。

国产算力生态,开始进入“人才争夺战”?

如果把视野拉得更大一些,这一系列动作背后其实对应着国产算力生态一个越来越现实的问题:

硬件可以研发,软件可以开源,但生态最终还是需要人来建设。

GPU厂商之间的竞争,也正在从单纯的芯片参数,逐渐延伸到软件栈、开发工具、开源社区以及开发者数量。

从目前沐曦公开的动作来看,它正在尝试把几个环节串起来:

开源软件栈 → 开源项目 → 开发者社区 → 训练营/赛事 → 高校人才培养 → 真实项目实践。

其开发者社区目前已经覆盖软件栈、编程资源、开源项目、解决方案等多个方向,GitHub/Gitee等公开代码仓库也在持续更新。

而首届开源英才夏令营结束之后,沐曦方面也公开提到,从开源社区实践、校企联合培养到进一步的人才计划,正在形成一条面向青年技术人才的培养路径。

所以,这次实战营真正值得关注的,可能并不是“又一个GPU培训班”。

而是一个更大的趋势:

国产算力生态正在试图把开发者从“用户”变成“参与者”。

从算力使用者,到算力建设者

这或许也是为什么,这次课程把标题定成了:

“别只做算子调用者。”

因为当AI越来越深入基础设施层,真正决定生态能不能跑起来的,终究不是有多少人会调用一个API,而是有多少人能够参与底层技术的开发、优化和贡献。

9月4日开放报名,9月13日正式开营,课程周期约3周。

对于已经有GPU编程、AI系统、编译器或者大模型开发基础的人来说,这类课程最大的价值,或许不是“学会三个工具”,而是借此机会真正把视线往AI技术栈的更底层推进一步。

毕竟,国产算力生态真正缺的,从来不只是芯片。

还缺一群愿意把芯片“用好”、把软件“写好”、把生态一起“做起来”的人。

这次实战营,某种程度上也是在回答这个问题:

当越来越多人开始使用国产GPU之后,谁来写下一代国产GPU上的算子?

答案,也许就藏在这些正在进入AI Infra底层的年轻开发者里。

(0)

本文由 计算杂谈 作者:云中子 发表,转载请注明来源!

关键词:
LensNews

热评文章

发表评论