收藏文章 楼主
绕过了CUDA?DeepSeek的论文惹争议
网友【chuang】 2025-01-29 14:05:38 分享在【时代发展的印记】版块    1    22

英伟达刚刚从DeepSeek-R1引发的4万亿元暴跌中缓过劲来,又面临新的压力?

网友分享在meiguo.com上的图片

硬件媒体Tom‘s Hardware带来开年最新热议:

DeepSeek甚至绕过了CUDA,使用更底层的编程语言做优化。

网友分享在meiguo.com上的图片

这一次是DeepSeek-V3论文中的更多细节,被人挖掘出来。

来自Mirae Asset Securities Research(韩国未来资产证券)的分析称,V3的硬件效率之所以能比Meta等高出10倍,可以总结为“他们从头开始重建了一切”。

在使用英伟达的H800 GPU训练DeepSeek-V3时,他们针对自己的需求把132个流式多处理器(SMs)中的20个修改成负责服务器间的通信,而不是计算任务

变相绕过了硬件对通信速度的限制。

网友分享在meiguo.com上的图片
DeepSeek-V3 Technical Report

这种操作是用英伟达的PTX(Parallel Thread Execution)语言实现的,而不是CUDA。

PTX在接近汇编语言的层级运行,允许进行细粒度的优化,如寄存器分配和Thread/Warp级别的调整。

这种编程非常复杂且难以维护,所以行业通用的做法是使用CUDA这样的高级编程语言。

换句话说,他们把优化做到了极致。

有网友表示,如果有一群人嫌CUDA太慢而使用PTX,那一定是前量化交易员。

网友分享在meiguo.com上的图片

一位亚马逊工程师提出灵魂质问:CUDA是否还是护城河?这种顶尖实验室可以有效利用任何GPU。

网友分享在meiguo.com上的图片

甚至有网友开始畅想,如果“新源神”DeepSeek开源了一个CUDA替代方案……

网友分享在meiguo.com上的图片

那么事情是否真会如此?

DeepSeek真的绕过了CUDA?

首先要明确的是,PTX仍然是英伟达GPU架构中的技术,它是CUDA编程模型中的中间表示,用于连接CUDA高级语言代码和GPU底层硬件指令。

PTX类似汇编语言,代码大概长这样:

网友分享在meiguo.com上的图片
来自tinkerd.net

在实际编译流程中,CUDA代码首先被编译为PTX代码,PTX代码再被编译为目标GPU架构的机器码(SASS,Streaming ASSembler)。

CUDA起到了提供高级编程接口和工具链的作用,可以简化开发者的工作。而PTX作为中间层,充当高级语言和底层硬件之间的桥梁。

另外,这种两步编译流程也使得CUDA程序具有跨架构的兼容性和可移植性。

反过来说,像DeepSeek这种直接编写PTX代码的做法,首先不仅非常复杂,也很难移植到不同型号的GPU。

有从业者表示,针对H100优化的代码迁移到其他型号上可能效果打折扣,也可能根本不工作了。

网友分享在meiguo.com上的图片

所以说,DeepSeek做了PTX级别的优化不意味着完全脱离了CUDA生态,但确实代表他们有优化其他GPU的能力。

事实上,我们也能看到DeekSeek已经与AMD、华为等团队紧密合作,第一时间提供了对其他硬件生态的支持。

网友分享在meiguo.com上的图片

One More Thing

还有人提出,如此一来,让AI擅长编写汇编语言是AI自我改进的一个方向。

网友分享在meiguo.com上的图片

我们不知道DeepSeek内部是否使用AI辅助编写了PTX代码——

但是确实刚刚见证DeepSeek-R1编写的代码显著提升大模型推理框架的运行速度

Llama.cpp项目中的一个新PR请求,使用SIMD指令(允许一条指令同时处理多个数据)显著提升WebAssembly在特定点积函数上的运行速度,提交者表示:

这个PR中的99%的代码都是由DeekSeek-R1编写的。我唯一做的就是开发测试和编写提示(经过一些尝试和错误)。

是的,这个PR旨在证明大模型现在能够编写良好的底层代码,甚至能够优化自己的代码。

网友分享在meiguo.com上的图片

llama.cpp项目的创始人检查了这段代码后表示“比预期的更爆炸”。

网友分享在meiguo.com上的图片

参考链接:
[1] https://www.tomshardware.com/tech-industry/artificial-intelligence/deepseeks-ai-breakthrough-bypasses-industry-standard-cuda-uses-assembly-like-ptx-programming-instead
[2] https://x.com/bookwormengr/status/1883355712191123666
[3] https://tinkerd.net/blog/machine-learning/cuda-basics/
[4] https://www.amd.com/en/developer/resources/technical-articles/amd-instinct-gpus-power-deepseek-v3-revolutionizing-ai-development-with-sglang.html
[5] https://x.com/ggerganov/status/1883888097185927311

编译:梦晨、西风

出处:见配图右下角

meiguo.com 发布人签名/座右铭我已经有美国绿卡了,只差美果绿卡啦!
大家都在看
楼主新近贴
回复/评论列表
默认   热门   正序   倒序
meiguo.com 创始人

emotion

22   2025-01-29 14:05:38  回复

回复/评论:绕过了CUDA?DeepSeek的论文惹争议

暂无用户组 升级
退出
等级:0级
美果:
美过
精华推荐
  1. 麻省理工学院发布AI学习平台“MIT Learn”
  2. 川普总统“访华表态”继续反复
  3. 蔡文胜的2025大动作之五,香港投资版图在持续扩张!
  4. 选择西雅图、圣地亚哥还是洛杉矶?全面对比“三城生活”
  5. 先交押金!美国重启了“签证保证金”试点计划
  6. 中国🇨🇳开始质疑英伟达芯片“存后门”
  7. 工作日没空?周末集中运动同样有益健康!
  8. 加州州长竟然模仿川普总统的风格发帖,粉丝数和支持率“都涨了”!
  9. 白宫开通了TikTok 账号,传播政策信息!
  10. 全美房地产市场在趋向中性,区域分化明显!
  11. 川普政府的对华政策突然改变了?
  12. 香港永居 vs 美国国籍:身份选择背后的生活考量
  13. 川普总统的态度突变,暗示乌克兰应该反击俄罗斯本土?
  14. 疯狂打压华人精英,勒令华人CEO辞职… 川普政府的致命错误?
  15. 华人留学生“索赔1亿美元控诉”大学期间的农药伤害
  16. 为激励员工,OpenAI打算豪掷96亿美元!
  17. ICE抓捕的非法移民中,中国人数量激增?
  18. 房子属于你,但你得付费受他们管着!关于美国HOA
  19. 在美国可以感受欧洲风情的五座小镇
  20. 2025年度的美国公立高中排名发布,咱只关注前三!
  21. 川普政府在力推药价改革和数字医疗系统
  22. 中美经贸谈判重启,瑞典磋商和商界代表团访华“双管齐下”
  23. 核聚变技术或将成为黄金价格的颠覆者
  24. 植物油更健康?动物油脂摄入或将加速肿瘤生长
  25. 中美连谈5小时,川普总统公开感叹“中国太强硬”… 英伟达在加紧扩大芯片出口量
  26. 广西防城港“奔驰女司机事件”引发全网热议
  27. 川普家族竟然靠它狂揽45亿美金!操盘手是赵长鹏?
  28. 华人科学家身陷“杀猪盘”,短短数月就被掏光250万美元积蓄!
  29. 川普总统签署了“对等关税令” 引发全球震荡
  30. 持中国大陆护照在申请美国签证的注意事项更新(2025年8月版本)
  31. 突然“失去住持”的少林寺情况如何了?
  32. 敌友即友?马斯克和扎克伯格开始接触,图谋合伙收购OpenAI?
  33. 美国年轻人的“中国观”悄然转变
  34. 苹果投资了6000亿美元,加速“美国制造”计划!
  35. 美国华裔二代坦言:中国发展现状,让父辈移民后悔了!
  36. 盘点“数字游民”的精选停留地!2025“逃离美国”指南

美国动态 美果搜索

Your IP: 216.73.216.186, 2025-08-31 12:16:37

Processed in 0.35257 second(s)

头像

用户名:

粉丝数:

签名:

资料 关注 好友 消息
已有0次打赏
(22) 分享
分享
取消