AI是否打破了NVIDIA的CUDA护城河?Infinity在10小时内究竟构建了什么
Infinity 的 Ignition 智能体据称在约 10 小时内将矩阵乘法迁移到 d-Matrix Corsair,并达到芯片实测上限的 92%。这不是重建 CUDA,而是说明编码智能体正在缩短新芯片软件适配周期。

AI是否打破了NVIDIA的CUDA护城河?Infinity在10小时内究竟构建了什么
引言
NVIDIA的CUDA护城河被宣告终结的次数之多,几乎已成为行业的一种仪式。
一个新的加速器问世。一个编译器进入公开测试阶段。一家云服务商推广自己的AI芯片。一种编程抽象承诺可移植的内核。有人宣布开发者不再需要手写CUDA。
然而,CUDA依然在下一代AI基础设施中占据核心地位。
最新的挑战之所以更有意思,是因为它来自AI本身。
Infinity,一家由前Google Brain研究员Jeremy Nixon创立的AI基础设施初创公司,声称其Ignition智能体将推理软件栈的重要组成部分迁移到了陌生的d-Matrix Corsair加速器上,其速度远超传统工程流程。
最引人注目的结果是:在大约10小时内,Ignition就在全部32个计算单元上实现了张量并行的矩阵乘法,并达到了该芯片实测计算上限的92%。
这是一个有意义的结果。但这并不等于在10小时内重建了CUDA。
Infinity自己的案例研究指出,完整的端到端Qwen3推理路径耗时约10天,每个所需操作都针对新硬件重新编写。而CUDA并非一个矩阵乘法实现或一个模型运行时。它是一个成熟的平台,包含编译器、运行时、库、性能分析和调试工具、通信系统、框架集成、文档,以及近二十年的生产经验。
更好的问题不是AI是否在一夜之间复制了CUDA。
而是编码智能体能否大幅缩短让一款新AI芯片变得有用的时间。
答案越来越倾向于“能”。

CUDA的护城河从来不只是GPU
NVIDIA最为人熟知的是硬件:H100、Blackwell、Rubin,以及围绕它们构建的大型系统。
其最持久的优势是围绕硬件构建的软件。
CUDA全称是计算统一设备架构。NVIDIA将其描述为加速计算平台,而非仅仅是一种编程语言。
CUDA平台包括:
- GPU编程模型。
- 编译器工具链。
- 运行时库。
- 驱动接口。
- 高度优化的数学和AI库。
- 调试和性能分析工具。
- 多GPU通信软件。
- 框架集成。
- 文档、培训和代码示例。
- 庞大的开发者与合作伙伴生态系统。
在底层,CUDA让工程师能够编写直接在NVIDIA上执行的内核
GPU。
在其之上是诸如 cuBLAS、cuDNN、cuFFT、NCCL、TensorRT 和 TensorRT-LLM 等库。在库之上则是 PyTorch、TensorFlow、JAX、推理服务器、研究代码以及公司内部系统。
一个简化的视图如下所示:
应用程序与AI框架
↓
优化库与分布式系统
↓
编译器、运行时、性能分析器、调试器与内核
↓
NVIDIA GPU 与互联技术
企业不仅仅因为熟悉 CUDA 语法而留在 NVIDIA 生态,而是因为模型、测试、部署系统、性能预期、调试流程以及生产团队都已经依赖于整个技术栈。
更换硬件可能远不止翻译源代码那么简单,它可能需要重建信心。
Infinity 在 10 小时内实际做了什么
Infinity 的官方案例研究比广为流传的标题更加严谨。
该公司与 d-Matrix 合作,后者是一家专注于生成式 AI 推理硬件的初创公司。其 Corsair 加速器采用了与 NVIDIA GPU 不同的架构和指令集。Infinity 表示,这款芯片几乎没有公开的软件历史可供通用编程模型直接从训练数据中复现。
Ignition 获得了硬件信息,并开始生成运行 AI 工作负载所需的底层软件。
据 Infinity 称,在大约 10 小时内,该系统实现了:
- 张量并行矩阵乘法。
- 在所有 32 个 Corsair 计算单元上执行。
- 达到高达 92% 的“光速”性能。
Infinity 将“光速”定义为生成内核所实现的芯片可达到计算峰值的比例。已发布案例研究中的经验上限本身约为理论峰值的 90%。
这是一个出色的内核快速启动结果,但并非完整的、等同于 CUDA 的平台。
十小时:高性能矩阵乘法
矩阵乘法是 Transformer 推理的核心,但它只是操作类别中的一种。
完整的模型还需要注意力机制、归一化、激活函数、路由、量化、KV 缓存管理、采样、张量移动、状态处理以及模型服务等额外工作。
十天:端到端模型推理
Infinity 表示,在大约 10 天内,Qwen3 已经在 Corsair 上端到端运行。其后来的融资公告称,在该时间段内,三个前沿模型已端到端运行,且内核从头编写。
这一更长的时间线依然令人印象深刻。
将一款陌生的加速器从基本操作推进到可运行的模型运行时,从数月缩短到数天,可能会从根本上改变推出新硬件的经济效益。
| 说法 | 更精确的解读 |
|---|---|
| “AI 在 10 小时内重造了 CUDA” | 夸大其词 |
| 矩阵乘法在 10 小时内运行 | Infinity 报告 |
| 性能达到经验上限的 92% | Infinity 报告 |
| Qwen3 在约 10 天内端到端运行 | Infinity 报告 |
| Infinity 正在构建通用推理库 | Infinity 已确认 |
| 完整 CUDA 生态系统已被复现 | 否 |
Ignition 是一个自动化内核与推理工程 Agent
Infinity
将Ignition称为AI研究代理。
其目的是生成并改进底层软件,将模型运算转化为在特定芯片上的高效工作。
这一循环类似于自动化的性能工程流程:
生成代码
→ 编译
→ 在硬件上运行
→ 测试正确性
→ 测量性能
→ 诊断瓶颈
→ 修改实现
→ 重复

人类工程师仍然提供目标、硬件信息、约束条件、验收标准和高层方向。Ignition则执行大量重复性的搜索和优化工作。
这类任务非常适合代理处理,因为环境能产生异常清晰的反馈。
生成的核函数可以针对具体问题进行评估:
- 能否编译?
- 能否运行?
- 数值输出是否正确?
- 是否稳定?
- 达到了多少硬件性能?
- 最新更改是否改善了结果?
硬件和测试提供了客观事实依据。
为什么核函数工程是代理的理想问题
许多软件任务的验收标准存在模糊性。核函数优化虽然困难,但其中部分环节是可量化的。
一个有效的实现必须满足两个独立的标准。
正确性
核函数必须在可接受的数值容差范围内产生输出。
性能
核函数必须足够高效地利用目标硬件,以证明替代现有实现是合理的。
代理可以生成数百个候选方案,拒绝不正确的方案,对存活的方案进行基准测试,并不断优化最强的路径。
同样的模式也出现在NVIDIA专注于CUDA的代理、INT21的PTX Kernel Factory、DeepSeek的TileKernels工作,以及生成Triton或TileLang核函数的研究系统中。
最近的变化在于,基础模型现在可以参与更完整的循环,而不仅仅是填补几行语法代码。
Infinity以1亿美元估值融资1500万美元
Infinity的技术故事吸引了投资者。
该公司于2026年7月宣布完成一轮1500万美元的种子轮融资,据报道投后估值为1亿美元。Touring Capital和Principal Venture Partners参与了投资,此外还有芯片行业高管和与主要AI实验室相关的研究人员。

Infinity正在为硬件供应商和推理服务提供商构建一个模型感知的推理软件层。其既定工作流程实际上是:
硬件规格
→ 生成的生产级推理软件
Infinity还据报道已生成一个
NVIDIA推理引擎从零开始构建,在Qwen3-8B上比配置匹配的vLLM实现性能高出多达34.3%。
该结果由公司自行报告,且依赖于硬件、批处理设置、模型配置和测量方法。尽管如此,这表明Infinity的雄心远不止于基础芯片启动。
DeepSeek TileKernels需要同样的精度
原文还提到了DeepSeek的TileKernels仓库。
TileKernels是一个使用TileLang编写的优化GPU内核库,TileLang是一种基于Python的领域特定语言,用于高性能内核开发。
该仓库包含以下操作:
- 混合专家(MoE)门控。
- MoE路由。
- FP8和FP4量化。
- 转置。
- Engram门控。
- 流形超连接(Manifold HyperConnection)。
- PyTorch自动求导封装。
DeepSeek表示,许多内核在计算强度或内存带宽方面已接近硬件极限,部分内核已在内部使用。
TileLang减少了工程师必须手动编写的底层CUDA C++代码量。
就其当前形式而言,它并未表明DeepSeek已消除对NVIDIA技术栈的依赖。
官方TileKernels当前要求包括:
NVIDIA SM90或SM100 GPU
CUDA Toolkit 13.1或更高版本
PyTorch 2.10或更高版本
TileLang 0.1.9或更高版本
当前库是为最新的NVIDIA架构设计的。它减弱了对手工编写CUDA源代码的依赖,但并未减弱对NVIDIA硬件或CUDA工具包的依赖。
TileLang的范围比当前DeepSeek库更广
TileLang本身有更广泛的雄心。
该项目描述了一种基于TVM编译器基础设施、使用Python风格语法为GPU、CPU和加速器内核设计的平铺(tiled)编程模型。
其目标是将工程师想要的数据流与高效执行所需的底层调度分离。
TileLang一直在添加多后端语言支持以及涉及CUDA、ROCm和Metal的硬件路径。
这种可移植性可以降低供应商之间的切换成本,但前提是生成的结果正确、稳定、可调试,并且与供应商库相比具有竞争力。
一个到处都能运行但性能不佳的内核并不能替代生产环境中的CUDA路径。
正确的代码仍可能慢数百倍
2026年7月的一篇研究论文考察了Triton和TileLang中内核正确性与替代质量之间的差距。
作者发现,内核可以通过数值正确性测试,但性能远低于优化基线。据报道,一个TileLang LayerNorm实现尽管通过了正确性检查,运行速度却比PyTorch基线慢300倍以上。
该论文并非反对TileLang,而是主张从两个维度评估生成的内核:
正确性
+
硬件效率
代码生成正变得越来越快。但证明生成的代码足以替代成熟的生产软件仍然困难。
推理是第一大主战场
对CUDA的挑战在推理领域比在前沿模型训练领域更具可信度。
训练优先考虑最大规模和稳定性
大规模训练运行可能涉及数千或数万个
数十个加速器协同运行数周或数月。
训练平台必须处理跨大量设备的分布式通信、检查点、故障恢复、内存管理、并行性、可复现性和调试。
一次硬件或软件故障可能浪费大量算力。因此,各机构在将重要训练负载从成熟系统迁移时往往非常谨慎。
CUDA、CUDA-X 库、NCCL、PyTorch 支持以及 NVIDIA 集成的网络能力,使该公司在这一领域拥有强势地位。
推理优先关注每个有用答案的成本
推理是在模型完成训练之后提供服务的环节。
相关的业务指标通常更接近:
可接受的输出质量
÷
总服务成本
推理可以分布在单个加速器、小型集群、大规模机群和专用硬件上。
新芯片并不需要在所有场景中取代 NVIDIA。它可能只需要证明某个模型或负载在成本更低、速度更快、功耗更低、吞吐量更高或延迟更可预测方面具有优势。
这一更窄的目标为专用硬件提供了现实的切入点。
d-Matrix 围绕生成式 AI 推理而构建
d-Matrix 成立于 2019 年,专注于推理加速。其 Corsair 平台利用大量片上 SRAM,旨在降低运行生成模型的成本和能耗。

Infinity 的工作解决了新加速器面临的经典问题之一。
一颗芯片可能拥有很有前景的硬件,但在内核、模型执行、内存处理、量化、服务逻辑和集成方案就绪之前,客户无法高效使用它。
如果智能体能够将这一启动过程从数月压缩到数天,硬件初创公司就能在接近模型发布时提供支持,并更早地展示硬件能力。
这削弱了 NVIDIA 软件优势的一部分,但并未消除全部优势。
其他厂商也在瞄准同样的突破口
推理市场包含多个挑战者:
| 厂商或平台 | 总体定位 |
|---|---|
| Rebellions | 专用 AI 推理加速器和系统 |
| Cerebras | 用于训练和推理的晶圆级系统 |
| AWS Inferentia | 亚马逊设计的推理芯片,使用 Neuron SDK |
| Google TPU | 通过 XLA 和主流框架支持的谷歌加速器 |
| AMD Instinct | 使用 ROCm 平台的数据中心 GPU |
| d-Matrix | 以 SRAM 为核心的生成式 AI 推理加速 |
| NVIDIA | GPU 及 CUDA 加速计算栈 |
压力来自让用户无需手动重写每个操作即可部署模型的软件层,包括 AWS Neuron、Google XLA、AMD ROCm、Modular MAX 和 Mojo、TileLang、Triton 以及 AI 生成内核系统。
这些软件层自动化的内容越多,应用程序开发人员需要手动介入的次数就越少。
直接关于CUDA的内容。
跨芯片软件可以降低锁定效应
当应用程序及其优化内核与NVIDIA硬件紧密绑定时,CUDA的锁定效应最为强烈。
一个可移植的推理层旨在实现以下工作流程:
模型
→ 可移植执行层
→ 生成或选择硬件内核
→ 目标加速器
现实世界更加复杂,因为不同芯片具有不同的内存层次结构、数值格式、互连方式、调度行为和支持的操作。
高性能通常仍然需要针对特定硬件的工作。
Infinity的核心观点是,智能体可以自动生成这种专业化的工作。
CUDA的护城河不仅仅是现有代码
10小时的结果并不能复制那些使CUDA难以被替代的资产。
这些资产包括:
成熟的库
许多组织使用供应商库而不是直接编写内核。cuBLAS、cuDNN、TensorRT、NCCL和其他库蕴含了多年的优化经验。
调试与分析工具
NVIDIA Nsight及相关工具帮助工程师理解正确性、内存行为、时间线、通信和性能。
框架支持
新模型特性通常会及早针对NVIDIA硬件进行集成和优化。
部署知识
生产团队了解NVIDIA系统在负载下的行为表现。
文档与培训
该生态系统包含示例、课程、会议演讲、社区解答和专家资源。
现有投资
企业拥有数百万行代码、测试、采购流程和员工技能与该平台绑定。
AI可能降低翻译成本,但不会自动消除组织层面的切换成本。
验证可能成为下一个CUDA护城河
INT21创始人、曾任NVIDIA收购的HippoML创始人的Bing Xu认为,验证是主要瓶颈。

智能体可以快速生成代码。但生产团队仍需证据证明它:
- 产生正确的数值输出。
- 适用于各种形状和数据类型。
- 处理边缘情况。
- 不会破坏内存。
- 在并发下保持稳定。
- 在各种工作负载下表现良好。
- 能够应对驱动程序和硬件变更。
- 与软件栈的其他部分正确交互。
NVIDIA已经拥有大量的合规性测试、性能测试、参考实现、模拟器、性能分析器、编译器诊断、生产工作负载和历史错误数据。
这些资产使智能体更加有用。
因此,AI可能将护城河从代码生成转向验证环境的质量。
NVIDIA正在构建自己的CUDA智能体
挑战CUDA的技术同样适用于NVIDIA。
Business Insider援引NVIDIA开发者生态系统副总裁Ankit Patel的话说,该公司正在使用AI编码智能体来更快地开发CUDA并进行更大规模的验证。
NVIDIA已经
同时还提出了一种 CUDA 智能策略,将现有的CUDA知识、优化专长、云端性能剖析、Nsight工具、基准测试以及基于MCP的服务结合起来。
NVIDIA维护着 ComputeEval,这是一个用于AI生成的CUDA及CUDA核心计算库代码的开放基准测试。
该基准测试涵盖涉及张量核心、共享内存、线程束级原语、CUDA图、流和事件等任务。
因此,这场竞赛是相对的:
挑战者软件追赶的速度
对阵
NVIDIA软件改进的速度
Chris Lattner:炒作是真实的,但被夸大了
Modular联合创始人兼CEO Chris Lattner给出了更为审慎的看法。

他认为编码代理带来的是一种增量改进,而非对CUDA优势的即时摧毁。
源文章总结了三个原因。
编写代码仅是工程的一部分
生产环境的优化决定了芯片是否具有经济实用性。性能的最后几个百分点可能需要大量的专家工作。
GPU软件的公开训练数据较少
应用代码在网上十分丰富。高端内核与编译器工程是一个较小的领域,而且许多最强的工作仍然保持私有。
现有系统仍需迁移
技术可行性并不能消除认证成本、运营风险、员工再培训、合同、可靠性要求或机会成本。
这些观点并不意味着代理式内核工程无关紧要。它们解释了一个强大的演示为何不会立即转变为市场替代。
护城河在移动,而非消失
最强有力的解读不是“CUDA已死”。
而是CUDA历史优势中的某一层正在变得更容易被复制。
代理、DSL和自动化编译器可以缩短为新芯片构建内核、运行时和模型支持所需的时间。
最暴露的层面是早期推理的快速适配。
最受保护的层面仍然是大规模训练、成熟的生成库、验证、调试、集群编排、框架集成、现有客户工作流以及持续优化。
战略问题可能从:
谁拥有最大量的手写内核代码?
转变为:
谁拥有最好的自动化生成、测量、
验证和优化闭环?
NVIDIA处于有利位置,因为它已经拥有硬件、工具、库、工作负载和反馈数据。挑战者则因代理降低了进入门槛而受益。
这两点可以同时成立。
10小时结果真正改变了什么
Infinity的结果改变了硬件初创企业的预期。
新的加速器不再必须假设每一个有用的内核都将由一小队专家手动编写。
代理可以
可能:
- 阅读架构描述。
- 生成初始内核。
- 编译并运行。
- 将输出与参考结果进行比较。
- 测量硬件利用率。
- 搜索替代调度方案。
- 保留最佳实现。
- 从算子扩展到完整模型。
这可以缩短从芯片首次流片到实现可用模型推理之间的时间。
这种缩短使芯片供应商能够更早展示硬件,更快支持新模型,减轻软件人员配置压力,测试更多想法,并在更细分的推理市场中竞争。
这一结果并不会抹除CUDA,而是让迈出与CUDA竞争的第一步不再那么令人生畏。
接下来值得关注
独立复现
Infinity公布的结果来自公司及其硬件合作伙伴。外部基准测试将提供更有力的证据。
模型覆盖范围
一个通用的推理层必须支持多种架构、模态、量化格式和服务模式。
生产可靠性
端到端运行的演示与在客户流量下持续运行数月的软件是两回事。
验证规模
关键问题在于智能体系统如何在庞大的测试空间中证明正确性和性能。
可移植性
如果一种实现能在NVIDIA、AMD、Apple以及其他加速器上都取得出色结果,TileLang和其他领域特定语言将更具战略意义。
NVIDIA的应对
NVIDIA正在积极构建智能体、基准测试、编译器智能以及新的CUDA抽象。现有巨头并没有停滞不前。
常见问题
AI智能体真的在10小时内重新实现了CUDA吗?
不是。Infinity表示,Ignition在10小时内为d-Matrix Corsair生成了张量并行矩阵乘法软件,并达到了该芯片经验计算上限的92%。端到端的Qwen3推理耗时约10天,该项目并未复现CUDA的完整生态系统。
什么是Infinity Ignition?
Ignition是Infinity的AI研究与工程智能体,用于生成、测试、调试和优化底层推理软件。它利用真实硬件的反馈来迭代改进内核和模型运行时。
什么是d-Matrix Corsair?
Corsair是d-Matrix推出的生成式AI推理平台。Infinity将其作为自动生成张量并行操作和完整模型推理栈的目标平台。
DeepSeek TileKernels会取代CUDA吗?
不会。TileKernels通过使用TileLang减少手写底层CUDA内核的需求,但其当前要求包括NVIDIA SM90或SM100硬件以及CUDA Toolkit 13.1或更高版本。
为什么推理比训练更愿意接受CUDA的替代方案?
推理可以在较小的系统上运行,并且通常以单模型的成本、功耗、吞吐量或延迟来评估。前沿训练需要更大的集群、成熟的通信系统、故障恢复能力以及经过验证的稳定性。
CUDA最大的护城河是什么?
CUDA的护城河包括成熟的库、框架集成、调试和性能分析工具、分布式系统、文档、生产历史以及现有客户代码。验证和持续优化可能
随着代码生成成本日益降低,这一点将变得更加重要。
AI 生成的 kernel 能否既正确又过于缓慢?
可以。研究表明,kernel 虽然能通过数值正确性测试,但其性能可能远低于优化的库实现。生产级评估既需要正确性检查,也需要硬件效率检查。
NVIDIA 是否也在使用 AI 编码代理?
是的。NVIDIA 表示其正在使用代理来加速 CUDA 开发和验证,并已公开演示了面向 CUDA 的代理工作流、性能分析集成以及 ComputeEval 基准测试。
相关工具
- NVIDIA CUDA:NVIDIA 的加速计算平台,包括编译器、运行时、库和开发者工具。
- Infinity:为新型 AI 加速器构建 Ignition 和模型感知推理软件的公司。
- DeepSeek TileKernels:DeepSeek 使用 TileLang 编写的 MIT 许可的优化 LLM kernel 集合。
- TileLang:一种 Python 风格领域专用语言和编译器栈,用于在多种后端上生成高性能 kernel。
- INT21 PTX Kernel Factory:用于生成和改进底层 NVIDIA GPU kernel 的代理式系统。
- AMD ROCm:AMD 面向 GPU 计算、AI 和 HPC 的软件平台。
- AWS Neuron:用于在 AWS Trainium 和 Inferentia 芯片上部署和优化模型的 SDK。
- Modular MAX:面向硬件优化的建模和服务框架,用于可移植的高性能 AI 执行。
相关链接
- Business Insider:AI 正在改写 NVIDIA 的软件护城河:包含对 Infinity、NVIDIA、INT21、Modular 和 Rebellions 采访的主要报道。
- Infinity d-Matrix Corsair 案例研究:Infinity 关于 10 小时矩阵乘法结果和 10 天端到端模型上线的官方说明。
- Infinity 研究:涵盖 d-Matrix、生成式推理软件以及公司 OMEGA 研究系统的官方案例研究。
- NVIDIA CUDA 平台:CUDA 编译器、运行时、库、工具和生态系统的官方概述。
- DeepSeek TileKernels 仓库:官方源代码、依赖要求、测试命令、功能特性及 MIT 许可证。
- TileLang 论文:描述 TileLang 分块编程模型和编译器方法的研究论文。
- NVIDIA ComputeEval:NVIDIA 用于评估现代 CUDA 编程任务的基准测试。
摘要
Infinity 的 Ignition 代理并未在 10 小时内重造 NVIDIA CUDA。它针对一个不熟悉的架构生成了高性能的张量并行矩阵乘法。
当时的d-Matrix加速器据称达到了芯片经验计算上限的92%。大约10天后,完整的Qwen3推理路径便已实现。
这一成果至今仍有意义。它表明智能体能够加速新AI芯片的早期软件启动,尤其是在推理领域——客户关心的是每答案成本,并且可以为较窄的工作负载采用专用硬件。
DeepSeek的TileKernels和TileLang也指向同一方向:更多的内核工作可以通过更高级别的系统来表达并自动优化。当前TileKernels版本仍依赖最新的NVIDIA GPU和CUDA,因此它减少的是手写CUDA工作,而非消除该平台。
CUDA的护城河仍然很深,因为它包含的远不止源代码。库、验证、性能分析、框架支持、分布式训练、生产历史以及现有组织投资都难以复刻。
AI并未在10小时内跨越CUDA的整个护城河——但它可能已经降低了到达第一道壁垒的成本,将长期竞争从代码所有权转向自动化生成、验证和优化。