Сломала ли ИИ крепостной ров CUDA от NVIDIA? Что именно INFINITY создала за 10 часов
О кончине защитного рва CUDA от NVIDIA объявляли так часто, что это стало почти ритуалом в индустрии. Появляется новый ускоритель. Компилятор выходит в открытую бета-версию. Облачный провайдер…

Разрушил ли ИИ "ров" CUDA от NVIDIA? Что именно Infinity создала за 10 часов
Введение
"Ров" CUDA от NVIDIA объявляли мёртвым так часто, что это уже стало своего рода ритуалом в индустрии.
Появляется новый ускоритель. Компилятор выходит в открытое бета-тестирование. Облачный провайдер продвигает свой собственный AI-чип. Программная абстракция обещает переносимые ядра. Кто-то объявляет, что разработчикам больше не нужно писать CUDA вручную.
И всё же CUDA по-прежнему занимает центральное место в инфраструктуре ИИ следующего поколения.
Новый вызов тем более интересен, что он исходит от самого ИИ.
Infinity, ИИ-инфраструктурный стартап, основанный бывшим исследователем Google Brain Джереми Никсоном, утверждает, что их агент Ignition перенёс ключевые компоненты стека инференсного ПО на незнакомый ускоритель d-Matrix Corsair со скоростью, намного превышающей традиционные инженерные процессы.
Самый заметный результат: примерно за 10 часов Ignition реализовала тензорно-параллельное умножение матриц на всех 32 вычислительных блоках, достигнув 92% от измеренного вычислительного потолка чипа.
Это значимый результат. Но это не означает, что CUDA была воссоздана за 10 часов.
В самом кейсе Infinity отмечается, что полный сквозной путь инференса Qwen3 занял около 10 дней, при этом каждая требуемая операция была переписана под новое оборудование. А CUDA — это не одна реализация умножения матриц и не одна модель рантайма. Это зрелая платформа, включающая компиляторы, рантаймы, библиотеки, инструменты профилирования и отладки, системы коммуникации, интеграцию с фреймворками, документацию и почти два десятилетия производственного опыта.
Более правильный вопрос — не в том, скопировал ли ИИ CUDA за одну ночь.
А в том, могут ли кодирующие агенты кардинально сократить время, необходимое для того, чтобы новый ИИ-чип стал полезным.
Ответ всё чаще — «да».

Ров CUDA никогда не был только про GPU
NVIDIA больше всего известна своим железом: H100, Blackwell, Rubin и крупными системами, построенными вокруг них.
Её самое устойчивое преимущество — ПО, выстроенное вокруг железа.
CUDA расшифровывается как Compute Unified Device Architecture (единая вычислительная архитектура устройств). NVIDIA описывает её как платформу ускоренных вычислений, а не просто язык программирования.
Платформа CUDA включает:
- Модель программирования GPU.
- Цепочку инструментов компилятора.
- Библиотеки времени выполнения.
- Интерфейсы драйверов.
- Высокооптимизированные математические и ИИ-библиотеки.
- Инструменты отладки и профилирования.
- ПО для много-GPU коммуникаций.
- Интеграцию с фреймворками.
- Документацию, обучение и примеры кода.
- Огромную экосистему разработчиков и партнёров.
В основании CUDA позволяет инженерам писать ядра, исполняемые напрямую на GPU от NVIDIA.
Поверх неё находятся такие библиотеки, как cuBLAS, cuDNN, cuFFT, NCCL, TensorRT и TensorRT-LLM. Над библиотеками — PyTorch, TensorFlow, JAX, инференс-серверы, исследовательский код и внутренние корпоративные системы.
Упрощённая схема выглядит так:
Приложения и AI-фреймворки
↓
Оптимизированные библиотеки и распределённые системы
↓
Компиляторы, рантаймы, профайлеры, отладчики и ядра
↓
GPU и интерконнекты NVIDIA
Компании остаются в экосистеме NVIDIA не только потому, что знакомы с синтаксисом CUDA, а потому, что модели, тесты, системы развёртывания, ожидания по производительности, процессы отладки и производственные команды уже зависят от всего стека.
Смена аппаратной платформы может означать не просто перевод исходного кода — это может потребовать восстановления доверия.
Что Infinity реально сделала за 10 часов
Официальный кейс Infinity гораздо строже, чем громкие заголовки.
Компания работала с d-Matrix — стартапом, специализирующимся на оборудовании для инференса генеративного ИИ. Ускоритель Corsair имеет архитектуру и систему команд, отличные от GPU NVIDIA. Infinity утверждает, что у этого чипа практически нет публичной программной истории, которую общие модели программирования могли бы воспроизвести из обучающих данных напрямую.
Ignition получил информацию об оборудовании и приступил к генерации низкоуровневого ПО, необходимого для запуска ИИ-нагрузок.
По данным Infinity, примерно за 10 часов система достигла:
- Тензорно-параллельного умножения матриц.
- Исполнения на всех 32 вычислительных блоках Corsair.
- До 92% «скорости света».
«Скорость света» Infinity определяет как отношение производительности сгенерированного ядра к достижимому вычислительному пику чипа. Эмпирический потолок в опубликованном кейсе сам по себе составляет около 90% от теоретического пика.
Это отличный быстрый запуск ядра, но не полноценная платформа, эквивалентная CUDA.
Десять часов: высокопроизводительное умножение матриц
Умножение матриц — ядро инференса Transformer, но это лишь один класс операций.
Полная модель требует также механизмов внимания, нормализации, функций активации, маршрутизации, квантования, управления KV-кэшем, сэмплирования, перемещения тензоров, обработки состояний и сервисной обвязки модели.
Десять дней: сквозной инференс модели
Infinity сообщает, что примерно за 10 дней Qwen3 заработала на Corsair сквозным образом. В последующем анонсе о финансировании утверждается, что за этот период три前沿-модели были запущены сквозным образом, причём ядра написаны с нуля.
Этот более длинный таймлайн тоже впечатляет.
Перевод незнакомого ускорителя от базовых операций до работающего модельного рантайма — с месяцев до дней — может радикально изменить экономику выпуска нового оборудования.
| Утверждение | Более точная интерпретация |
|---|---|
| «ИИ воссоздал CUDA за 10 часов» | Преувеличение |
| Умножение матриц заработало за 10 часов | Сообщается в кейсе Infinity |
| Производительность — 92% от эмпирического пика | Сообщается в кейсе Infinity |
| Qwen3 заработала сквозным образом примерно за 10 дней | Сообщается в кейсе Infinity |
| Infinity строит универсальную библиотеку инференса | Подтверждено Infinity |
| Полная экосистема CUDA воспроизведена | Нет |
Ignition — это агент автоматизации ядер и инженерного процесса инференса
Infinity называет Ignition ИИ-исследовательским агентом.
Его назначение — генерировать и улучшать низкоуровневое ПО, превращающее операции модели в эффективную работу на конкретном чипе.
Цикл напоминает автоматизированный процесс оптимизации производительности:
Генерация кода
→ Компиляция
→ Запуск на оборудовании
→ Проверка корректности
→ Измерение производительности
→ Диагностика узких мест
→ Изменение реализации
→ Повтор

com/cms-assets/image/2026/08/9a7908b8-ffee-4250-b280-649499618ce5-658d1e86-10d7-4116-a564-e2b43d0c3a24.png)
Инженеры-люди по-прежнему предоставляют цели, информацию об аппаратном обеспечении, ограничения, критерии приёмки и общее направление. Ignition же выполняет основной объём повторяющейся работы по поиску и оптимизации.
Такие задачи идеально подходят для агентов, поскольку среда даёт исключительно чёткую обратную связь.
Сгенерированные ядра можно оценивать по конкретным критериям:
- Компилируется ли?
- Запускается ли?
- Корректны ли численные результаты?
- Стабильно ли?
- Какой уровень аппаратной производительности достигнут?
- Улучшили ли последние изменения результат?
Аппаратное обеспечение и тесты предоставляют объективную фактическую основу.
Почему разработка ядер — идеальная задача для агентов
Во многих программных задачах критерии приёмки размыты. Оптимизация ядер, хоть и сложна, частично поддаётся количественной оценке.
Эффективная реализация должна соответствовать двум независимым критериям.
Корректность
Ядро должно выдавать результаты в пределах допустимой численной погрешности.
Производительность
Ядро должно достаточно эффективно использовать целевое аппаратное обеспечение, чтобы оправдать замену существующей реализации.
Агент может сгенерировать сотни кандидатов, отбраковать некорректные, прогнать бенчмарки на выживших и последовательно оптимизировать самые сильные варианты.
Та же схема прослеживается в CUDA-ориентированных агентах NVIDIA, PTX Kernel Factory от INT21, работе DeepSeek над TileKernels, а также в исследовательских системах, генерирующих ядра на Triton или TileLang.
Новизна в том, что базовые модели теперь могут участвовать в более полном цикле, а не просто заполнять несколько строк синтаксического кода.
Infinity привлекает 15 миллионов долларов при оценке в 100 миллионов
Технологическая история Infinity привлекла инвесторов.
В июле 2026 года компания объявила о завершении раунда посевного финансирования на 15 миллионов долларов при оценке после инвестиций в 100 миллионов долларов, по сообщениям. В раунде участвовали Touring Capital и Principal Venture Partners, а также руководители чип-индустрии и исследователи, связанные с ведущими AI-лабораториями.

Infinity создаёт модель-ориентированный программный слой для логических выводов для поставщиков аппаратного обеспечения и провайдеров инференс-сервисов. Её заявленный рабочий процесс фактически таков:
Характеристики аппаратного обеспечения
→ Сгенерированное производственное ПО для логических выводов
Сообщается также, что Infinity создала
движок логических выводов NVIDIA с нуля, который на Qwen3-8B показывает производительность до 34,3% выше, чем конфигурационно совпадающая реализация vLLM.
Этот результат предоставлен самой компанией и зависит от аппаратного обеспечения, настроек батчинга, конфигурации модели и методики измерений. Тем не менее, это указывает на то, что амбиции Infinity простираются далеко за пределы базового запуска чипов.
TileKernels от DeepSeek требуют той же точности
В оригинальном тексте также упоминается репозиторий TileKernels от DeepSeek.
TileKernels — это библиотека оптимизированных GPU-ядер, написанных на TileLang, Python-подобном предметно-ориентированном языке для разработки высокопроизводительных ядер.
Репозиторий содержит следующие операции:
- Шлюзование смеси экспертов (MoE).
- Маршрутизация MoE.
- Квантизация FP8 и FP4.
- Транспонирование.
- Шлюзование Engram.
- Многообразие гиперсвязей (Manifold HyperConnection).
- Обёртки для автоматического дифференцирования PyTorch.
DeepSeek утверждает, что многие ядра уже близки к аппаратным пределам по вычислительной интенсивности или пропускной способности памяти, и часть из них используется внутри компании.
TileLang сокращает объём низкоуровневого кода CUDA C++, который инженерам приходится писать вручную.
В нынешнем виде это не свидетельствует о том, что DeepSeek устранила зависимость от технологического стека NVIDIA.
Текущие официальные требования TileKernels включают:
NVIDIA SM90 или SM100 GPU
CUDA Toolkit 13.1 или новее
PyTorch 2.10 или новее
TileLang 0.1.9 или новее
Текущая библиотека рассчитана на новейшие архитектуры NVIDIA. Она снижает зависимость от рукописного исходного кода CUDA, но не устраняет зависимость от аппаратного обеспечения NVIDIA или CUDA Toolkit.
Сфера применения TileLang шире, чем у текущей библиотеки DeepSeek
Сам TileLang имеет более широкие амбиции.
Проект описывает модель мозаичного (tiled) программирования для GPU, CPU и ускорительных ядер, основанную на инфраструктуре компилятора TVM и использующую синтаксис в стиле Python.
Его цель — разделить поток данных, который хочет инженер, и низкоуровневое планирование (scheduling), необходимое для эффективного исполнения.
TileLang постоянно добавляет поддержку многобэкендных языков, а также аппаратные пути, охватывающие CUDA, ROCm и Metal.
Такая переносимость может снизить затраты на переключение между поставщиками, но только при условии, что результаты будут корректными, стабильными, поддающимися отладке и конкурентоспособными по сравнению с библиотеками поставщиков.
Ядро, которое работает везде, но с низкой производительностью, не сможет заменить путь CUDA в производственной среде.
Корректный код всё ещё может быть в сотни раз медленнее
В исследовательской статье за июль 2026 года рассматривался разрыв между корректностью ядер в Triton и TileLang и качеством их замены.
Авторы обнаружили, что ядра могут проходить тесты на численную корректность, но при этом иметь производительность значительно ниже оптимизированного базового уровня. Сообщается, что одна реализация LayerNorm на TileLang, несмотря на прохождение проверки корректности, работала более чем в 300 раз медленнее базовой линии PyTorch.
Статья не направлена против TileLang; она выступает за оценку сгенерированных ядер по двум измерениям:
Корректность
+
Аппаратная эффективность
Генерация кода становится всё быстрее. Но доказать, что сгенерированный код способен заменить зрелое производственное ПО, по-прежнему сложно.
Логические выводы — главное поле битвы
Вызов CUDA выглядит более убедительным в сфере логических выводов, чем в обучении передовых моделей.
Обучение ставит во главу угла масштаб и стабильность
Масштабные обучающие запуски могут задействовать тысячи или десятки тысяч
ускорителей, работающих неделями или месяцами.
Обучающие платформы должны обеспечивать распределённую коммуникацию, контрольные точки, восстановление после сбоев, управление памятью, параллелизм, воспроизводимость и отладку на огромном количестве устройств.
Один сбой аппаратного обеспечения или программного обеспечения может привести к потере огромных вычислительных ресурсов. Поэтому организации крайне осторожно переносят критически важные обучающие нагрузки с устоявшихся систем.
CUDA, библиотеки CUDA-X, NCCL, поддержка PyTorch и интегрированные сетевые возможности NVIDIA дают компании сильные позиции в этой области.
Логические выводы ставят во главу угла стоимость каждого полезного ответа
Логические выводы — это этап обслуживания модели после завершения обучения.
Соответствующие бизнес-метрики обычно ближе к:
Приемлемое качество вывода
÷
Общая стоимость обслуживания
Логические выводы могут распределяться на одном ускорителе, небольшом кластере, масштабном парке машин и специализированном аппаратном обеспечении.
Новому чипу не обязательно заменять NVIDIA во всех сценариях. Ему достаточно доказать преимущество для конкретной модели или нагрузки по стоимости, скорости, энергопотреблению, пропускной способности или предсказуемости задержек.
Эта более узкая цель даёт специализированному аппаратному обеспечению реалистичную точку входа.
d-Matrix создана вокруг генеративных AI-выводов
Компания d-Matrix, основанная в 2019 году, фокусируется на ускорении логических выводов. Её платформа Corsair, использующая большие объёмы встроенной SRAM, предназначена для снижения стоимости и энергопотребления при работе генеративных моделей.

Работа Infinity решает одну из классических проблем, с которыми сталкиваются новые ускорители.
Чип может обладать многообещающим аппаратным обеспечением, но пока не готовы ядро, исполнение моделей, работа с памятью, квантизация, сервисная логика и схема интеграции, клиенты не смогут эффективно им пользоваться.
Если агент способен сократить этот процесс запуска с нескольких месяцев до нескольких дней, аппаратные стартапы смогут предлагать поддержку ближе к моменту выхода моделей и раньше демонстрировать возможности своего оборудования.
Это ослабляет часть программного преимущества NVIDIA, но не устраняет его полностью.
Другие компании также нацелены на эту нишу
Рынок инференса включает несколько challenger'ов:
| Производитель или платформа | Общее позиционирование |
|---|---|
| Rebellions | Специализированные ИИ-ускорители и системы для инференса |
| Cerebras | Системы на пластине для обучения и инференса |
| AWS Inferentia | Инференс-чипы от Amazon с использованием Neuron SDK |
| Google TPU | Ускорители Google с поддержкой XLA и основных фреймворков |
| AMD Instinct | Датацентровые GPU с платформой ROCm |
| d-Matrix | Ускорение генеративного ИИ-инференса на основе SRAM |
| NVIDIA | GPU и стек ускоренных вычислений CUDA |
Давление исходит от программных уровней, которые позволяют пользователям развёртывать модели без ручной переписывания каждой операции, включая AWS Neuron, Google XLA, AMD ROCm, Modular MAX и Mojo, TileLang, Triton и системы генерации ядер на основе ИИ.
Чем больше автоматизируют эти программные уровни, тем реже разработчикам приложений приходится вмешиваться вручную.
Речь непосредственно о CUDA.
Кроссплатформенное ПО может снизить эффект блокировки
Эффект блокировки CUDA наиболее силён, когда приложения и их оптимизированные ядра тесно связаны с оборудованием NVIDIA.
Переносимый уровень инференса призван обеспечить следующий рабочий процесс:
Модель
→ Переносимый уровень исполнения
→ Генерация или выбор аппаратных ядер
→ Целевой ускоритель
Реальный мир сложнее, поскольку разные чипы имеют различные иерархии памяти, числовые форматы, способы соединения, планировщики поведения и поддерживаемые операции.
Высокая производительность по-прежнему часто требует работы, специфичной для конкретного оборудования.
Ключевой тезис Infinity заключается в том, что агенты могут автоматически генерировать такую специализированную работу.
Ров CUDA — это не только существующий код
Результаты за 10 часов не воспроизводят те активы, которые делают CUDA сложной для замены.
К ним относятся:
Зрелые библиотеки
Многие организации используют вендорские библиотеки вместо непосредственного написания ядер. cuBLAS, cuDNN, TensorRT, NCCL и другие содержат многолетний оптимизационный опыт.
Инструменты отладки и анализа
NVIDIA Nsight и связанные инструменты помогают инженерам понимать корректность, поведение памяти, тайминги, коммуникации и производительность.
Поддержка фреймворков
Новые возможности моделей обычно рано интегрируются и оптимизируются под оборудование NVIDIA.
Экспертиза развёртывания
Продакшен-команды знают, как системы NVIDIA ведут себя под нагрузкой.
Документация и обучение
Экосистема включает примеры, курсы, выступления на конференциях, ответы сообщества и экспертные ресурсы.
Существующие инвестиции
Предприятия имеют миллионы строк кода, тесты, процессы закупок и навыки сотрудников, привязанные к этой платформе.
ИИ может снизить стоимость перевода, но не автоматически устраняет организационные издержки перехода.
Верификация может стать следующим рвом CUDA
Бинг Сюй, основатель INT21 и бывший основатель HippoML, приобретённой NVIDIA, считает, что основным узким местом является верификация.

Агенты могут быстро генерировать код. Но продакшен-командам всё ещё нужны доказательства того, что он:
- выдаёт корректные числовые результаты;
- работает с разнообразными формами и типами данных;
- обрабатывает краевые случаи;
- не нарушает память;
- стабилен при конкурентном доступе;
- хорошо показывает себя на различных нагрузках;
- выдерживает изменения драйверов и оборудования;
- корректно взаимодействует с остальным программным стеком.
У NVIDIA уже есть большое количество тестов на соответствие, тестов производительности, эталонных реализаций, симуляторов, профайлеров, диагностики компилятора, продакшен-нагрузок и исторических данных об ошибках.
Эти активы делают агентов более полезными.
Таким образом, ИИ может сместить ров с генерации кода на качество среды верификации.
NVIDIA строит собственного CUDA-агента
Технологии, бросающие вызов CUDA, применимы и к самой NVIDIA.
Business Insider со ссылкой на вице-президента экосистемы разработчиков NVIDIA Анкита Пателя сообщает, что компания использует ИИ-агентов для кодирования, чтобы быстрее развивать CUDA и проводить более масштабную верификацию.
NVIDIA уже
Также предложена стратегия CUDA Intelligence, объединяющая существующие знания CUDA, экспертизу оптимизации, облачное профилирование производительности, инструменты Nsight, бенчмарки и сервисы на основе MCP.
NVIDIA поддерживает ComputeEval — открытый бенчмарк для проверки ИИ-сгенерированного кода CUDA и ядер вычислительных библиотек CUDA.
Данный бенчмарк охватывает задачи, связанные с тензорными ядрами, разделяемой памятью, примитивами на уровне варпов, CUDA-графами, потоками и событиями.
Таким образом, это гонка относительная:
Скорость догоняющего ПО challenger'ов
против
Скорость улучшения ПО NVIDIA
Крис Латтнер: хайп реален, но преувеличен
Сооснователь и генеральный директор Modular Крис Латтнер даёт более осторожную оценку.

Он считает, что агенты кодирования дают инкрементальное улучшение, а не мгновенное разрушение преимущества CUDA.
Исходная статья обобщает три причины.
Написание кода — лишь часть инженерной работы
Продакшен-оптимизация определяет экономическую целесообразность чипа. Последние несколько процентов производительности могут требовать значительной экспертной работы.
Публичных обучающих данных по GPU-программированию меньше
Код приложений в интернете в изобилии.
Высококлассная разработка ядер и компиляторов — довольно нишевая область, и многие из самых сильных наработок по-прежнему остаются закрытыми.
Существующие системы всё ещё нужно мигрировать
Техническая осуществимость не устраняет затраты на сертификацию, эксплуатационные риски, переобучение сотрудников, контрактные обязательства, требования к надёжности или альтернативные издержки.
Эти соображения не означают, что агентная разработка ядер неважна. Они объясняют, почему впечатляющая демонстрация не превращается мгновенно в замену на рынке.
Ров меняется, а не исчезает
Наиболее сильная интерпретация — не «CUDA мертва».
А скорее: один из слоёв исторического преимущества CUDA становится легче воспроизвести.
Агенты, DSL и автоматизированные компиляторы могут сократить время, необходимое для создания ядер, рантаймов и поддержки моделей для новых чипов.
Наиболее уязвимый слой — быстрая адаптация для раннего инференса.
Наиболее защищённый слой — по-прежнему масштабное обучение, зрелые библиотеки генерации, валидация, отладка, оркестрация кластеров, интеграция с фреймворками, существующие рабочие процессы клиентов и постоянная оптимизация.
Стратегический вопрос может сместиться с:
У кого больше всего кода ядер, написанного вручную?
на:
У кого лучший замкнутый цикл автоматической генерации,
измерения, валидации и оптимизации?
NVIDIA находится в выгодном положении, поскольку уже владеет аппаратным обеспечением, инструментами, библиотеками, рабочими нагрузками и данными обратной связи. Претенденты выигрывают от того, что агенты снижают барьер входа.
Оба утверждения могут быть верны одновременно.
Что действительно меняет результат за 10 часов
Результат Infinity меняет ожидания аппаратных стартапов.
Новым ускорителям больше не обязательно предполагать, что каждое полезное ядро будет написано вручную небольшой командой экспертов.
Агент может:
- Прочитать описание архитектуры.
- Сгенерировать初始 ядро.
- Скомпилировать и запустить.
- Сравнить выходные данные с эталонным результатом.
- Измерить утилизацию аппаратного обеспечения.
- Искать альтернативные схемы планирования.
- Сохранить лучшую реализацию.
- Масштабироваться от операторов до полной модели.
Это может сократить время от первой кремниевой тапеута чипа до достижения пригодного для использования инференса моделей.
Такое сокращение позволяет поставщикам чипов раньше демонстрировать аппаратное обеспечение, быстрее поддерживать новые модели, снижать нагрузку на персонал по разработке ПО, тестировать больше идей и конкурировать в более нишевых сегментах инференса.
Этот результат не стирает CUDA, но делает первый шаг к конкуренции с CUDA менее пугающим.
За чем стоит следить дальше
Независимое воспроизведение
Опубликованные результаты Infinity получены от компании и её аппаратных партнёров. Внешние бенчмарки предоставят более веские доказательства.
Покрытие моделей
Универсальный инференс-слой должен поддерживать множество архитектур, модальностей, форматов квантования и режимов обслуживания.
Производственная надёжность
Демонстрация сквозного запуска — это одно; программное обеспечение, работающее месяцами под клиентской нагрузкой, — совсем другое.
Масштаб валидации
Ключевой вопрос — как агентные системы могут доказать корректность и производительность в огромном пространстве тестов.
Переносимость
Если одна реализация будет давать отличные результаты на NVIDIA, AMD, Apple и других ускорителях, TileLang и другие предметно-ориентированные языки станут более стратегически значимыми.
Ответ NVIDIA
NVIDIA активно строит агентов, бенчмарки, компиляторный интеллект и новые абстракции CUDA. Существующий гигант не стоит на месте.
Часто задаваемые вопросы
Действительно ли ИИ-агент переimplementовал CUDA за 10 часов?
Нет. Infinity сообщает, что Ignition за 10 часов сгенерировал программное обеспечение для тензорно-параллельного умножения матриц для d-Matrix Corsair, достигнув 92% от эмпирического вычислительного предела этого чипа. Сквозной инференс Qwen3 занял около 10 дней; проект не воспроизвёл полную экосистему CUDA.
Что такое Infinity Ignition?
Ignition — это исследовательско-инженерный агент ИИ от Infinity для генерации, тестирования, отладки и оптимизации низкоуровневого инференсного ПО. Он использует обратную связь от реального аппаратного обеспечения для итеративного улучшения ядер и рантаймов моделей.
Что такое d-Matrix Corsair?
Corsair — это платформа для генеративного ИИ-инференса от d-Matrix. Infinity использовала её как целевую платформу для автоматической генерации тензорно-параллельных операций и полного стека инференса моделей.
Заменит ли DeepSeek TileKernels CUDA?
Нет. TileKernels снижает потребность в ручном написании низкоуровневых ядер CUDA с помощью TileLang, но его текущие требования включают аппаратное обеспечение NVIDIA SM90 или SM100 и CUDA Toolkit версии 13.1 или выше.
Почему инференс более открыт к альтернативам CUDA, чем обучение?
Инференс может работать на меньших системах и часто оценивается по стоимости, энергопотреблению, пропускной способности или задержке одной модели. Передовое обучение требует более крупных кластеров, зрелых коммуникационных систем, способности к восстановлению после сбоев и проверенной стабильности.
Какой самый большой ров CUDA?
Ров CUDA включает зрелые библиотеки, интеграцию с фреймворками, инструменты отладки и профилирования, распределённые системы, документацию, производственную историю и существующий клиентский код. Валидация и постоянная оптимизация могут стать ещё более важными по мере снижения стоимости генерации кода.
Могут ли ИИ-сгенерированные ядра быть одновременно корректными и слишком медленными?
Да. Исследования показывают, что ядра могут проходить тесты на числовую корректность, но их производительность может быть значительно ниже оптимизированных библиотечных реализаций. Производственная оценка требует как проверки корректности, так и проверки эффективности аппаратного обеспечения.
Использует ли NVIDIA агентов для написания кода?
Да. NVIDIA заявляет, что использует агентов для ускорения разработки и валидации CUDA, и публично продемонстрировала агентные рабочие процессы для CUDA, интеграцию с профилировщиками и бенчмарк ComputeEval.
Связанные инструменты
- NVIDIA CUDA:платформа ускоренных вычислений NVIDIA, включающая компиляторы, рантаймы, библиотеки и инструменты для разработчиков.
- Infinity:компания, создающая Ignition и ПО для инференса с учётом особенностей новых ИИ-ускорителей.
- DeepSeek TileKernels:набор оптимизированных LLM-ядер от DeepSeek, написанных на TileLang, под лицензией MIT.
- TileLang:предметно-ориентированный язык в стиле Python и компиляторный стек для генерации высокопроизводительных ядер на различных бэкендах.
- INT21 PTX Kernel Factory:агентная система для генерации и улучшения низкоуровневых ядер NVIDIA GPU.
- AMD ROCm:программная платформа AMD для GPU-вычислений, ИИ и HPC.
- AWS Neuron:SDK для развёртывания и оптимизации моделей на чипах AWS Trainium и Inferentia.
- Modular MAX:фреймворк моделирования и обслуживания для аппаратной оптимизации и переносимого высокопроизводительного ИИ.
Связанные ссылки
- Business Insider: ИИ переписывает программный ров NVIDIA:основной материал с интервью Infinity, NVIDIA, INT21, Modular и Rebellions.
- Тематическое исследование Infinity d-Matrix Corsair:официальное описание Infinity о результате умножения матриц за 10 часов и развёртывании полной модели за 10 дней.
- Исследования Infinity:публикации Infinity о системах агентов и инструментах для ИИ-инференса.
inc/research): Официальные тематические исследования, охватывающие d-Matrix, программное обеспечение для генеративного вывода и исследовательскую систему компании OMEGA.
- Платформа NVIDIA CUDA: Официальный обзор компилятора CUDA, среды выполнения, библиотек, инструментов и экосистемы.
- Репозиторий DeepSeek TileKernels: Официальный исходный код, требования к зависимостям, команды тестирования, функциональные возможности и лицензия MIT.
- Научная статья TileLang: Исследовательская работа, описывающая блочную модель программирования TileLang и подход компилятора.
- NVIDIA ComputeEval: Бенчмарк NVIDIA для оценки современных задач программирования на CUDA.
Резюме
Агент Ignition от Infinity не пересоздал NVIDIA CUDA за 10 часов. Он сгенерировал высокопроизводительное тензорно-параллельное матричное умножение для незнакомой архитектуры.
Тогдашний ускоритель d-Matrix, по заявлению, достиг 92% от эмпирического вычислительного предела чипа. Примерно через 10 дней был реализован полный конвейер вывода Qwen3.
Этот результат остаётся значимым и сегодня. Он показывает, что агенты способны ускорить ранний запуск программного обеспечения для новых ИИ-чипов, особенно в области вывода — где клиентов волнует стоимость за ответ и где можно применять специализированное оборудование для узких рабочих нагрузок.
TileKernels и TileLang от DeepSeek также указывают в том же направлении: больше работы над ядрами может быть выражено через системы более высокого уровня и автоматически оптимизировано. Текущая версия TileKernels по-прежнему зависит от новейших GPU и CUDA от NVIDIA, поэтому она сокращает объём рукописного кода CUDA, а не устраняет эту платформу.
Ров CUDA остаётся глубоким, поскольку включает в себя гораздо больше, чем исходный код. Библиотеки, валидация, профилирование производительности, поддержка фреймворков, распределённое обучение, производственная история и существующие организационные инвестиции трудно воспроизвести.
ИИ не преодолел весь ров CUDA за 10 часов — но он, возможно, снизил стоимость достижения первого барьера, сместив долгосрочную конкуренцию с владения кодом на автоматизированную генерацию, проверку и оптимизацию.