楊慶氏がIntent Labを立ち上げ:Fleetが一行のプロンプトを本番システムに変換

Lepton AIがNVIDIAの一部となってから1年余り、楊慶氏は再び新たなスタートを切る。彼の新会社Intent Labは、従来のチャットボットやクラウド市場での立ち上げではない。

发布于 2026年7月31日generalGEO 评分: 05 次阅读
Intent Lab Fleetのプロモーション画像。背景は暗色で、ぼかしの入ったIntent Lab Fleetのロゴやスピードメーターなどの要素が配置されている。画像には「Intent Lab Fleet」および「GLM-5.2 6.3× Faster」の文字が強調表示され、下部には「One-Shot Database・Verified File System」の説明がある。左下にはZ.aiとGLM-5.2のロゴがあり、右下にはフォルダアイコンがあり、その中に盾とチェックマークが表示されている。この画像は、文書内でIntent Lab Fleetを紹介する内容に関連し、その技術的なハイライトを視覚的に示している。

Yangqing Jia、Intent Labを立ち上げ:Fleetが一行のプロンプトを本番システムに変換

はじめに

Lepton AIがNVIDIAの一部となってから1年余り。Yangqing Jia氏が再び動き出した。

彼の新会社Intent Labは、従来型のチャットボットやクラウドマーケットプレイス、開発者向けIDEとともに立ち上がったわけではない。代わりに同社が構築しているのはFleet。これは、高レベルの意図を本番品質のソフトウェアに変換する自律型エンジニアリングチームと説明されている。

Intent Labの最初の公開デモには、非常に異なる3つのシステムが含まれている:

  1. 標準のTensorRT-LLMを超えて最適化されたGLM-5.2推論エンジン。
  2. 一行の要件から構築されたSQLite互換データベース。
  3. 形式的検証と障害テストを備えたAIエージェント向け分散ファイルシステム。

一見すると、これらのプロジェクトは単一の製品カテゴリには見えない。

そこがポイントだ。

Intent Labによれば、実際の製品は背後にあるエンジニアリングシステムそのものだという。Fleetは、曖昧なソフトウェアリクエストと、ベンチマーク可能で検証・運用・進化が可能な本番システムとの間の作業を実行することを目的としている。

画像はYangqing Jia氏によるツイートで、Intent Labの紹介についてです。ツイートには、Intent Labが「fleet」という自律チームを構築しており、意図を本番ソフトウェアに変換していると記載されています。今日は初期の成果をいくつか共有するとあり、最速のGLM5.2推論エンジン、一度のデータベース作成、完全検証済みのエージェントファイルシステムが挙げられています。下部にはリンクがあり、タイトルは「世界で初めて意図を本番システムに変換する自律車隊」で、「意図を本番システムに変換——Intent Lab」という文字があります。この画像は文脈と密接に関連しており、Intent Labとその成果の公式紹介です。

この記事の初期パフォーマンス数値は、Intent Lab自身のローンチ資料に基づくものです。これらは有望なデモであり、独立したベンチマーク認定ではありません。同社はまだ、外部チームが同一条件下ですべての結果を確認できるほどの再現性の詳細を公開していません。

Yangqing Jia、再びインフラ企業を立ち上げる

Yangqing Jia氏のキャリアは、繰り返しインフラに立ち返ってきた。

彼はカリフォルニア大学バークレー校在籍時にCaffeを開発したことで最もよく知られており、その後はPyTorchやONNXなど、主要なAIインフラプロジェクトに携わってきた。

2023年にアリババを退社後、Jia氏はLepton AIを共同設立。GPUコンピューティングとモデルデプロイを開発者にとってより簡単にすることを重視した企業である。

Leptonの当初の提案は、Pythonネイティブの開発者体験と、複数のGPUプロバイダーにわたってAIワークロードを実行できるインフラを組み合わせたものだった。

同社は2025年にNVIDIAによって買収され、当時は数億ドル規模と公に報じられた。その後の業界レポートでは約7億ドルとされたが、NVIDIAは最終的な買収価格を公開していない。

Leptonの技術はNVIDIA DGX Cloud Leptonの一部となった。

![画像はLepton AIのクラウドアーキテクチャを示しています。上部にはServerless Cloud、Lepton API Services、Enterprise Deploymentの3つのセクションがあります。中央の青色領域はLepton AI Cloud Architectureで、Deployments(Inference、Training)、Jobs(Training、Development)、Pods(Development)、Fast Runtimes(LLM、SDなど)、Global Overlay Network、Infra Health Management、Lepton Optimized Kubernetesなどのセクションを含みます。最下部はMulti Cloud & BYOC Hardware Resourcesです。この図は文脈と密接に関連しており、Lepton AIのクラウドアーキテクチャにおける技術的構成を直感的に示しています。](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/07/32165d25-ec8e-45a4-8ec2-4b9895592d90-c88a130e-0f9f-4f13-a721-065d3cf997fc.png)

NVIDIAは現在、DGX Cloud Leptonを、開発・トレーニング・推論のためにクラウドプロバイダーと顧客所有インフラストラクチャーにわたってGPUコンピューティングを統合するアクティブなプラットフォームとして説明しています。

この現在の状況は明確にしておく価値があります。というのも、Jia氏の退社後のコメントでは、当初のスタートアップ型Lepton製品とそのオープンソースへの野心は、買収後も形を変えずに生き残ったわけではないと主張されていたからです。

公開されている証拠は、より慎重な説明を裏付けています:

  • 独立したLepton社はNVIDIAに吸収されました。
  • そのブランドと技術はDGX Cloud Leptonの一部となりました。
  • NVIDIAは現在もDGX Cloud Leptonを運営・文書化しています。
  • 公開Pythonライブラリとlep CLIは引き続き利用可能です。
  • より深いプラットフォームコンポーネントのオープンソース化に関する当初の期待の一部は、観測者が予想した形では実現されませんでした。

Jia氏はその後、NVIDIAのシステムソフトウェア担当副社長を務め、2026年に同社を退社しました。

Hyperbolicでの一幕

2026年7月、HyperbolicはJia氏がGPUインフラストラクチャー企業のアドバイザーとして加わったことを発表しました。

Hyperbolicは、Caffe、ONNX、PyTorch、Lepton AI、NVIDIA、Google、Facebook、Alibaba Cloudでの彼の経歴が、GPUアクセスとインフラストラクチャーに関する自社の取り組みに特に関連性が高いと説明しました。

この画像はHyperbolic社に関する内容を示しており、左上にHyperbolicのロゴがあります。画像左側にはYangqing Jia氏の白黒ポートレート写真、右側には彼のコメントが添えられており、Hyperbolicが開発者や企業がAIシステムのトレーニング、デプロイ、スケーリングに必要な計算リソースにアクセスできるよう支援していること、彼がHyperbolicのアドバイザーとしてこのチームのAI分野での取り組みを支援する考えを表明していること、また彼の肩書きとしてHyperbolicアドバイザー、Lepton AI共同創設者と記載されており、これは文書内で言及されている彼がHyperbolicにアドバイザーとして加わった背景情報と関連しています。

しかし、その役割は彼の次の本格的な動きではありませんでした。

7月29日、Jia氏はIntent Labを公に紹介しました。

彼の位置づけはLepton AIとは異なるものでした。

Leptonは開発者にコンピューティングへのより簡単なアクセスを提供することに焦点を当てていました。

Intent Labは、自律型エンジニアリングシステムに、そのコンピューティング上で動作するソフトウェアを作成・維持する能力を与えることに焦点を当てています。

Jia氏はこの転換について、自身のチームはキャリアを通じて大規模なシステムを一つずつ注意深く構築してきたと総括しました。彼らが今関心を持っているのは、そのようなシステムを多数生み出すことができるシステムだということです。

これは2026年7月29日に公開されたソーシャルメディアの投稿で、投稿者はYangqing Jia氏、アカウント名は@jiayqです。内容は、自身のチームがこれまで常にオープンソースやクラウドインフラストラクチャープロジェクトなどの大規模システムを手作業で構築してきたこと、テーマは一度に一つのシステムを注意深く構築することであり、現在興味があるのはそのようなシステムを何千もの生成できる「源流」を作り出すことだと述べています。この内容は、文書で紹介されているJia氏のIntent Lab設立の背景と呼応し、彼がIntent Labを紹介する際に述べた、大規模システムの一回限りの構築から複数のシステムを量産できる自律型エンジニアリングシステムへの転換という核心的な方向性に対応しています。

Fleetは3つのデモの背後にある製品

Intent Labはその自律型エンジニアリングシステムをFleetと呼んでいます。

同社はそれを単一のコーディングエージェントではなく、チームとして説明しています。

この区別は重要です。

典型的なコーディングエージェントは、ファイルの編集、コマンドの実行、テストの修正、リポジトリの検索、機能の実装ができます。

Fleetは、より長いエンジニアリングプロセスを調整できるシステムとして提示されています。

Intent Labの表明された目標は、高レベルのリクエストから測定可能な本番システムへの移行に必要な作業をカバーすることです。

動作、検証、そして継続的改善への道筋。

最初の3つのデモンストレーションは、非常に異なる工学分野にわたってその主張を検証するために選ばれた。

デモ1: 標準TensorRT-LLMを超えるGLM-5.2の最適化

技術的に最も注目すべき発表結果は、GLM-5.2推論エンジンである。

最初の指示は、基本的に1つの工学的目標であった:

TensorRT-LLMを再設計し、GLM-5.2がGrace Blackwellノード上で効率的に動作するようにする。
最適化の機会を特定し、実装し、自律的に検証する。

TensorRT-LLMは、すでにNVIDIAの大規模言語モデル向け本番環境向け推論スタックである。

NVIDIAは、マルチGPUおよびマルチノードサービス、インフライトバッチ処理、ページングKVキャッシュ、量子化、最適化カーネル、PythonおよびC++ランタイムなどの機能を文書化している。

したがって、そのスタック上でパフォーマンスを向上させることは、最適化されていないリファレンス実装を最適化するよりも困難な目標である。

Intent Lab、出力速度6.3倍の向上を報告

Intent Labによると、Fleetは標準TensorRT-LLMで開始し、おおよそ以下の速度であった:

102トークン/秒

最適化されたランタイムは、以下に達した:

161トークン/秒

同社の最適化された投機的デコーディングパスを追加した後、システムは以下に達したと報告されている:

647トークン/秒

これは元の出力速度のおよそ6.3倍である。

画像は、Intent LabによるTensorRT-LLMの最適化成果を示している。目標は、GLM 5.2をGrace Blackwellノード上で動作させ、最適化カテゴリを特定し自律的に実装・検証することで、6.3倍の出力速度向上を達成することである。最適化はカーネル、ランタイム、通信、投機的デコーディングの4つのカテゴリに分けられ、それぞれ24%、16%、18%、4.0倍の向上をもたらした。画像はまた、102から181、そして647への異なる最適化段階での出力速度の比較と、性能向上の内訳を示しており、最適化効果を直感的に表している。

Intent Labによると、ベンチマークは2つのGrace Blackwellノードを使用した。

同社はパフォーマンス作業を4つのカテゴリに分類している。

カーネル最適化: +24%

Fleetは、カーネル融合を適用し、命令レベル制御のための低レベルPTX/SASSパスを生成したと報告されている。

ランタイム最適化: +16%

Intent Labによると、ランタイムはH2Dバッチ処理とゼロコピー技術を通じて、定常状態のデコーディングから繰り返されるホストからデバイスへのメタデータコピーを削除した。

通信最適化: +18%

Fleetは、残余加算とRMSNormを集合操作に組み込んだ融合MNNVLオールリデュースパスを使用したと報告されている。

投機的デコーディング: 約4倍

最大の個別ゲインは投機的デコーディングからもたらされた。

Intent Labによると、最適化されたDSparkドラフターは複数のトークンを提案し、メインモデルがそれらをバッチで検証することで、デコードスループットを大幅に向上させる。

同社は、エンドツーエンドの結果として、標準ベースラインからの534%の改善を報告している。

これらの数値はIntent Lab自身の測定値である。ハードウェア構成、ワークロードの詳細、バッチ設定、出力長、精度、同時実行性、ソフトウェアリビジョンは、推論ベンチマークに大きく影響する可能性がある。

Fleetの最適化ループは、一回限りの処理というよりもチームのように見える

Intent Labによると、Fleetは繰り返しのエンジニアリングループに従う:

  1. ルーフライン分析
  2. ボトルネックの特定
  3. 提案
  4. 検証
  5. 複合
  6. 次のボトルネックに戻る

提案された最適化が

検証に失敗すると、システムは戻って再度試行します。

「複合」ステップが重要なのは、個々に成功した最適化が互いに干渉し合うことで、パフォーマンスエンジニアリングがしばしば失敗するからです。

Fleet は、複合システムが依然として機能することを検証した後にのみ変更を保持するように設計されています。

GLM-5.2 が要求の厳しいターゲットである理由

GLM-5.2 は、Z.ai の長期的タスク向けフラッグシップモデルです。

その公式モデルカードは、100万トークンのコンテキストウィンドウ、長期的なコーディングとエージェントワークロード、柔軟な推論努力、改善されたスパースアテンションアーキテクチャ、そして MIT ライセンスによるオープンウェイトを強調しています。

長いコンテキストとエージェント的なワークロードを備えた大規模モデルは、困難なサービング問題を生み出します。

最速の実装は、カーネル設計、メモリ帯域幅、KVキャッシュの動作、インターコネクト帯域幅、バッチサイズ、投機的デコード、量子化、ホストスケジューリング、通信コレクティブ間の相互作用に依存します。

これにより、推論最適化は、自律型エンジニアリングシステムにとって有用なストレステストとなります。

デモ2: 単一の要件から作られた SQLite 互換データベース

Fleet の2つ目の公開プロジェクトは、GPU カーネルから完全に離れています。

Intent Lab は、システムに SQLite と互換性のある SQL データベースエンジンの構築を依頼しました。

公開資料には、次の要件が示されています:

SQLite と互換性のある SQL データベースエンジンを構築する。
つまり、すべての sqllogictest テストケースに合格でき、
パフォーマンスが同等以上でなければならない。

Intent Lab は、Fleet が SQLite のソースコードやドキュメントから開始しなかったと述べています。

代わりに、既存システムの動作とテストコーパスを受け入れ契約として扱いました。

画像は、Fleet が SQLite と互換性のある SQL データベースエンジンを構築する意図とプロセスを示しています。意図は、既存のコードやドキュメントに依存せず、動作とテストコーパスのみから、SQLite と互換性のある SQL データベースエンジンを構築することです。プロセスには、反復的な設計と実装、労働分担、モデル非依存かつコスト効率の高さなどが含まれます。また、プロジェクトにおけるさまざまな役割の活動を示す操作シーケンス図も提示されています。この図はコンテキストと密接に関連しており、コンテキストで説明されている Fleet のデータベースエンジン構築の意図とプロセスを視覚的に示しています。

同社は、最終システムが約600万件の SQLite 互換性テストに合格したと報告しています。

この数値は Intent Lab からのものであり、この記事のために独立して再現されたものではありません。

1つの Fleet、複数のエンジニアリング役割

Intent Lab は、データベース構築を、プロジェクト全体で機能する複数の役割として視覚化しています:

  • 意思決定。
  • アーキテクチャ。
  • コーディング。
  • テスト。
  • レビュー。
  • QA。

役割は単に直線的な引き継ぎで機能するわけではありません。

実装が進行している間にアーキテクチャが変更されることがあります。機能が追加されている間もテストは継続されます。コードベースが成長するにつれて、レビューと QA はアクティブなままです。

コストはモデルに大きく依存する

Intent Lab はコスト比較も公開しました。

同じデータベース構築について、同社は Opus 4.8 を使用した実行には約2,000ドル、オープンソースモデルを使用した実行には約350ドルかかったと述べています。

これらの数値は企業報告によるもので、モデル価格、トークン消費、エージェントオーケストレーション、インフラストラクチャに依存します。

それでも、エージェントエンジニアリングにとっての主要な経済的疑問を示しています: 1回のモデル呼び出しの価格ではなく、完全なプロジェクト成功のコストはいくらか、ということです。

デモ3: 正式な

エージェント向け検証済みファイルシステム

3つ目のデモは、AgentFSと呼ばれる分散ファイルシステムです。

Intent Labによると、これはクラウド環境におけるエージェントワークロードのために特別に設計されたものです。

AIコーディングおよびリサーチエージェントは、特徴的なストレージパターンを生み出す傾向があります:

  • 多数の一時サンドボックス
  • 大量の小規模ファイル
  • 頻繁な作成と削除
  • 共有クラウドストレージ
  • 高いメタデータチャーン
  • 短期間のリポジトリ

Intent Labは、Amazon EFSやS3FSを含む既存システムを評価したところ、このワークロードに対する制限を発見し、代わりに新しいファイルシステムを構築したと述べています。

同社は、メタデータ中心の操作において、比較対象のシステムと比べて大幅な高速化を達成したと主張しています。

画像はAgentFS分散ファイルシステムの主要特性を示しています。上部のタイトルは「10倍高速な分散ファイルシステム」。中央部分では、git cloneやgit statusなどのGitリポジトリ操作におけるAgentFS、EFS、S3FSのパフォーマンスを比較しており、AgentFSが最良の結果を示しています。下部では、AgentFSの構築目的、継続的検証、障害検出と修復、形式検証などの特性が説明されており、1.8M状態の正式モデル検査などを通じて、コードエージェントが単純なテストでは到達できない正確性のレベルを保証しています。

繰り返しになりますが、これらはIntent Labの発表時点でのベンチマークであり、独立した第三者による結果ではありません。

形式検証がコーディングエージェントが見落としたバグを発見

ファイルシステムの例で最も重要な部分は、ベンチマークのチャートではありません。

それは検証です。

Intent Labによると、Fleetはコアプロトコルを形式的にモデル化し、約190万状態を探索しました。

そのプロセスにより、コーディングエージェントが生成したコードにバグが発見されました。

そのバグは、分散環境での作成・削除動作中に一時的な破損状態を引き起こす可能性がありました。

Intent Labは、Fleetが実装を修正し、検証を再実行したと述べています。

同社はまた、約300件の統合テストに加え、クラッシュ注入とレプリカを用いたフォールトインジェクションおよびファジングも実施したと報告しています。

形式検証がここで価値を持つのは、ファイルシステムが稀なインターリービングに対して特に脆弱だからです。

従来のテストでは、一般的なパスが機能することを示すことができます。モデルチェッカーは、通常のテストスイートでは決して遭遇しない状態の組み合わせを体系的に探索できます。

この原則はIntent Labの外部でも確立されています。ファイルシステム研究者は、成熟したシステムのクラッシュ整合性やメタデータのバグを発見するために、数十年にわたりモデルチェッキングを使用してきました。

ここでの新しい主張は、自律型エンジニアリングシステムがこの種の検証を自らのビルドループに組み込めるということです。

「動作するコード」と本番ソフトウェアの間に欠けている層

Jia氏の中心的な主張は、3つのデモのいずれよりも広範です。

現代のモデルは素早くコードを書くことができます。

それは、その結果が企業が何年にもわたって運用すべきソフトウェアであることを意味しません。

彼は、残されたギャップは単にモデルのコーディング能力のさらなる飛躍ではないと主張しています。

それはモデルを取り巻くエンジニアリング層です。

これはYangqing Jia氏が投稿したツイートで、投稿者名の横には認証マークが付いており、現在のモデルはコードを書く速度が速いが、実行可能なコードと企業が運用し数年にわたって保守する必要のある本番グレードのソフトウェアとの間には依然として現実的なギャップが存在し、このギャップはモデルの能力の限界ではなく、欠落した層が存在するという彼の中心的な見解を述べています。このツイートは、前述したYangqing Jia氏の中心的な主張に正確に対応しており、モデルが生成したコードの周りに本番システムを構築するために欠落したエンジニアリング層に焦点を当てています。

本番システムには、実装以上のものが必要です。

要件、アーキテクチャ、インターフェース、

トレードオフ、調整、テスト、パフォーマンス分析、信頼性作業、検証、障害処理、保守、そして本番環境からのフィードバック。

コーディングモデルはこれらすべての活動に参加する可能性がある。

Fleetの主張は、これらを一つの自律システムとして組織化する必要があるというものだ。

Fleetはエンジニアリングを6つの段階に分解する

Intent Labはそのエンジニアリングプロセスを6つの段階で説明している。

画像はFleetのワークフローの6つの段階を示している。Understand段階では、Fleetが曖昧な意図を具体的な成果物、制約、受け入れ基準に変換する。Design段階では、Fleetがトレードオフを検討し、インターフェース、コンポーネント、長期的なシステム構造を決定する。Coordinate段階では、システムが大規模プロジェクトをタスクに分割し、依存関係を管理し、実装を設計と整合させる。Build段階では、開発中に新しい情報が現れるにつれて、実装とアーキテクチャ、コードが共に進化する。Verify段階では、Fleetが形式証明などの多方面で作業を検証し、問題はコード変更時に顕在化する。Evolve段階では、システムの実行時に実際の動作が示され、Fleetがパフォーマンスを観察し、使用状況、信頼性、コストを設計にフィードバックし、ソフトウェアは継続的に改善される。

1. Understand(理解)

Fleetは、曖昧な意図を具体的な成果物、制約、受け入れ基準、そして成功の測定可能な定義に変換することを想定している。

2. Design(設計)

Fleetはトレードオフを検討し、インターフェース、コンポーネント、長期的なシステム構造を定義する。

3. Coordinate(調整)

システムは大規模プロジェクトをタスクに分割し、依存関係を管理し、実装を全体的な設計と整合させる。

4. Build(構築)

開発中に新しい情報が現れるにつれて、実装とアーキテクチャは共に進化する。

5. Verify(検証)

検証には、ユニットテスト、統合テスト、ベンチマーク、形式証明、モデル検査、フォールトインジェクション、ファジング、ランタイム検証が含まれる。

6. Evolve(進化)

Fleetは、本番環境のパフォーマンスを観察し、使用状況、信頼性、コストに関する情報を設計にフィードバックすることを意図している。

ここが、Intent Labの野心が自律的なコーディングエージェントを超えて広がる点である。

目標はソフトウェア生成だけではない。

それは自律的なソフトウェア所有権である。

「原則に基づくエンジニアリングチーム」が製品のメタファーである

Intent Labは、Fleetが原則に基づくエンジニアリングチームのように動作すると説明している。

これは有用なメタファーである。なぜなら、強力なエンジニアリング組織のどの一員も、すべての関心事に責任を負うわけではないからだ。

あるエンジニアはカーネルを最適化するかもしれない。別のエンジニアはストレージプロトコルを設計するかもしれない。また別の人物はベンチマークを維持する。さらに別の人物は信頼性をレビューする。

Fleetはそれらの責任を調整されたエージェントの役割に変換しようと試みる。

したがって、難しい問いは、LLMが高品質なコードを書けるかどうかだけではない。

複数の自律プロセスが、同じプロジェクトを長期間にわたって構築、テスト、最適化、検証、改訂しながら、一貫したシステムアーキテクチャを維持できるかどうかである。

経済的議論:ソフトウェアはよりカスタマイズ可能になる

Jiaはまた経済的議論を行っている。

数十年にわたり、ソフトウェア開発には大きな固定費があった。

合理的な戦略は、一つの製品を構築し、それを多くのユーザーに販売し、異なるニーズを持つユーザーに同じソフトウェアへの適応を求めることだった。

自律的エンジニアリングがシステムの構築と維持の固定費を削減すれば、その方程式は変わる。

画像はYangqing JiaがTwitterに投稿したツイートを示している。ツイートの内容は「それが機能すれば、コンピュータエンジニアリングの経済は永遠に変わるだろう。50年間、賢明なやり方は一つのソフトウェアを構築し、異なるニーズがあるにもかかわらずできるだけ多く販売することだった。今、それは変わり得る。世界はよりカスタマイズされたソフトウェアを見るだろう。」ツイートは8時間前に投稿され、右上には「編集」と「...」のオプションがある。この画像は文書内のYangqing Jiaの経済的議論に関連し、コンピュータエンジニアリングの経済変化に関する彼の考えを視覚的に示している。

Intent Labの最初の成果は野心的だが、公開資料では重要な疑問が未解決のまま残されている。

独立した再現

6.3倍の推論結果、SQLiteのテスト数、AgentFSのパフォーマンス、形式検証の数値はすべて同社による報告値である。

独立した再現が行われれば、その主張ははるかに強力なものになるだろう。

Fleetのアーキテクチャ

Intent Labは、Fleet自体を再構築するのに十分な詳細を公開文書として提示していない。

各ロールにどのベースモデルが使われるのか、エージェントがどのように状態を共有するのか、タスクがどのようにスケジュールされるのか、競合がどのように解決されるのか、仕様がどのように保存されるのか、人的監督がどの程度残されているのかは、まだ明確ではない。

本番運用の責任

ベンチマーク品質のシステムを構築することと、それを何年にもわたって運用することは同一ではない。

「進化」段階はこの提言全体で最も困難な部分かもしれない。本番運用の責任者は、セキュリティパッチ、依存関係の変更、ハードウェアの移行、障害、コスト変動、機能追加要求、後方互換性に対応しなければならないからだ。

経済性

自律的なエンジニアリングは、ある種のタスクでは人間のチームよりも安価でありながら、依然として相当な推論リソースと計算リソースを消費する可能性がある。

Intent Lab自身のデータベースの例は、モデルの選択によってプロジェクト全体のコストが数倍変わり得ることを示している。

Intent Labをより正確に捉える方法

Intent Labは、単なる別のコーディングエージェントのスタートアップではない。

その提言は自律的システムエンジニアリングに近いものだ。

作業の対象単位は、コード補完やプルリクエストではない。

それは本番システムである。

だからこそ、最初の3つの例は無関係に見えるのだ。

推論エンジン、データベース、ファイルシステムは、製品レベルではほとんど共通点がない。

しかし、それらには共通のエンジニアリングパターンがある。

意図
→ 仕様
→ アーキテクチャ
→

coordinated implementation
→ measurement
→ verification
→ iteration
→ production evolution

Fleetはそのパターンを自動化することを目的としています。

それが多くの実在の企業で確実に機能するかどうかは、まだ未解決の問いです。

しかし、その野心は明確です。

よくある質問

Intent Labとは何ですか?

Intent Labは、楊慶(Yangqing Jia)と他の経験豊富なシステムエンジニアによって共同設立された、新しいAIインフラストラクチャおよび自律型エンジニアリング企業です。最初の製品であるFleetは、高レベルのソフトウェアインテントを本番級システムに変えるために設計されています。

Fleetとは何ですか?

FleetはIntent Labの自律型エンジニアリングシステムです。同社はこれを、要件を理解し、アーキテクチャを設計し、コードを構築し、結果を検証し、デプロイ後もソフトウェアを進化させ続けることができる連携エージェントのチームと説明しています。

Fleetは本当にGLM-5.2の推論を6.3倍高速化したのですか?

Intent Labは、最適化されたGLM-5.2エンジンが、標準のTensorRT-LLMでの102トークン/秒から、Grace Blackwellノード2基で647トークン/秒に出力速度を向上させたと報告しています。この数字は同社が報告したベンチマークであり、本記事でレビューした情報源ではまだ独立に再現されていません。

Fleetは1つのプロンプトからデータベースを構築したのですか?

Intent Labによると、初期のデータベース要件は「SQLite互換のSQLエンジンを求める」という単一のプロンプトでした。その後Fleetは、同社が約600万件の互換性テストを通過したと言うまで、自律的にアーキテクチャ、コーディング、テスト、レビュー、QAを実行しました。

AgentFSとは何ですか?

AgentFSは、Intent Labの3番目のローンチデモで作成された分散ファイルシステムです。多くのサンドボックスと小ファイルを含むAIエージェントのワークロードに最適化されており、Intent Labはその中核プロトコルが形式モデル検証によってチェックされたと述べています。

Fleetと通常のコーディングエージェントの違いは何ですか?

通常のコーディングエージェントは、既存のプロジェクト内のコード変更に取り組みます。Fleetは、要件定義、アーキテクチャ、実装、パフォーマンス作業、形式検証、障害テスト、本番進化を含む、システムエンジニアリングの全ライフサイクルを調整することを目的としています。

Fleetはオープンソースですか?

Intent Labはデモと製品の考え方を公開していますが、本記事でレビューした情報源には、Fleetの完全なオーケストレーションシステムの公開リリースは示されていません。最新の利用可能性については、Intent Labの公式サイトをご確認ください。

NVIDIA DGX Cloud Leptonはまだ運用されていますか?

はい。NVIDIAは現在、DGX Cloud Leptonに関する製品ページとドキュメントを維持しており、ワークロード、ノードグループ、エンドポイント、Dev Pods、バッチジョブ、持ち込みコンピュート機能などが含まれています。これは、NVIDIA製品がLepton AIの当初のスタートアップロードマップをどの程度保持していたかに関する議論とは別の問題です。

関連ツール

  • Intent Lab: Fleetを構築している企業。インテントを本番ソフトウェアに変える自律型エンジニアリングシステム。
  • NVIDIA TensorRT-LLM: NVIDIA GPU上で大規模言語モデルを最適化・提供するためのNVIDIAの本番推論フレームワーク。
  • TensorRT-LLM on GitHub: NVIDIAのLLM推論スタックのオープンソースリポジトリ。

GLM-5.2: Intent Labの推論エンジンデモで使用された、Z.aiによるオープンウェイトの長時間ホライズンモデル。

  • NVIDIA DGX Cloud Lepton: GPUコンピュートプロバイダーのネットワーク全体でAIワークロードを構築・展開するためのNVIDIAのプラットフォーム。
  • SQLite: Fleetのデータベースデモのターゲットとして、その動作および互換性テストが使用されたデータベース。

関連リンク

まとめ

Yangqing Jia氏の新会社Intent Labは、コード生成ではなく、完全な本番システムのライフサイクルという、異なるAI作業単位を中心にFleetを構築している。

その最初のデモンストレーションは、GLM-5.2の推論最適化、SQLite互換データベース、および形式的に検証された分散ファイルシステムにわたる。Intent Labは、6.3倍の推論高速化、約600万件のデータベース互換性テスト、および約190万状態のファイルシステムに対するモデル検査を報告している。

共通するアイデアは、理解、設計、調整、構築、検証、進化という6段階のエンジニアリングループであり、自律エージェントを用いて強力なエンジニアリング組織の責任を再現しようとするものである。

結果はまだ初期段階であり、大部分が自己報告に依存しているため、再現性と長期的な本番運用が真の試金石となる。

Fleetの最も重要な主張は、AIが一文からコードを書けるということではなく、自律システムが一文と、何年も運用する価値のあるソフトウェアとの間のエンジニアリング作業に対して責任を負えるということである。