양칭지아, 인텐트 랩 출범: 플릿이 한 줄 프롬프트를 프로덕션 시스템으로 전환

Lepton AI가 NVIDIA의 일부가 된 지 1년여 만에, 양칭지아가 다시 시작합니다. 그의 새 회사인 Intent Lab은 전통적인 챗봇이나 클라우드 마켓플레이스로 출발하지 않습니다.

发布于 2026年7月31日generalGEO 评分: 02 次阅读
이미지는 Intent Lab Fleet의 홍보 자료를 보여줍니다. 배경은 어두운 색이며, 흐릿한 Intent Lab Fleet 로고와 속도계 등의 요소가 있습니다. 이미지에는 'Intent Lab Fleet' 및 'GLM-5.2 6.3× Faster' 문구가 강조되어 있으며, 아래에는 'One-Shot Database · Verified File System' 설명이 있습니다. 왼쪽 하단에는 Z.ai와 GLM-5.2 로고가, 오른쪽 하단에는 방패와 체크 표시가 있는 폴더 아이콘이 있습니다. 이 이미지는 문서에서 Intent Lab Fleet을 소개하는 내용과 관련되어 있으며, 기술적 하이라이트를 직관적으로 보여줍니다.

Yangqing Jia, Intent Lab 출범: Fleet, 한 줄의 프롬프트를 프로덕션 시스템으로 전환

서론

Lepton AI가 NVIDIA의 일부가 된 지 1년여 만에, Yangqing Jia가 다시 시작합니다.

그의 새로운 회사인 Intent Lab은 기존의 챗봇, 클라우드 마켓플레이스, 또는 개발자 IDE로 출발하지 않습니다. 대신, 이 회사는 Fleet을 구축하고 있습니다. Fleet은 높은 수준의 의도를 프로덕션급 소프트웨어로 전환하는 자율 엔지니어링 팀으로 설명됩니다.

Intent Lab의 첫 공개 데모에는 서로 매우 다른 세 가지 시스템이 포함됩니다:

  1. 기본 TensorRT-LLM 이상으로 최적화된 GLM-5.2 추론 엔진.
  2. 한 줄의 요구사항으로 구축된 SQLite 호환 데이터베이스.
  3. 공식 검증 및 장애 테스트를 갖춘 AI 에이전트용 분산 파일 시스템.

언뜻 보기에 이 프로젝트들은 하나의 제품 카테고리로 보이지 않습니다.

바로 그것이 핵심입니다.

Intent Lab은 실제 제품이 그 뒤에 있는 엔지니어링 시스템이라고 말합니다. Fleet은 막연한 소프트웨어 요청과 벤치마킹, 검증, 운영, 그리고 프로덕션에서의 진화가 가능한 시스템 사이의 작업을 수행하도록 설계되었습니다.

이미지는 Yangqing Jia가 게시한 트윗으로, Intent Lab 소개에 관한 내용입니다. 트윗은 Intent Lab이 'fleet'이라는 자율 팀을 구축하여 의도를 프로덕션 소프트웨어로 전환하고 있다고 언급합니다. 오늘 초기 성과를 공유합니다: 가장 빠른 GLM5.2 추론 엔진, 한 번에 완성된 데이터베이스 생성, 그리고 완전히 검증된 에이전트 파일 시스템. 아래에는 '세계 최초로 의도를 프로덕션 시스템으로 전환하는 자율 플릿'이라는 제목의 링크와 '의도를 프로덕션 시스템으로 전환 - Intent Lab'이라는 문구가 있습니다. 이 이미지는 맥락과 밀접하게 관련되어 있으며 Intent Lab 및 그 성과에 대한 공식 소개입니다.

이 글의 초기 성능 수치는 Intent Lab의 자체 출시 자료에서 가져온 것입니다. 이는 유망한 데모일 뿐, 독립적인 벤치마크 인증이 아닙니다. 이 회사는 아직 외부 팀이 동일한 조건에서 모든 결과를 확인할 수 있을 만큼 충분한 재현 가능성 세부 정보를 공개하지 않았습니다.

Yangqing Jia, 또 다른 인프라 회사를 시작하다

Yangqing Jia의 경력은 반복적으로 인프라로 돌아왔습니다.

그는 UC 버클리에서 Caffe를 만든 것으로 가장 잘 알려져 있으며, 이후 PyTorch 및 ONNX를 포함한 주요 AI 인프라 프로젝트에 참여했습니다.

2023년 알리바바를 떠난 후, Jia는 Lepton AI를 공동 창업했습니다. 이 회사는 개발자들이 GPU 컴퓨팅과 모델 배포를 더 쉽게 사용할 수 있도록 하는 데 초점을 맞췄습니다.

Lepton의 초기 제안은 Python 네이티브 개발자 경험과 여러 GPU 제공업체에서 AI 워크로드를 실행할 수 있는 인프라를 결합한 것이었습니다.

이 회사는 2025년 NVIDIA에 인수되었으며, 당시 공개적으로 수억 달러 규모의 거래로 설명되었습니다. 이후 업계 보고서에 따르면 그 금액은 약 7억 달러로 추정되지만, NVIDIA는 최종 인수 가격을 공개하지 않았습니다.

Lepton의 기술은 NVIDIA DGX Cloud Lepton의 일부가 되었습니다.

![이미지는 Lepton AI의 클라우드 아키텍처를 보여줍니다. 상단에는 Serverless Cloud, Lepton API Services, Enterprise Deployment 세 개의 섹션이 있습니다. 중간 파란색 영역은 Lepton AI Cloud Architecture로, Deployments(Inference, Training), Jobs(Training, Development), Pods(Development), Fast Runtimes(LLM, SD 등), Global Overlay Network, Infra Health Management, Lepton Optimized Kubernetes 등의 섹션을 포함합니다. 최하단은 Multi Cloud & BYOC Hardware Resources입니다. 이 이미지는 맥락과 밀접하게 관련되어 있으며 Lepton AI의 클라우드 아키텍처 기술 구성을 직관적으로 보여줍니다.](https://we0-cms.oss-cn-beijing.aliyuncs.

NVIDIA는 현재 DGX Cloud Lepton을 클라우드 제공업체와 고객 소유 인프라 전반에 걸쳐 GPU 컴퓨팅을 통합하여 개발, 학습, 추론에 활용하는 활성 플랫폼으로 설명하고 있습니다.

이러한 현재 상태에 대한 설명이 필요한 이유는 Jia가 퇴사한 이후의 논평에서 스타트업 스타일의 원래 Lepton 제품과 그 오픈소스 포부가 인수 이후 변화 없이 유지되지 못했다는 주장이 나왔기 때문입니다.

공개된 증거는 보다 신중한 설명을 뒷받침합니다:

  • 독립 회사였던 Lepton은 NVIDIA에 흡수되었습니다.
  • 브랜드와 기술은 DGX Cloud Lepton의 일부가 되었습니다.
  • NVIDIA는 오늘날에도 DGX Cloud Lepton을 운영하고 문서화하고 있습니다.
  • 공개 Python 라이브러리와 lep CLI는 계속 사용 가능합니다.
  • 더 깊은 플랫폼 구성 요소의 오픈소스화에 대한 기존의 기대 중 일부는 관찰자들이 예상했던 형태로 실현되지 않았습니다.

Jia는 이후 NVIDIA의 시스템 소프트웨어 부사장으로 재직하다 2026년에 회사를 떠났습니다.

Hyperbolic에서의 짧은 방문

2026년 7월, Hyperbolic은 Jia가 GPU 인프라 기업의 고문으로 합류했다고 발표했습니다.

Hyperbolic은 Caffe, ONNX, PyTorch, Lepton AI, NVIDIA, Google, Facebook, Alibaba Cloud에서의 그의 경력이 GPU 접근성 및 인프라에 대한 자사의 작업과 특히 관련이 깊다고 설명했습니다.

이 이미지는 Hyperbolic 회사와 관련된 내용을 보여주며, 왼쪽 상단에 Hyperbolic 로고가 있습니다. 이미지 왼쪽에는 Yangqing Jia의 흑백 초상화가 있고, 오른쪽에는 그가 Hyperbolic이 개발자와 기업이 AI 시스템 학습, 배포 및 확장에 필요한 컴퓨팅 성능을 확보하도록 돕는 일에 주력하고 있으며, Hyperbolic의 고문으로서 해당 팀의 AI 분야 구축을 지원하겠다는 의사를 밝힌 발언이 함께 있습니다. 그의 신분은 Hyperbolic 고문, Lepton AI 공동 창업자로 표기되어 있으며, 이는 문서에서 그가 Hyperbolic에 고문으로 합류한 배경과 관련이 있습니다.

그 역할은 실제로 그의 다음 주요 행보가 아니었습니다.

7월 29일, Jia는 Intent Lab을 공개적으로 소개했습니다.

그의 프레임은 Lepton AI와 달랐습니다.

Lepton은 개발자에게 컴퓨팅 접근성을 높이는 데 중점을 두었습니다.

Intent Lab은 해당 컴퓨팅에서 실행되는 소프트웨어를 생성하고 유지 관리할 수 있는 자율 엔지니어링 시스템을 구축하는 데 중점을 둡니다.

Jia는 자신의 팀이 경력 내내 대규모 시스템을 하나씩 신중하게 구축하는 데 시간을 보냈다고 말하며 이러한 전환을 요약했습니다. 이제 그들이 관심을 갖는 것은 그러한 시스템을 많이 만들어낼 수 있는 시스템이었습니다.

이것은 2026년 7월 29일에 게시된 소셜 플랫폼 게시물로, 게시자는 Yangqing Jia, 계정명은 @jiayq이며, 내용은 팀이 지금까지 오픈소스, 클라우드 인프라 등의 프로젝트를 포함한 대규모 시스템을 항상 직접 구축해 왔으며, 한 번에 하나의 시스템을 만드는 정교한 아키텍처가 주제였다는 점, 현재 관심을 두는 것은 수천 개의 이러한 시스템을 만들어낼 수 있는 '원천'을 만드는 것이라고 언급합니다. 이 내용은 문서에서 소개된 Jia의 Intent Lab 설립 배경과 연결되며, 그가 Intent Lab을 소개하며 언급한 단일 대규모 시스템 구축에서 다중 시스템을 양산할 수 있는 자율 엔지니어링 시스템 구축으로의 전환 핵심 방향에 해당합니다.

Fleet: 세 가지 데모 뒤에 있는 제품

Intent Lab은 자율 엔지니어링 시스템을 Fleet이라고 부릅니다.

회사는 이를 단일 코딩 에이전트가 아닌 팀으로 설명합니다.

이 구분은 중요합니다.

일반적인 코딩 에이전트는 파일 편집, 명령 실행, 테스트 수정, 리포지토리 검색, 기능 구현을 할 수 있습니다.

Fleet은 더 긴 엔지니어링 프로세스를 조정할 수 있는 시스템으로 제시됩니다.

Intent Lab의 목표는 높은 수준의 요청에서 측정 가능한 프로덕션 시스템으로 이동하는 데 필요한 작업을 포괄하는 것입니다.

행동, 검증, 그리고 지속적 개선을 위한 경로.

첫 번째 세 가지 데모는 매우 다른 엔지니어링 영역에서 그 주장을 시험하기 위해 선택되었습니다.

데모 1: 기본 TensorRT-LLM을 넘어선 GLM-5.2 최적화

기술적으로 가장 주목할 만한 출시 성과는 GLM-5.2 추론 엔진입니다.

초기 지시는 본질적으로 하나의 엔지니어링 목표였습니다:

TensorRT-LLM을 재설계하여 GLM-5.2가 Grace Blackwell 노드에서 효율적으로 실행되도록 하고,
최적화 기회를 식별하고, 구현하고, 자율적으로 검증하십시오.

TensorRT-LLM은 이미 NVIDIA의 대규모 언어 모델을 위한 프로덕션 중심 추론 스택입니다.

NVIDIA는 멀티 GPU 및 멀티 노드 서빙, 인플라이트 배칭, 페이징된 KV 캐싱, 양자화, 최적화된 커널, Python 및 C++ 런타임과 같은 기능을 문서화합니다.

따라서 해당 스택 위에서 성능을 개선하는 것은 최적화되지 않은 참조 구현을 최적화하는 것보다 더 까다로운 목표입니다.

Intent Lab, 6.3배 출력 속도 향상 보고

Intent Lab에 따르면 Fleet은 기본 TensorRT-LLM에서 약 다음과 같은 성능으로 시작했습니다:

102 tokens/s

최적화된 런타임은 다음에 도달했습니다:

161 tokens/s

회사의 최적화된 추측 디코딩 경로를 추가한 후, 시스템은 다음에 도달했다고 보고되었습니다:

647 tokens/s

이는 원래 출력 속도의 약 6.3배입니다.

이미지는 Intent Lab의 TensorRT-LLM 최적화 성과를 보여줍니다. 목표는 GLM 5.2를 Grace Blackwell 노드에서 실행하고, 최적화 범주를 식별하여 자율적으로 구현 및 검증함으로써 6.3배 출력 속도 향상을 달성하는 것입니다. 최적화는 커널, 런타임, 통신, 추측 디코딩의 네 가지 범주로 나뉘며, 각각 24%, 16%, 18%, 4.0배 향상되었습니다. 이미지는 또한 102에서 181, 647로의 다양한 최적화 단계별 출력 속도 비교와 성능 이득 분해도(perf gain breakdown)를 보여줌으로써 최적화 효과를 직관적으로 나타냅니다.

Intent Lab은 벤치마크가 두 개의 Grace Blackwell 노드를 사용했다고 밝혔습니다.

회사는 성능 작업을 네 가지 범주로 구분합니다.

커널 최적화: +24%

Fleet은 커널 융합을 적용하고 명령어 수준 제어를 위한 저수준 PTX/SASS 경로를 생성했다고 보고되었습니다.

런타임 최적화: +16%

Intent Lab에 따르면 런타임은 H2D 배칭과 제로 카피 기술을 통해 안정 상태 디코딩에서 반복적인 호스트-대-디바이스 메타데이터 복사를 제거했습니다.

통신 최적화: +18%

Fleet은 집합 연산에 잔여 덧셈과 RMSNorm을 통합한 융합 MNNVL 올리듀스 경로를 사용했다고 보고되었습니다.

추측 디코딩: 약 4배

가장 큰 개별 이득은 추측 디코딩에서 나왔습니다.

Intent Lab에 따르면 최적화된 DSpark 드래프터가 여러 토큰을 제안하고 메인 모델이 이를 배치로 검증하여 디코딩 처리량을 크게 향상시킵니다.

회사는 완전한 엔드투엔드 결과를 기본 베이스라인 대비 534% 개선으로 보고합니다.

이 수치는 Intent Lab 자체 측정 결과입니다. 하드웨어 구성, 워크로드 세부 사항, 배치 설정, 출력 길이, 정밀도, 동시성 및 소프트웨어 버전은 추론 벤치마크에 실질적인 영향을 미칠 수 있습니다.

Fleet의 최적화 루프는 단일 패스보다 팀처럼 작동합니다

Intent Lab에 따르면 Fleet은 반복적인 엔지니어링 루프를 따릅니다:

  1. 루프라인 분석
  2. 병목 현상 식별
  3. 제안
  4. 검증
  5. 복합화
  6. 다음 병목 현상으로 복귀

제안된 최적화가

검증에 실패하면 시스템이 돌아가서 다시 시도합니다.

"복합" 단계가 중요한 이유는 개별적으로 성공한 최적화들이 서로 간섭할 때 성능 엔지니어링이 실패하는 경우가 많기 때문입니다.

Fleet은 결합된 시스템이 여전히 작동하는지 확인한 후에만 변경 사항을 유지하도록 설계되었습니다.

GLM-5.2가 까다로운 목표인 이유

GLM-5.2는 Z.ai의 장기 작업(long-horizon)용 플래그십 모델입니다.

공식 모델 카드에는 100만 토큰 컨텍스트 창, 장기 코딩 및 에이전트 워크로드, 유연한 추론 노력, 개선된 희소 어텐션 아키텍처, MIT 라이선스 하의 오픈 가중치가 강조되어 있습니다.

긴 컨텍스트와 에이전트 워크로드를 가진 대형 모델은 까다로운 서빙 문제를 만듭니다.

가장 빠른 구현은 커널 설계, 메모리 대역폭, KV-캐시 동작, 인터커넥트 대역폭, 배치 크기, 추측 디코딩, 양자화, 호스트 스케줄링, 통신 집합(collectives) 간의 상호작용에 달려 있습니다.

이는 추론 최적화를 자율 엔지니어링 시스템에게 유용한 스트레스 테스트로 만듭니다.

데모 2: 단일 요구사항에서 탄생한 SQLite 호환 데이터베이스

Fleet의 두 번째 공개 프로젝트는 GPU 커널에서 완전히 벗어납니다.

Intent Lab은 시스템에게 SQLite와 호환되는 SQL 데이터베이스 엔진을 구축하도록 요청했습니다.

공개 자료에는 다음과 같은 요구사항이 제시되어 있습니다:

SQLite와 호환되는 SQL 데이터베이스 엔진을 구축하되,
모든 sqllogictest 테스트 케이스를 통과할 수 있다는 의미에서 호환되어야 하며,
성능은 동등하거나 더 빨라야 합니다.

Intent Lab에 따르면 Fleet은 SQLite의 소스 코드나 문서에서 시작하지 않았다고 합니다.

대신 기존 시스템의 동작과 테스트 코퍼스를 승인 계약(acceptance contract)으로 취급했습니다.

이미지는 SQLite와 호환되는 SQL 데이터베이스 엔진을 구축하려는 Fleet의 의도와 프로세스를 보여줍니다. 의도는 기존 코드나 문서에 의존하지 않고 동작과 테스트 코퍼스만을 기반으로 SQLite와 호환되는 SQL 데이터베이스 엔진을 구축하는 것입니다. 프로세스에는 반복적 설계 및 구현, 작업 분업, 모델 무관성 및 비용 효율성 등이 포함됩니다. 또한 다양한 역할이 프로젝트에서 수행하는 활동을 보여주는 운영 시퀀스 다이어그램도 제시됩니다. 이 다이어그램은 컨텍스트와 밀접하게 연관되어 있으며, 컨텍스트에서 설명한 Fleet의 데이터베이스 엔진 구축 의도와 프로세스를 직관적으로 보여줍니다.

회사는 최종 시스템이 약 600만 개의 SQLite 호환성 테스트를 통과했다고 보고합니다.

이 수치는 Intent Lab에서 나온 것이며, 이 기사에서 독립적으로 재현되지는 않았습니다.

하나의 Fleet, 여러 엔지니어링 역할

Intent Lab은 데이터베이스 구축을 프로젝트 전반에 걸쳐 작업하는 여러 역할로 시각화합니다:

  • 의사 결정
  • 아키텍처
  • 코딩
  • 테스팅
  • 리뷰
  • QA

역할들은 단순히 선형적으로 인계되는 방식으로 작동하지 않습니다.

구현이 진행되는 동안 아키텍처가 변경될 수 있습니다. 기능이 추가되는 동안 테스팅이 계속됩니다. 코드베이스가 성장하는 동안 리뷰와 QA가 활성 상태로 유지됩니다.

비용은 모델에 크게 의존합니다

Intent Lab은 또한 비용 비교를 공개했습니다.

동일한 데이터베이스 구축에 대해, 회사는 Opus 4.8을 사용한 실행은 약 $2,000가 들었고, 오픈소스 모델을 사용한 실행은 약 $350가 들었다고 밝혔습니다.

이 수치는 회사가 보고한 것이며, 모델 가격, 토큰 소비, 에이전트 오케스트레이션, 인프라에 따라 달라집니다.

그럼에도 이는 에이전트 엔지니어링의 주요 경제적 질문을 보여줍니다: 단일 모델 호출의 가격이 아니라, 완전한 성공적인 프로젝트의 비용은 얼마인가?

데모 3: 정형

에이전트를 위한 검증된 파일 시스템

세 번째 데모는 AgentFS라는 분산 파일 시스템입니다.

Intent Lab은 클라우드 환경의 에이전트 워크로드를 위해 특별히 설계되었다고 밝혔습니다.

AI 코딩 및 연구 에이전트는 독특한 저장 패턴을 만드는 경향이 있습니다:

  • 많은 임시 샌드박스
  • 대량의 작은 파일
  • 잦은 생성 및 삭제
  • 공유 클라우드 스토리지
  • 높은 메타데이터 변동
  • 수명이 짧은 저장소

Intent Lab은 Amazon EFS와 S3FS를 포함한 기존 시스템을 평가했지만 이러한 워크로드에 한계가 있음을 발견하고, 대신 새로운 파일 시스템을 구축했다고 밝혔습니다.

회사는 메타데이터 중심 작업 전반에 걸쳐 비교 대상 시스템보다 상당한 속도 향상을 달성했다고 주장합니다.

이미지는 AgentFS 분산 파일 시스템의 핵심 기능을 보여줍니다. 상단 제목은 "10배 더 빠른 분산 파일 시스템"입니다. 중간 부분은 git clone, git status 등 Git repo 작업에서 AgentFS, EFS, S3FS의 성능을 비교하며 AgentFS가 가장 우수한 성능을 보여줍니다. 하단은 AgentFS의 구축 목적, 지속적 검증, 장애 감지 및 복구, 형식 검증 등의 특징을 설명하며, 180만 상태의 공식 모델 검사를 통해 코드 에이전트가 단순한 테스트로는 달성할 수 없는 정확성 수준을 보장합니다.

다시 말하지만, 이는 Intent Lab의 출시 벤치마크이지 독립적인 제3자 결과가 아닙니다.

형식 검증이 코딩 에이전트가 놓친 버그를 발견

파일 시스템 예시에서 가장 중요한 부분은 벤치마크 차트가 아닙니다.

바로 검증입니다.

Intent Lab은 Fleet이 핵심 프로토콜을 공식적으로 모델링하고 약 190만 개의 상태를 탐색했다고 밝혔습니다.

이 과정에서 코딩 에이전트가 생성한 코드에서 버그가 발견되었습니다.

이 버그는 분산 생성/삭제 동작 중 일시적인 손상 상태를 초래할 수 있었습니다.

Intent Lab은 Fleet이 구현을 수정하고 검증을 다시 실행했다고 밝혔습니다.

또한 회사는 약 300개의 통합 테스트와 장애 주입, 크래시 및 복제본을 주입한 퍼징 테스트를 수행했다고 보고했습니다.

파일 시스템은 드문 인터리빙(교차 실행)에 특히 취약하기 때문에 형식 검증이 여기서 중요한 가치를 갖습니다.

전통적인 테스트는 일반적인 경로가 작동한다는 것을 보여줄 수 있습니다. 모델 체커는 일반적인 테스트 스위트가 결코 만나지 못할 상태 조합을 체계적으로 탐색할 수 있습니다.

이 원리는 Intent Lab 외부에서도 잘 정립되어 있습니다. 파일 시스템 연구자들은 수십 년간 모델 체킹을 사용하여 성숙한 시스템에서 크래시 일관성 및 메타데이터 버그를 노출시켜 왔습니다.

여기서 새로운 주장은 자율 엔지니어링 시스템이 이러한 스타일의 검증을 자체 빌드 루프에 통합할 수 있다는 것입니다.

"실행되는 코드"와 프로덕션 소프트웨어 사이의 누락된 계층

Jia의 핵심 주장은 세 가지 데모보다 더 광범위합니다.

최신 모델은 코드를 빠르게 작성할 수 있습니다.

그렇다고 그 결과물이 기업이 수년간 운영해야 하는 소프트웨어라는 의미는 아닙니다.

그는 남은 격차가 단순히 모델 코딩 능력의 또 다른 도약이 아니라고 주장합니다.

그것은 모델 주변의 엔지니어링 계층입니다.

이것은 Yangqing Jia가 게시한 트윗으로, 게시자 계정 이름 옆에 인증 배지가 있으며, 현재 모델이 코드를 빠르게 작성하지만 실행 가능한 코드와 기업이 수년간 운영해야 하는 프로덕션 수준 소프트웨어 사이에는 여전히 실질적인 격차가 존재하며, 이 격차는 모델 능력의 한계가 아니라 누락된 계층이 있다는 핵심 주장을 담고 있습니다. 이 트윗은 앞서 언급한 Yangqing Jia의 핵심 주장과 정확히 일치하며, 모델이 코드를 생성한 후 프로덕션 시스템을 구축하는 누락된 엔지니어링 계층에 관한 내용입니다.

프로덕션 시스템은 구현 이상의 것이 필요합니다.

요구사항, 아키텍처, 인터페이스가 필요합니다.

trade-offs, coordination, testing, performance analysis, reliability work, verification, fault handling, maintenance, and feedback from production.

A coding model may participate in all of those activities.

Fleet의 핵심 주장은 이러한 활동들이 하나의 자율 시스템으로 조직되어야 한다는 것입니다.

Fleet는 엔지니어링을 6단계로 구분한다

Intent Lab은 엔지니어링 프로세스를 6단계로 설명합니다.

이미지는 Fleet 작업 흐름의 6단계를 보여줍니다. Understand 단계에서 Fleet는 모호한 의도를 구체적인 결과물, 제약 조건, 승인 기준으로 전환합니다. Design 단계에서 Fleet는 트레이드오프를 검토하고 인터페이스, 구성 요소, 장기 시스템 구조를 결정합니다. Coordinate 단계에서 시스템은 대규모 프로젝트를 작업으로 분할하고 의존성을 관리하며 구현이 설계와 일관성을 유지하도록 합니다. Build 단계에서는 개발 중 새로운 정보가 나타남에 따라 구현이 아키텍처 및 코드와 함께 진화합니다. Verify 단계에서 Fleet는 형식 증명 등 다양한 방식으로 작업을 검증하고 문제는 코드 변경 시 드러납니다. Evolve 단계에서 시스템은 실행 중 실제 동작을 보여주며, Fleet는 성능을 관찰하고 사용, 신뢰성, 비용 정보를 설계에 피드백하여 소프트웨어를 지속적으로 개선합니다.

1. 이해(Understand)

Fleet는 모호한 의도를 구체적인 결과물, 제약 조건, 승인 기준, 측정 가능한 성공 정의로 전환하도록 설계되었습니다.

2. 설계(Design)

Fleet는 트레이드오프를 검토하고 인터페이스, 구성 요소, 장기 시스템 구조를 정의합니다.

3. 조정(Coordinate)

시스템은 대규모 프로젝트를 작업으로 분할하고 의존성을 관리하며 구현이 전체 설계와 일관성을 유지하도록 합니다.

4. 구축(Build)

개발 중 새로운 정보가 나타남에 따라 구현과 아키텍처가 함께 진화합니다.

5. 검증(Verify)

검증에는 단위 테스트, 통합 테스트, 벤치마크, 형식 증명, 모델 체킹, 장애 주입, 퍼징, 런타임 검증이 포함될 수 있습니다.

6. 진화(Evolve)

Fleet는 프로덕션 성능을 관찰하고 사용, 신뢰성, 비용에 대한 정보를 설계에 피드백하도록 설계되었습니다.

이 지점에서 Intent Lab의 야망은 자율 코딩 에이전트를 넘어섭니다.

목표는 단순한 소프트웨어 생성이 아닙니다.

목표는 자율적인 소프트웨어 소유권입니다.

"원칙 있는 엔지니어링 팀"이 제품의 은유이다

Intent Lab은 Fleet가 원칙 있는 엔지니어링 팀처럼 작동한다고 설명합니다.

이는 유용한 은유입니다. 강력한 엔지니어링 조직의 어떤 구성원도 모든 문제를 담당하지 않기 때문입니다.

한 엔지니어는 커널을 최적화할 수 있습니다. 다른 엔지니어는 스토리지 프로토콜을 설계할 수 있습니다. 또 다른 사람은 벤치마크를 유지 관리합니다. 다른 사람은 신뢰성을 검토합니다.

Fleet는 이러한 책임을 조정된 에이전트 역할로 전환하려고 시도합니다.

따라서 핵심 질문은 LLM이 고품질 코드를 작성할 수 있는지 여부만이 아닙니다.

핵심 질문은 여러 자율 프로세스가 동일한 프로젝트를 장기간에 걸쳐 구축, 테스트, 최적화, 검증, 수정하면서 일관된 시스템 아키텍처를 유지할 수 있는지 여부입니다.

경제적 논거: 소프트웨어가 더 맞춤화될 수 있다

Jia는 또한 경제적 논거를 제시합니다.

수십 년 동안 소프트웨어 개발에는 고정 비용이 크게 들었습니다.

합리적인 전략은 하나의 제품을 만들어 많은 사용자에게 판매하고, 서로 다른 요구를 가진 사용자들이 동일한 소프트웨어에 적응하도록 하는 것이었습니다.

자율 엔지니어링이 시스템 구축 및 유지 관리의 고정 비용을 줄인다면, 이 공식은 변화합니다.

![이미지는 Yangqing Jia가 Twitter에 게시한 트윗을 보여줍니다. 트윗 내용은 "그것이 작동한다면 컴퓨터 엔지니어링의 경제는 영원히 바뀔 것입니다. 50년 동안 서로 다른 요구가 있음에도 불구하고 하나의 소프트웨어를 만들어 최대한 많이 판매하는 것이 현명한 방법이었습니다. 이제 그것이 바뀔 수 있습니다. 세계는 더 많은 맞춤형 소프트웨어를 보게 될 것입니다." 트윗은 8시간 전에 게시되었으며 오른쪽 상단에 "편집" 및 "..." 옵션이 있습니다. 이 이미지는 문서에서 Yangqing Jia의 경제적 논증과 관련이 있으며, 컴퓨터 엔지니어링 경제 변화에 대한 그의 생각을 직관적으로 보여줍니다.](https://we0-cms.

Intent Lab은 외부 조직과 이러한 유형의 프로젝트를 진행할 계획이라고 밝혔습니다: 기업들이 필요한 작업이 너무 방대하다는 이유로 연기해 온, 상당한 엔지니어링 가치를 지닌 시스템들이 그 대상입니다.

이것은 "프롬프트 하나로 모든 앱을 만든다"는 것과는 다릅니다

출시 데모는 쉽게 바이럴 헤드라인으로 축약될 수 있습니다:

한 문장이 데이터베이스를 만들었다.

이러한 프레이밍은 Fleet이 수행한다고 주장하는 작업의 대부분을 놓칩니다.

데이터베이스 예시는 하나의 요구사항에서 시작하지만, 시스템은 그 후 긴 엔지니어링 프로세스를 수행합니다.

설계 결정을 반복적으로 내리고, 코드를 생성하고, 테스트를 실행하고, 실패를 진단하고, 아키텍처를 수정하고, 동작을 검토하고, 다시 반복해야 합니다.

사용자는 짧은 의도를 제공합니다.

기계가 반드시 짧은 작업을 수행하는 것은 아닙니다.

더 나은 평가는 인간의 개입이 얼마나 필요했는지, 실행에 얼마나 많은 컴퓨팅이 소모되었는지, 재시도가 몇 번 발생했는지, 결과가 얼마나 잘 검증되었는지, 다른 팀이 이를 재현할 수 있는지, 데모 이후에도 시스템을 유지보수할 수 있는지를 묻습니다.

아직 입증되지 않은 것들

Intent Lab의 첫 결과는 야심차지만, 공개된 자료는 중요한 질문들을 남겨 둡니다.

독립적 재현

6.3배 추론 결과, SQLite 테스트 수, AgentFS 성능, 형식 검증 수치는 모두 회사 자체 보고입니다.

독립적 재현이 이루어진다면 이러한 주장은 훨씬 더 설득력을 얻을 것입니다.

Fleet 아키텍처

Intent Lab은 Fleet 자체를 재구성할 수 있을 만큼 충분한 기술적 세부 사항을 공개적으로 문서화하지 않았습니다.

각 역할에 어떤 기본 모델이 사용되는지, 에이전트가 상태를 어떻게 공유하는지, 작업이 어떻게 스케줄링되는지, 충돌이 어떻게 해결되는지, 사양이 어떻게 저장되는지, 인간의 감독이 어느 정도까지 가능한지 아직 명확하지 않습니다.

운영 소유권

벤치마크 수준의 시스템을 구축하는 것은 수년간 이를 운영하는 것과 동일하지 않습니다.

"Evolve" 단계는 이 논지에서 가장 어려운 부분일 수 있습니다. 운영 책임자는 보안 패치, 의존성 변경, 하드웨어 변화, 장애, 비용 변화, 기능 요청, 하위 호환성을 처리해야 하기 때문입니다.

경제성

자율 엔지니어링은 일부 작업에서 인간 팀보다 저렴할 수 있지만, 여전히 상당한 추론과 컴퓨팅을 소비합니다.

Intent Lab의 자체 데이터베이스 예시는 모델 선택이 총 프로젝트 비용을 몇 배까지 바꿀 수 있음을 보여줍니다.

Intent Lab을 생각하는 더 정확한 방식

Intent Lab은 단순히 또 다른 코딩 에이전트 스타트업이 아닙니다.

그 논지는 자율 시스템 엔지니어링에 더 가깝습니다.

작업의 대상 단위는 코드 완성이나 풀 리퀘스트가 아닙니다.

그것은 운영 시스템입니다.

그렇기 때문에 처음 세 가지 예시가 서로 무관해 보이는 것입니다.

추론 엔진, 데이터베이스, 파일 시스템은 제품 수준에서 공통점이 거의 없습니다.

하지만 그들은 하나의 엔지니어링 패턴을 공유합니다:

의도
→ 사양
→ 아키텍처
→

조정된 구현
→ 측정
→ 검증
→ 반복
→ 프로덕션 진화

Fleet은 이러한 패턴을 자동화하는 것을 목표로 한다.

많은 실제 기업에서 이를 안정적으로 수행할 수 있을지는 여전히 미해결 과제다.

하지만 야망은 분명하다.

자주 묻는 질문

What is Intent Lab?

Intent Lab은 Jia Yangqing과 경험 많은 시스템 엔지니어들이 공동 창업한 새로운 AI 인프라 및 자율 엔지니어링 회사입니다. 첫 번째 제품인 Fleet은 높은 수준의 소프트웨어 의도를 프로덕션 등급 시스템으로 전환하도록 설계되었습니다.

What is Fleet?

Fleet은 Intent Lab의 자율 엔지니어링 시스템입니다. 회사는 이를 요구사항을 이해하고, 아키텍처를 설계하며, 코드를 작성하고, 결과를 검증하며, 배포 후에도 소프트웨어를 지속적으로 진화시키는 조정된 에이전트 팀이라고 설명합니다.

Did Fleet really make GLM-5.2 inference 6.3× faster?

Intent Lab은 최적화된 GLM-5.2 엔진이 기본 TensorRT-LLM의 초당 102토큰에서 두 개의 Grace Blackwell 노드에서 초당 647토큰으로 출력 속도를 높였다고 보고합니다. 이 수치는 회사가 보고한 벤치마크이며, 여기서 검토된 자료에서는 아직 독립적으로 재현되지 않았습니다.

Did Fleet build a database from one prompt?

Intent Lab은 초기 데이터베이스 요구사항이 SQLite 호환 SQL 엔진을 요청하는 단일 프롬프트였다고 말합니다. 이후 Fleet은 회사가 시스템이 약 600만 건의 호환성 테스트를 통과했다고 말할 때까지 아키텍처, 코딩, 테스트, 검토 및 QA를 자율적으로 수행했습니다.

What is AgentFS?

AgentFS는 Intent Lab의 세 번째 출시 데모에서 만들어진 분산 파일 시스템입니다. 많은 샌드박스와 소규모 파일이 포함된 AI 에이전트 워크로드에 최적화되어 있으며, Intent Lab은 핵심 프로토콜이 공식 모델 검증으로 확인되었다고 말합니다.

What is the difference between Fleet and a normal coding agent?

일반 코딩 에이전트는 일반적으로 기존 프로젝트 내에서 코드 변경 작업을 수행합니다. Fleet은 요구사항 정의, 아키텍처, 구현, 성능 작업, 공식 검증, 장애 테스트 및 프로덕션 진화를 포함한 전체 시스템 엔지니어링 수명주기를 조정하도록 설계되었습니다.

Is Fleet open source?

Intent Lab은 데모와 제품 이념을 공개적으로 공유했지만, 이 기사에서 검토된 자료에는 완전한 Fleet 오케스트레이션 시스템의 공개 출시가 표시되어 있지 않습니다. 최신 사용 가능 여부는 Intent Lab 공식 사이트를 확인하세요.

Is NVIDIA DGX Cloud Lepton still operating?

네. NVIDIA는 현재 DGX Cloud Lepton에 대한 제품 페이지와 문서(워크로드, 노드 그룹, 엔드포인트, Dev Pod, 배치 작업, 자체 컴퓨팅 기능 포함)를 유지 관리하고 있습니다. 이는 NVIDIA 제품이 Lepton AI의 원래 스타트업 로드맵을 얼마나 밀접하게 보존했는지에 대한 논쟁과는 별개의 문제입니다.

관련 도구

  • Intent Lab: 의도를 프로덕션 소프트웨어로 전환하는 자율 엔지니어링 시스템인 Fleet을 구축하는 회사.
  • NVIDIA TensorRT-LLM: NVIDIA GPU에서 대규모 언어 모델을 최적화하고 서빙하기 위한 NVIDIA의 프로덕션 추론 프레임워크.
  • TensorRT-LLM on GitHub: NVIDIA LLM 추론 스택의 오픈소스 저장소.

GLM-5.2: Intent Lab의 추론 엔진 데모에 사용된 Z.ai의 오픈 가중치 장기 지평(long-horizon) 모델.

  • NVIDIA DGX Cloud Lepton: GPU 컴퓨팅 제공업체 네트워크 전반에서 AI 워크로드를 구축하고 배포하기 위한 NVIDIA의 플랫폼.
  • SQLite: Fleet의 데이터베이스 데모에서 동작 및 호환성 테스트의 대상으로 사용된 데이터베이스.

관련 링크

요약

Yangqing Jia의 새 회사 Intent Lab은 AI 작업의 다른 단위, 즉 코드 생성이 아닌 완전한 프로덕션 시스템 수명주기를 중심으로 Fleet을 구축하고 있다.

첫 번째 데모는 GLM-5.2 추론 최적화, SQLite 호환 데이터베이스, 그리고 형식 검증된 분산 파일 시스템에 걸쳐 있다. Intent Lab은 6.3배의 추론 속도 향상, 약 600만 건의 데이터베이스 호환성 테스트, 약 190만 개의 파일 시스템 상태에 대한 모델 체킹을 보고한다.

공통된 아이디어는 이해(Understand), 설계(Design), 조정(Coordinate), 구축(Build), 검증(Verify), 진화(Evolve)의 6단계 엔지니어링 루프로, 자율 에이전트를 통해 강력한 엔지니어링 조직의 책임을 재현하려는 것이다.

결과는 아직 초기 단계이며 대부분 자체 보고에 의존하므로, 재현성과 장기적인 프로덕션 운영이 진정한 시험대가 될 것이다.

Fleet의 가장 중요한 주장은 AI가 한 문장에서 코드를 작성할 수 있다는 것이 아니라, 자율 시스템이 한 문장과 수년간 운영할 가치가 있는 소프트웨어 사이의 엔지니어링 작업에 대한 책임을 질 수 있다는 것이다.