Gemini 3.6 Flash 출시 초기 부정적 평가, Gemini 3.5 Pro 출시 지연

Google DeepMind가 **Gemini 3.6 Flash**, **Gemini 3.5 Flash-Lite**, **Gemini 3.5 Flash Cyber** 등 세 가지 새로운 Gemini 모델을 공개했습니다. 하지만 많은 개발자들이 기대했던 **Gemini 3.5 Pro**는 예정대로 출시되지 않았습니다. Google은 3.5 Pro가 여전히 파트너와 함께 테스트 중이며, 준비가 완료되는 대로 광범위하게 출시될 것이라고 밝혔습니다. 한편, 회사는 이른바 '지금까지 가장 야심찬 사전 학습 계획'을 통해 Gemini 4 개발에 착수했음을 확인했습니다.

发布于 2026年7月25日generalGEO 评分: 02 次阅读
어두운 배경 이미지로, 왼쪽에는 파란색 별 모양이 있고 오른쪽에는 대문자로 'Gemini'라는 글자가 있습니다. 중앙에는 'Gemini 3.6 Flash'와 'Reviews · Benchmarks · Pricing' 문구가 강조되어 표시됩니다. 하단에는 3.6 Flash, 3.5 Pro, 경쟁사 1, 경쟁사 2의 수치를 보여주는 차트가 있으며, 3.6 Flash의 수치가 가장 높습니다. 오른쪽에는 파란색 가격 태그 아이콘이 있고 그 아래에 '$' 기호가 있습니다. 맨 아래에는 '3.5 Pro Delay' 문구와 보라색 시계 아이콘이 있습니다. 이 이미지는 문서에서 Gemini 3.6 Flash 관련 내용을 설명하며, 다양한 측면에서의 특징을 강조하고 있습니다.

Gemini 3.6 Flash 출시 직후 혹독한 비판, Gemini 3.5 Pro 출시 연기

서론

Google DeepMind가 세 가지 새로운 Gemini 모델을 발표했습니다: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber입니다.

하지만 많은 개발자들이 기다리던 Gemini 3.5 Pro는 예정대로 출시되지 않았습니다.

Google은 3.5 Pro가 여전히 파트너들과 테스트 중이며, 준비가 완료되면 광범위하게 출시될 것이라고 밝혔습니다. 동시에, 회사는 "지금까지 가장 야심찬 사전 학습 실행"이라고 부르는 것을 통해 Gemini 4 관련 작업을 시작했음을 확인했습니다.

Google DeepMind의 공식 트윗 이미지로, 세 가지 새로운 모델을 소개하고 있습니다. Gemini 3.6 Flash는 3.5 Flash보다 더 적은 토큰을 사용하여 동일한 비용으로 더 높은 품질의 결과물을 제공합니다. Gemini 3.5 Flash-Lite는 문서 처리 및 스마트 검색과 같은 일상적인 작업을 위한 빠르고 비용 효율적인 옵션을 제공합니다. Gemini 3.5 Flash Cyber는 중요한 소프트웨어 취약점을 발견하고 수정하기 위해 구축된 사이버 보안 모델입니다. 이 이미지는 문맥상 위에서 언급된 Google DeepMind의 세 가지 신규 모델 발표에 대한 공식 설명과 밀접하게 관련되어 있으며, 독자들에게 구체적인 정보를 제공합니다.

Google이 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber를 출시했습니다.

이번 출시는 개발자 커뮤니티에서 빠르게 논란을 불러일으켰습니다. 여러 초기 사용자들이 Gemini 3.6 Flash의 프론트엔드 출력이 약하고, 공간 추론이 일관성이 없으며, 경쟁사의 최첨단 모델과 비교했을 때 코딩 성능이 실망스럽다고 비판했습니다.

이러한 비판의 강도는 기존 증거가 뒷받침할 수 있는 수준을 훨씬 넘어섰습니다. 초기의 실제 사용 불만은 분명히 존재했지만, Google 자체의 벤치마크 결과와 독립적인 Artificial Analysis 테스트는 더 복잡한 그림을 보여줍니다: Gemini 3.6 Flash는 여러 코딩, 컴퓨터 사용, 긴 컨텍스트 및 지식 작업 평가에서 3.5 Flash보다 향상되었으며, 동시에 동일한 전체 Artificial Analysis 지능 지수 점수를 유지했습니다.

이 글은 원본 보고서의 구조를 따르면서도 공식 벤치마크 데이터와 커뮤니티 반응을 구분합니다.

Gemini 3.6 Flash, 출시 직후 비판에 직면

Google은 Gemini 3.6 Flash를 프로덕션 환경의 AI 에이전트를 위한 주력 모델로 포지셔닝했습니다.

이 모델은 현재 광범위하게 사용 가능하며, 텍스트, 이미지, 비디오, 오디오 및 PDF 입력을 지원하고, 컨텍스트 창은 1,048,576 입력 토큰, 최대 65,536 출력 토큰입니다. 지원되는 기능으로는 코드 실행, 컴퓨터 사용, 함수 호출, 파일 검색, 구조화된 출력, 검색 접지, URL 컨텍스트 및 사고 추론이 포함됩니다.

Google은 주요 목표가 단순히 더 높은 벤치마크 지능을 달성하는 것이 아니라고 밝혔습니다. 핵심은 Gemini 3.5 Flash보다 더 적은 출력 토큰, 더 적은 추론 단계, 더 낮은 지연 시간 및 더 낮은 출력 토큰 가격으로 작업을 완료하는 데 있습니다.

그럼에도 불구하고, 일부 초기 공개 테스트 결과는 긍정적이지 않았습니다.

프론트엔드 생성, 혹독한 초기 피드백 받아

원본 보고서는 개발자 테스트를 중점적으로 다뤘는데, 여기서 Gemini 3.6 Flash에게 두 번의 프론트엔드 생성 작업이 요청되었습니다.

해당 개발자는 이 결과를 매우 나쁘다고 설명하며, 생성된 애플리케이션 컴포넌트 구조가 산만하고, 논리가 일관성이 없으며, 상호작용이 신뢰할 수 없다고 비판했습니다.

이 이미지는 Aetheria라는 이름의 픽셀 스타일 3D 장면으로, Gemini 3.6 Flash가 대화형 프론트엔드를 생성한 전형적인 결과물을 보여줍니다. 어두운 별이 빛나는 하늘을 배경으로 회색 성, 산지, 수역, 떠 있는 UFO, 떠 있는 발광체 등 픽셀화된 요소가 포함되어 있으며, 보라색 나무, 다채로운 작은 건물 등의 세부 사항도 있습니다. 이미지 왼쪽에는 시간 및 조명, 영화적 시점, 세계 효과의 세 가지 설정 옵션이 있는 장면 매개변수 조정 패널이 있어 표현 효과를 조절할 수 있습니다. 이 이미지는 문서에서 언급된 커뮤니티 테스트 내용에 해당하며, Gemini 3.6 Flash가 생성한 프론트엔드 인터페이스 결과물을 시각적으로 보여줌으로써 개발자가 이 모델의 프론트엔드 생성 품질에 대해 평가한 내용을 뒷받침합니다.

초기 커뮤니티 테스트에서 Gemini 3.6 Flash를 사용하여 대화형 프론트엔드 경험을 생성했습니다.

다른 개발자들도 기존 코드베이스에서 이 모델을 시도한 후 유사한 문제를 보고했습니다. 불만 사항에는 디자인 시스템 제약 조건 무시, 예상치 못한 UI 변경, 그리고 결과물이 초기 Gemini Pro 모델이 생성한 인터페이스보다 더 나빠 보이는 점 등이 포함되었습니다.

이러한 관찰이 중요한 이유는 프론트엔드 코딩이 여러 능력을 동시에 결합하기 때문입니다:

  • 기존 코드베이스 이해
  • 디자인 제약 조건 준수
  • 유효한 코드 생성
  • 기존 동작 유지
  • 시각적으로 일관된 레이아웃 생성
  • 작동 중인 컴포넌트를 깨뜨리지 않고 여러 단계 편집 처리

모델은 코딩 벤치마크에서 높은 점수를 받을 수 있지만, 실제 프론트엔드 작업에서는 여전히 신뢰할 수 없게 느껴질 수 있습니다.

한편, 개별 사례는 통제된 벤치마크가 아닙니다. 프롬프트 품질, 에이전트 프레임워크, 코드베이스 구조, 사고 수준, 도구 접근 권한 및 허용된 반복 횟수는 모두 결과를 크게 바꿀 수 있습니다.

프론트엔드 아레나 결과는 단순한 '최고' 판단을 지지하지 않음

원본 보고서는 프론트엔드 코딩에서 Gemini 3.6 Flash가 Claude Fable 5, GPT-5.6 Sol, Meta Muse Spark 1.1과 같은 모델만큼 좋은 성능을 내지 못했다고 지적했습니다.

WebDev 실시간 아레나 순위표는 지속적으로 업데이트되므로, 더 많은 투표가 들어옴에 따라 순위가 변경될 수 있습니다. 이 글을 작성하는 시점에서 Kimi K3가 일시적으로 선두를 유지하고 있으며, 그 다음으로 Claude Fable 5와 GPT-5.6 Sol이 뒤를 잇고 있습니다.

Gemini 3.6 Flash가 7월 21일에야 출시되었기 때문에, 정적 스크린샷과 초기 순위표 스냅샷은 영구적인 순위로 간주되어서는 안 됩니다.

더 유용한 결론은, Google이 이 모델이 코딩에서 더 강력하다고 밝혔음에도 불구하고, 이 새로운 Flash 모델이 즉시 명확한 프론트엔드 리더로 자리 잡지는 못했다는 점입니다.

공간 추론도 부정적인 반응을 불러일으킴

원본 보고서는 이어서 공간 추론에 대해 다룹니다.

한 개발자가 Gemini 3.6 Flash의 기본 위치 및 방향 관계에 대한 테스트를 기록했으며, Gemini 3.5 Flash보다 더 많은 오류를 보고했습니다.

해당 사용자는 처음에 약한 출력이 높은 사고 수준을 선택하지 않았기 때문인지 의심했습니다. 다른 사용자들이 이후 더 높은 추론 설정을 시도했지만, 여전히 엇갈린 초기 인상을 보고했습니다.

불만 사항에는 공간 관계가 부정확하고 시각적 장면이 일관성이 없다는 점이 포함되었습니다.

이러한 테스트는 다시 표준화된 평가보다는 커뮤니티 관찰을 나타냅니다. 이는 실제 세계의 마찰 사례로 유용하지만, 모델이 공간 추론에서 전반적으로 퇴보했다는 주장으로 확대되어서는 안 됩니다.

Google 공식 문서는 Gemini 3.6 Flash를 멀티모달 및 공간 작업을 위해 설계된 모델로 설명합니다. 독립적인 시각 테스트에서도 여러 이미지 및 비디오 카테고리에서 장점을 발견했지만, 모든 시각 작업에서 3.5 Flash보다 우수한 것은 아닙니다.

CursorBench, 3.5 Flash 대비 개선 보여주지만 최첨단 선두에는 미치지 못함

원본 보고서는 또한 CursorBench를 지적했는데, 이는 Cursor 환경에서의 실제 소프트웨어 엔지니어링 작업을 평가합니다.

널리 퍼진 한 스크린샷은 Gemini 3.6 Flash를 Cursor Composer 2.5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5 및 Claude Sonnet 5와 같은 모델과 비교했습니다.

CursorBench 3.2 점수를 보여주는 차트가 포함된 트윗 스크린샷 이미지입니다. 차트에서 각 모델의 점수는 Grok 4.5, GPT-5.6 Sol, Opus 4.0 등 다양한 색상의 점으로 표시되어 있습니다.

Gemini 3.6 Flash 및 다양한 모델의 CursorBench 점수를 보여주는 차트.

Gemini 3.6 Flash는 차트에서 파란색 점으로 표시되며, 점수가 다른 모델에 비해 낮습니다. 트윗 아래에는 사용자 댓글로 "즉, Gemini 3.6 Flash는 Composer 2.5만도 못하고, Grok 4.5는 말할 것도 없네"라는 내용이 있으며, Gemini 3.6 Flash가 현재 Cursor에서 사용 가능하다고 언급합니다. 이 이미지는 문서 맥락상 CursorBench 테스트 결과를 설명하며, Gemini 3.6 Flash가 해당 테스트에서 일부 모델보다 성능이 낮다는 점을 보여줍니다.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/a0b9be2c-3d78-4695-949c-009046cb9b84-c5ae89ef-5997-469a-a228-6806788968da.png)

메시지 소스가 공유한 스크린샷에서 CursorBench는 Gemini 3.6 Flash를 더 높은 점수를 받은 여러 코딩 모델 아래에 배치합니다.

현재 CursorBench 페이지에는 Gemini 3.6 Flash의 여러 추론 계층이 표시됩니다. 이 내용을 작성할 당시 사용 가능한 최신 공개 결과는 다음과 같습니다:

  • Gemini 3.6 Flash Medium 점수 51.2%
  • Gemini 3.5 Flash 점수 48.8%
  • Gemini 3.6 Flash Low 점수 47.4%

이는 해당 벤치마크에서 중간 추론 구성이 Gemini 3.5 Flash 대비 개선되었음을 의미하지만, 여전히 많은 강력한 코딩 모델에는 뒤처짐을 보여줍니다.

또한 모델 평가는 맥락을 고려해야 한다는 좋은 예시이기도 합니다.

"Gemini 3.6 Flash가 경쟁사보다 나쁘다"는 주장은 특정 벤치마크와 비교 세트에 대해서는 사실일 수 있으며, "Gemini 3.6 Flash가 3.5 Flash보다 개선되었다"는 주장 역시 성립할 수 있습니다.

구글 자체 벤치마크, 실제 개선 입증

구글이 발표한 평가 결과는 커뮤니티의 가장 강한 반응보다 훨씬 긍정적인 그림을 보여줍니다.

회사는 코딩, 머신러닝 엔지니어링, 컴퓨터 사용, 지식 작업, 차트 추론 및 긴 컨텍스트 작업에서 Gemini 3.5 Flash 대비 개선되었다고 보고했습니다.

이는 2026년 7월의 Gemini 3.6 Flash 벤치마크 결과 비교표로, 해당 모델과 다른 AI 모델의 각종 성능 지표 데이터를 보여줍니다. 표는 Gemini 3.6 Flash와 Gemini 3.5 Flash를 중점적으로 비교하며, 두 모델의 각 평가 항목별 수치 차이를 명확히 보여줍니다. 핵심 지표로는 입력/출력 가격, SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1 등 다차원 평가 결과를 포함하며, GPT-4o-Luma, Grok 1.5, Claude Sonnet 5 등 다른 경쟁 모델의 관련 데이터도 포함하여, Google이 공개한 해당 모델의 벤치마크 성능을 전체적으로 직관적으로 제시합니다. 이는 문서에서 소개된 Gemini 3.6 Flash 평가 관련 내용과 대응되며, 문서에서 언급된 모델 성능 향상을 보조적으로 설명합니다.

구글이 2026년 7월 공개한 벤치마크 표로, Gemini 3.6 Flash를 여러 경쟁 모델과 비교합니다.

구글이 보고한 일부 선정 결과는 다음과 같습니다:

벤치마크 Gemini 3.6 Flash Gemini 3.5 Flash
SWE-Bench Pro 58.7% 55.1%
DeepSWE v1.1 49% 37%
Terminal-Bench 2.1 78.0% 76.2%
MLE-Bench 63.9% 49.7%
GDPval-AA v2 1421 1349
OSWorld-Verified 83.0% 78.4%
CharXiv 추론, 도구 없음 85.2% 84.2%
GDM-MRCR v2, 128K 91.8% 77.3%
GDM-MRCR v2, 1M 54.0% 26.6%

또한 구글은 Artificial Analysis Index에서 Gemini 3.6 Flash가 Gemini 3.5 Flash보다 출력 토큰을 17% 덜 소비하며, 일부 DeepSWE 워크로드에서는 토큰 사용량이 최대 65%까지 줄어들 수 있다고 밝혔습니다.

새 모델의 가격은 다음과 같습니다:

  • 입력 토큰 100만 개당 1.50달러
  • 출력 토큰 100만 개당 7.50달러

Gemini 3.5 Flash는 동일한 명시된 입력 가격을 가지지만, 구글 가격 기준 출력 가격은 더 높은 9.00달러입니다.

비교 시작.

에이전트 워크로드의 경우, 비용은 벤치마크 품질뿐만 아니라 모델이 작업을 완료하는 데 사용하는 추론 토큰 수와 도구 루프 횟수에 따라 달라지므로 이러한 차이가 중요합니다.

Artificial Analysis, 3.6 Flash 지능 점수 3.5 Flash와 동일

타사 테스트는 더 절제된 결론을 제시합니다.

Artificial Analysis는 Gemini 3.6 Flash(높은 추론 모드)에 지능 지수 점수 50을 부여했습니다.

이는 Gemini 3.5 Flash의 점수와 동일합니다.

이미지는 Twitter 사용자 @synthwavedd의 트윗으로, Gemini 3.6 Flash의 Artificial Analysis 점수에 대한 내용입니다. 트윗 위 텍스트는 Gemini 3.6 Flash의 Artificial Analysis 점수가 3.5 Flash와 동일하며, Meta Spark 1.1 등 모델보다 성능이 낮다고 표시합니다. 아래 차트는 Artificial Analysis에서 다양한 모델의 점수 현황을 보여주며, Gemini 3.6 Flash의 점수는 차트에서 낮은 위치에 있습니다. 이 이미지는 문서의 "Artificial Analysis가 Gemini 3.6 Flash의 Intelligence Index 점수를 3.5 Flash와 동일하게 평가했다"는 내용과 관련되어 있으며, 점수 현황을 직관적으로 보여줍니다.

Artificial Analysis는 3.5 Flash에서 3.6 Flash로의 전체 지능 지수 점수 향상을 발견하지 못했습니다.

이 결과는 일부 실망감의 이유를 설명합니다.

모델 번호만 보는 개발자는 전체 지능이 눈에 띄게 향상되기를 기대했을 수 있습니다. 대신, Artificial Analysis는 효율성과 작업 완료 시간 개선을 측정할 때 전체 지능이 대체로 동일하다는 것을 발견했습니다.

해당 테스트에 따르면 Gemini 3.6 Flash의 속도는 초당 약 251개의 출력 토큰으로, 비교 대상 중 가장 빠른 모델 중 하나입니다.

또한 Artificial Analysis는 Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite 모두 작업당 소요 시간이 이전 제품에 비해 약 절반으로 줄었다고 보고했습니다.

따라서 주요 개선 사항은 다음과 같이 더 정확하게 설명할 수 있습니다:

전반적인 지능은 유사하나, 완료 속도가 더 빠르고, 출력 토큰이 더 적으며, 많은 워크로드에서 작업당 비용이 더 낮습니다.

이는 획기적인 지능적 돌파구만큼 눈에 띄지는 않지만, 고용량 프로덕션 등급 에이전트에게는 여전히 중요한 의미를 가집니다.

가성비, 온라인 불만이 암시하는 것보다 더 미묘하다

일부 사용자들은 Gemini 3.6 Flash가 지능 벤치마크에서 더 높은 점수를 받은 경쟁 모델보다 비싸다고 비판합니다.

이미지는 Jean P.D. Meijer가 Gemini 3.6 Flash의 가격 대비 성능 문제에 대해 질문하는 Twitter 스크린샷입니다. Intelligence Index 대 Cost per Intelligence Index Task 그래프를 보여주며, 가로축은 작업당 비용(달러), 세로축은 Intelligence Index입니다. 그래프에는 GPT 5.6 Sol High, Grok 4.5 등 여러 모델이 서로 다른 색상으로 표시되어 있습니다. Gemini 3.6 Flash는 그래프에서 비교적 높은 위치에 있으며 비용도 상대적으로 높습니다. 이 이미지는 문서 맥락과 밀접하게 관련되어 Gemini 3.6 Flash의 비용 및 성능 측면을 시각적으로 보여주며, 문서에서 언급된 가격 및 성능 논란에 대응합니다.

이 출처는 Gemini 3.6 Flash의 비용 대비 지능 균형에 대한 우려를 지적합니다.

단순한 토큰당 가격만으로는 모든 것을 설명할 수 없습니다.

추론 단계나 출력 토큰을 적게 사용하는 모델은 공시된 토큰 가격이 가장 저렴하지 않더라도 작업을 더 저렴하게 완료할 수 있는 경우가 있습니다.

반대로, 더 저렴한 모델이라도 반복 재시도나 더 긴 생성이 필요하면 실제 사용 시 더 비싸질 수 있습니다.

개발자에게 더 나은 지표는 일반적으로 자체 워크로드를 측정한 성공적인 작업당 비용입니다.

정보

지식 마감일에 대한 더 많은 증거 필요

원본 기사는 또한 한 사용자가 Gemini 3.6 Flash가 2025년과 2026년의 많은 사건에 대해 알지 못한다고 주장했다고 인용했으며, 표면적으로는 더 최신의 지식 날짜를 표시했음에도 그렇다고 합니다.

해당 사용자는 모델의 실제 지식이 2025년 1월경에 멈춘 것으로 보인다고 결론지었습니다.

우리는 이 테스트에 신중해야 합니다.

언어 모델이 특정 사건을 기억하지 못한다는 것 자체가 훈련 데이터에 특정 마감일이 있음을 증명하지는 않습니다. 검색 행동, 추론 오류, 프롬프트 표현, 안전 필터, 훈련 범위 불완전 또는 불확실성 등 다양한 이유로 이런 현상이 발생할 수 있습니다.

Google이 공개한 모델 문서는 소셜 미디어 테스트에서 주장된 특정 마감일을 독립적으로 확인하기에 충분한 정보를 제공하지 않습니다.

최신 정보를 위해 개발자는 모델의 내부 메모리가 특정 날짜까지 완전하다고 가정하기보다는 Google 검색이나 기타 검증된 검색 출처를 활용해야 합니다.

Gemini 3.5 Flash-Lite, 속도에 집중

Google은 고처리량, 저지연 에이전트 워크로드를 위해 설계된 Gemini 3.5 Flash-Lite도 출시했습니다.

AI 분석 기관은 이 모델의 속도를 초당 약 350개 토큰 출력으로 측정했습니다.

Google이 제시한 API 가격은 다음과 같습니다.

  • 입력 토큰 100만 개당 0.30달러
  • 출력 토큰 100만 개당 2.50달러

이는 Gemini 3.6 Flash보다 훨씬 저렴합니다.

이 모델은 다음 워크로드에 적합합니다.

  • 에이전트 검색
  • 문서 처리
  • 고처리량 데이터 추출
  • 번역
  • 요약 생성
  • 하위 에이전트 실행

Google은 Flash-Lite가 구성 가능한 사고 수준과 내장된 컴퓨터 사용 기능도 지원한다고 밝혔습니다.

공식 비교에 따르면 Gemini 3.1 Flash-Lite 대비 상당한 개선이 있었으며, 여기에는 다음이 포함됩니다.

  • 터미널 벤치마크 2.1: 54% 대비 31%
  • GDM-MRCR v2: 72.2% 대비 60.1%
  • GDPval-AA v2: 1140 대비 642

또한 몇몇 에이전트 벤치마크에서 구형 Gemini 3 Flash를 능가했습니다.

초기 보도에서는 답변이 틀리면 아무리 빨라도 소용없다고 주장했습니다. 일반 원칙으로는 타당하지만, 벤치마크 증거는 Flash-Lite를 단순히 '더 빠르지만 더 나쁜' 모델로 보는 것을 지지하지 않습니다.

Google의 명시된 목표는 다릅니다. 완전한 최첨단 지능이 필요하지 않은 고처리량 워크로드에 더 작은 모델을 사용하는 것입니다.

Gemini 3.5 Flash Cyber, 취약점 연구에 집중

세 번째 신규 모델은 Gemini 3.5 Flash Cyber입니다.

이는 Gemini 3.5 Flash를 기반으로 사이버 보안 작업에 맞게 미세 조정되었습니다. 예를 들면 다음과 같습니다.

  • 소프트웨어 취약점 찾기
  • 보안 문제 검증
  • 패치 생성
  • 자동화된 방어 분석 지원

Google은 이 모델이 CodeMender 내부에서 사용되며, 여러 Flash Cyber 에이전트가 협력하여 각자의 발견을 하나의 보고서로 통합할 수 있다고 밝혔습니다.

Gemini 3.6 Flash 및 Flash-Lite와 달리 Flash Cyber는 일반 공개 모델로 출시되지 않았습니다.

Google은 자동화된 취약점 발견으로 인한 이중 용도 위험 때문에 제한된 액세스 권한의 CodeMender 시범 프로그램을 통해 정부 및 신뢰할 수 있는 파트너에게 제공될 것이라고 밝혔습니다.

Google DeepMind의 별도 발표에 따르면 이 모델은 대규모 취약점 발견 및 패치를 더 큰 최첨단 모델을 사용하는 것보다 저렴하게 만드는 것을 목표로 합니다.

Gemini 3.5 Pro, 아직 준비되지 않음

많은 개발자에게 가장 큰 뉴스는 출시되지 않은 모델입니다. Google은 다음과 같이 밝혔습니다.

Gemini 3.5 Pro는 현재 파트너와 함께 테스트 중이며, 준비가 완료되는 대로 일반에 공개될 예정입니다.

이는 플래그십 모델이 예상보다 지연되었음을 확인시켜줍니다. Reuters 등 일부 언론은 Gemini 3.5 Pro가 6월에 출시될 예정이었으며, 코딩 성능이 지연 요인 중 하나였다고 보도했습니다. Google은 7월 21일 발표에서 새로운 공개 출시일을 제시하지 않고, 모델이 자체 품질 기준에 도달했을 때 출시하겠다고 강조했습니다.

이는 3.6 Flash 출시에 매우 중요합니다. 이 새로운 Flash 모델은 Gemini 3.5 Pro의 대체재가 아닙니다. 제품 라인업에서 다른 위치를 차지합니다. 비용, 속도, 멀티모달 작업 및 자율 실행에 최적화된 프로덕션 중심 모델입니다.

Gemini 4, 역대 최대 규모 사전 훈련 시작

한편, Google은 차세대 Gemini 훈련을 시작했음을 확인했습니다. Google은 Gemini 4를 현재까지 가장 야심 찬 사전 훈련 프로젝트라고 설명했습니다.

이미지는 Twitter 사용자 Logan Kilpatrick이 2026년 7월 21일 오후 11시 50분에 게시한 트윗입니다. 트윗 내용은 "우리는 현재까지 가장 야심 찬 사전 훈련 프로젝트인 Gemini 4를 시작했으며, 현재 진행 상황에 매우 기대됩니다 :)"이며, 파란색 인증 마크와 Google 아이콘이 함께 있습니다. 이 트윗은 Google이 차세대 Gemini 훈련을 시작했음을 확인하는 문서 내용과 관련되어 있으며, Gemini 4 사전 훈련 프로젝트에 대한 중요성을 보여줍니다.

Google은 Gemini 4 사전 훈련 작업이 이미 진행 중이라고 밝혔습니다.

이는 특이한 제품 타임라인을 형성합니다.

  1. Gemini 3.6 Flash: 일반 사용 가능
  2. Gemini 3.5 Flash-Lite: 일반 사용 가능
  3. Gemini 3.5 Flash Cyber: 제한적 배포
  4. Gemini 3.5 Pro: 파트너 테스트 중
  5. Gemini 4: 사전 훈련 시작

정보 출처 기사는 이를 Google이 플래그십 Pro 모델이 완성되지 않은 상태에서 버전 번호를 서두르고 있다는 신호로 해석했습니다. 이는 추측성 해석입니다. 대규모 AI 조직은 일반적으로 현재 세대의 모든 제품이 출시 절차를 완료하기 전에 미래 세대 모델 훈련을 시작합니다.

사전 훈련, 사후 훈련, 안전 평가, 제품 통합 및 서비스 배포는 병행하여 진행할 수 있습니다.

그럼에도 불구하고 Pro 버전의 지연된 출시는 분명 Google에 부담을 가중시켰습니다. 코딩과 자율 워크플로우가 OpenAI, Anthropic, Moonshot, xAI, Meta 및 기타 모델 제공업체들의 주요 경쟁 분야가 되었기 때문입니다.

Gemini 3.6 Flash가 정말 Google의 최악의 모델인가요?

기존 증거는 이 결론을 뒷받침하지 않습니다. 현재 세 가지 별개의 일이 동시에 발생하고 있습니다.

1. 일부 초기 개발자들은 실제로 이 모델을 좋아하지 않습니다.

부정적인 프론트엔드 및 공간 추론 테스트 결과는 실제 사용자 보고에서 비롯되었습니다. 이러한 보고는 주목할 가치가 있습니다. 벤치마크가 생산 품질을 완전히 반영하지 못하기 때문입니다.

2. Google 자체 데이터는 3.5 Flash 대비 상당한 개선을 보여줍니다.

이 모델은 더 적은 출력 토큰을 사용하면서 DeepSWE, MLE-Bench, OSWorld, GDPval 및 긴 컨텍스트 평가에서 개선되었습니다.

3. 타사 종합 지능 지표는 거의 변하지 않았습니다.

Artificial Analysis는 3.6 Flash에 대해 다음과 같은 점수를 부여했습니다.

지능 지수 점수는 3.5 Flash와 동일합니다. 이는 이번 출시가 원시 지능의 비약적인 도약보다는 효율성 향상에 주로 초점을 맞추고 있다는 관점을 뒷받침합니다.

개발자에게 올바른 질문은 이 모델이 주목할 만한 레이블에 걸맞은지 여부가 아닙니다.

더 적절한 질문은 속도, 비용, 품질 및 안정성의 조합이 특정 애플리케이션 시나리오에 적합한지 여부입니다.

Gemini 3.6 Flash는 특정 프론트엔드 워크플로우에는 적합하지 않을 수 있지만, 높은 처리량의 멀티모달 에이전트에게는 좋은 선택이 될 수 있습니다. 이 두 경우는 모순되지 않습니다.

자주 묻는 질문

Gemini 3.6 Flash란 무엇인가요?

Gemini 3.6 Flash는 프로그래밍, 지식 작업, 컴퓨터 사용 및 에이전트 워크플로우에 최적화된 Google의 프로덕션용 멀티모달 모델입니다. 100만 개 이상의 입력 토큰 컨텍스트 윈도우를 지원하며, Gemini API 및 기타 Google 제품을 통해 공개적으로 사용할 수 있습니다.

Gemini 3.6 Flash가 Gemini 3.5 Flash보다 더 나쁜가요?

전반적으로 그렇지 않습니다. Artificial Analysis는 두 모델에 동일한 지능 지수 점수를 부여했지만, Google은 3.6 Flash가 더 적은 출력 토큰을 사용하면서 여러 프로그래밍, 컴퓨터 사용, 지식 작업 및 긴 컨텍스트 벤치마크에서 개선되었다고 보고했습니다.

개발자들이 Gemini 3.6 Flash를 비판하는 이유는 무엇인가요?

일부 초기 사용자들은 프론트엔드 생성 능력 부족, UI 편집 오류 발생 가능성, 공간 추론의 일관성 부족을 보고했습니다. 이는 통제된 벤치마크가 아닌 일회성 테스트에 해당하므로 결과는 프롬프트, 코드베이스, 도구 및 사고 체계에 따라 달라질 수 있습니다.

Gemini 3.6 Flash의 가격은 얼마인가요?

Google은 Gemini 3.6 Flash의 가격을 입력 토큰 100만 개당 1.50달러, 출력 토큰 100만 개당 7.50달러로 책정했습니다. 가격은 변동될 수 있으므로 개발자는 Gemini API 공식 문서에서 현재 요금을 확인해야 합니다.

Gemini 3.5 Flash-Lite의 속도는 어떤가요?

Artificial Analysis 측정 결과 Gemini 3.5 Flash-Lite는 초당 약 350개의 출력 토큰을 처리합니다. Google은 문서 처리 및 에이전트 검색과 같은 높은 처리량과 낮은 지연 시간이 요구되는 작업에 맞게 설계했습니다.

Gemini 3.5 Flash Cyber란 무엇인가요?

Gemini 3.5 Flash Cyber는 Gemini 3.5 Flash를 기반으로 한 사이버 보안 특화 모델입니다. Google은 일반 공개 API 모델이 아닌 CodeMender를 통해 정부 및 신뢰할 수 있는 파트너에게 제공할 계획입니다.

Gemini 3.5 Pro는 언제 출시되나요?

Google은 새로운 공개 출시 날짜를 발표하지 않았습니다. 회사는 Gemini 3.5 Pro가 파트너들과 테스트 중이며 준비되는 대로 광범위하게 출시될 것이라고 밝혔습니다.

Google이 이미 Gemini 4를 훈련하고 있나요?

네. Google은 지금까지 가장 야심찬 사전 훈련 프로그램인 Gemini 4를 시작했다고 밝혔습니다. 해당 회사는 Gemini 4의 공개 출시 날짜를 아직 발표하지 않았습니다.

관련 도구

  • Google AI Studio: Gemini 모델을 테스트하고 Gemini API를 통해 구축하기 위한 Google의 브라우저 기반 환경입니다.
  • Gemini API: Gemini 3.6 Flash 기능, 제한 사항 및 모델 식별자에 대한 공식 개발자 문서입니다.
  • Gemini: 현재 Gemini 모델을 사용하기 위한 Google의 소비자 지향 인터페이스입니다.
  • Vertex AI: Gemini 모델을 배포하고 관리하기 위한 Google Cloud의 엔터프라이즈급 플랫폼입니다.

CursorBench: 코드베이스 이해, 편집, 디버깅 및 지능형 소프트웨어 엔지니어링 작업을 평가하기 위한 Cursor의 벤치마크 플랫폼입니다.

  • Artificial Analysis: 지능 수준, 속도, 지연 시간, 가격 및 토큰 사용량을 포함한 독립적인 모델 테스트입니다.
  • CodeMender: Gemini 3.5 Flash Cyber를 기반으로 구축된 Google DeepMind의 보안 에이전트 환경입니다.

관련 링크

Flash Cyber 출시](https://deepmind.google/blog/introducing-gemini-3-5-flash-cyber/): 사이버 보안 모델, CodeMender 통합 및 제한적 배포에 대한 공식 설명.

요약

구글이 7월에 출시한 Gemini 시리즈에는 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber가 포함되며, Gemini 3.5 Pro는 여전히 파트너 테스트 단계에 있습니다.

초기 개발자들은 3.6 Flash의 프론트엔드 및 공간 추론 테스트 결과에 대해 매우 부정적인 반응을 보였고, 해당 모델은 가장 강력한 코딩 벤치마크에서 선두를 차지하지 못했습니다. 그러나 구글이 발표한 테스트 결과에 따르면, 이 모델은 여러 중요한 작업에서 3.5 Flash 대비 뚜렷한 성능 향상을 보였으며, Artificial Analysis 역시 동일한 종합 지능 점수를 유지하면서 더 나은 속도와 효율성을 제공한다고 확인했습니다.

Gemini 3.5 Flash-Lite는 높은 처리량 작업을 대상으로 하고, Flash Cyber는 방어적 보안 분야에 특화되어 있으며, 구글은 이미 Gemini 4의 사전 학습 작업을 시작했습니다.

가장 정확한 해석은 Gemini 3.6 Flash가 구글의 '최악의 모델'이라는 것이 아니라, 효율성에 중점을 둔 출시라는 점입니다. 실제 초기 시장 반응은 구글의 공식 벤치마크 결과보다 훨씬 더 복잡합니다.