서론
구글이 세 가지 새로운 Gemini 모델을 출시하며 에이전트 시장의 각기 다른 분야를 겨냥했습니다:
- Gemini 3.6 Flash – 주로 코딩, 멀티모달 작업, 다단계 에이전트를 위한 주력 모델
- Gemini 3.5 Flash-Lite – 높은 처리량과 지연 시간에 민감한 워크로드에 최적화
- Gemini 3.5 Flash Cyber – 소프트웨어 취약점 발견, 검증 및 패치를 위한 제한된 사이버 보안 모델
구글의 발표는 효율성에 초점을 맞췄습니다. 새로운 Flash 모델이 더 적은 출력 토큰, 더 적은 도구 호출, 더 낮은 실행 루프 오버헤드로 작업을 완료할 수 있다고 밝혔습니다. 가격도 Gemini 3.5 Flash보다 낮습니다.
이 부분은 구글의 내부 벤치마크와 초기 독립 테스트에서 뒷받침됩니다.
더 복잡한 문제는 Gemini 3.6 Flash가 대체하는 모델보다 지능 면에서 실질적인 향상을 보였는지 여부입니다.
Artificial Analysis는 종합 지능 지수에서 새 모델이 Gemini 3.5 Flash와 동일한 점수를 기록했습니다. 초기 사용자들도 특히 시각 디자인, 중국어 생성, 도구 선택, 지시 따르기 측면에서 엇갈린 경험을 보고했습니다.
결과가 단순한 실패는 아닙니다. Gemini 3.6 Flash는 더 빠르고 출력이 간결하며 많은 워크로드에서 작업당 비용이 더 낮아 보입니다. 또한 여러 코딩, 컴퓨터 사용, 머신러닝, 지식 작업 벤치마크에서 개선된 모습을 보였습니다.
하지만 이번 출시는 중요한 차이점을 보여줍니다:
모델이 일반 지능이나 주관적 출력 품질에서 동등한 큰 향상 없이도 효율성을 높일 수 있습니다.

세 가지 새 Gemini 모델 개요
| 모델 | 주요 역할 | 백만 토큰당 API 가격 | 기본 사고 수준 | 제공 가능 여부 |
|---|---|---|---|---|
| Gemini 3.6 Flash | 코딩, 멀티모달 작업, 복잡한 에이전트 워크플로 | 입력 $1.50 / 출력 $7.50 | 중간 | 완전 제공 |
| Gemini 3.5 Flash-Lite | 고용량 추출, 검색, 번역, 라우팅, 하위 에이전트 | 입력 $0.30 / 출력 $2.50 | 최소 | 완전 제공 |
| Gemini 3.5 Flash Cyber | 취약점 발견, 검증, 패치 | 공개되지 않음 | 전문화 | 정부 및 신뢰 파트너 대상 제한적 시범 |
Gemini 3.6 Flash와 Gemini 3.5 Flash-Lite는 모두 다음을 지원합니다:
- 최대 100만 개 토큰 컨텍스트
- 최대 64,000개 출력 토큰
- 텍스트, 이미지, 오디오, 비디오 입력
- 텍스트 출력
- 구성 가능한 사고 수준
- 컴퓨터 사용을 포함한 내장 도구
- Gemini API 및 Google AI Studio를 통한 접근
구글의 모델 카드는 두 가지 완전 제공 모델의 지식 기준일을 2026년 3월로 명시합니다.
Gemini 3.6 Flash: 더 적은 토큰과 더 낮은 작업 비용
Gemini 3.6 Flash는 Gemini 3.5 Flash를 기반으로 하며, 코딩, 지식 작업, 멀티모달, 에이전트 워크로드 등 많은 부분에서 이를 대체하도록 설계되었습니다.
가장 일관된 개선점은 효율성입니다.
구글은 AI 분석 지수에서 Gemini 3.6 Flash가 Gemini 3.5 Flash보다 출력 토큰을 17% 적게 사용한다고 보고했습니다. DeepSWE를 포함한 일부 에이전트 코딩 평가에서는 출력 토큰이 최대 **65%**까지 감소했습니다.
해당 모델은 또한 다음을 선호합니다:
- 더 적은 추론 단계
- 더 적은 도구 호출
- 더 짧은 실행 루프
- 더 적은 불필요한 코드 변경
- 더 간결한 최종 출력
이러한 변화가 중요한 이유는 에이전트 비용이 공개된 토큰당 가격에만 좌우되지 않기 때문입니다.
오래 실행되는 에이전트는 모델을 반복적으로 호출하고, 대규모 도구 정의를 전송하며, 파일을 확인하고, 코드를 실행하고, 오류에서 복구하며, 많은 추론 출력을 생성할 수 있습니다. 토큰당 가격 변화가 크지 않더라도 호출 횟수와 토큰 수를 줄이면 총비용을 낮출 수 있습니다.
Gemini 3.6 Flash 가격
구글은 다음과 같은 API 가격을 제시합니다:
| 토큰 유형 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 입력 | 백만 개 토큰당 $1.50 | 백만 개 토큰당 $1.50 |
| 출력 | 백만 개 토큰당 $7.50 | 백만 개 토큰당 $9.00 |
입력 가격은 동일하게 유지된 반면, 출력 가격은 약 16.7% 하락했습니다.
평가 설정에서 Artificial Analysis는 Gemini 3.6 Flash의 작업당 평균 비용을 약 $0.50, Gemini 3.5 Flash는 $0.59로 측정했습니다. 이는 출력 가격 인하와 생성 토큰 감소로 인해 약 18%의 하락을 의미합니다.
이 수치는 워크로드별 특성으로 간주되어야 하며 보편적으로 적용할 수 없습니다. 실제 비용은 다음에 따라 달라집니다:
- 프롬프트 크기
- 사고 수준
- 출력 길이
- 호출 횟수
- 도구 사용
- 컨텍스트 캐싱
- 재시도 동작
- 에이전트 프레임워크 유형
- 애플리케이션이 매 턴 전체 대화를 전송하는지 여부
더 빠른 완료 속도, 단순히 더 빠른 토큰 생성 속도 이상
Artificial Analysis는 Gemini 3.6 Flash의 평균 작업 시간이 약 1.3분으로, Gemini 3.5 Flash의 약 2.7분보다 낮다고 보고했습니다.
이 개선은 더 빠른 출력과 더 경제적인 추론 과정에서 비롯됩니다.
빠르게 토큰을 생성하는 모델이라도 반복적인 도구 호출 루프에 빠지면 여전히 오랜 시간이 걸릴 수 있습니다. 반대로 약간 느린 모델이더라도 더 적은 호출로 올바른 솔루션을 찾으면 더 일찍 완료될 수 있습니다.
에이전트 개발자에게 완료된 작업당 소요 시간은 일반적으로 원시적인 초당 토큰 생성 수보다 더 유용합니다.
코딩, 머신러닝, 컴퓨터 사용 및 지식 작업
구글은 여러 벤치마크 카테고리에서 개선을 보고했습니다.
코딩 및 소프트웨어 엔지니어링
DeepSWE에서 Gemini 3.6 Flash는 Gemini 3.5 Flash와 비교하여 37%에서 49%로 성능이 향상되었습니다.
구글은 해당 모델이:
- 불필요한 편집을 더 적게 생성
- 더 짧은 디버그 루프 사용
- 요구되는 범위를 더 엄격히 준수
- 생산 수준에 더 가까운 코드 생성
- 변경 전에 프로그래밍 방식으로 프로젝트를 확인하는 경향
마지막 항목에는 절충점이 있습니다.
구글의 개발자 가이드에 따르면 Gemini 3.6 Flash는 편집 전에 진단 스크립트를 실행할 수 있으며, 이는 복잡한 작업의 정확성을 높일 수 있습니다. 하지만 간단한 프런트엔드 작업에서는 이러한 추가 탐색 단계가 지연을 증가시킬 수 있지만 결과를 항상 개선하지는 않습니다.
구글은 또한 인간 평가자들이 Gemini 3.6 Flash가 더 실용적인 코드를 생성했음에도 불구하고 때때로 초기 모델의 시각적 레이아웃과 스타일을 더 선호한다고 밝혔습니다. 따라서 인터페이스를 구축하는 개발자는 더 명확한 시각적 디자인 제약 조건을 제공해야 할 수도 있습니다.
머신러닝 연구
MLE-Bench에서 구글이 보고한 결과는 49.7%에서 63.9%로 향상되었습니다.
이 평가는 고립된 코딩 문제가 아닌 실제 머신러닝 엔지니어링 및 연구 작업에 초점을 맞춥니다. 이러한 향상은 실험, 데이터 처리, 구현 및 반복적 개선이 필요한 워크플로우에서 모델 성능이 더 우수함을 시사합니다.
컴퓨터 사용 능력
OSWorld-Verified에서 구글이 공개한 비교에 따르면 Gemini 3.6 Flash는 78.4%에서 83.0%로 향상되었습니다.
컴퓨터 사용 능력은 이제 Gemini API 및 Gemini Enterprise를 통해 내장 클라이언트 도구로 제공됩니다. 이를 통해 에이전트 시스템이 직접 API에만 의존하지 않고 그래픽 인터페이스와 상호작용할 수 있습니다.
컴퓨터 사용 능력의 벤치마크 결과는 여전히 에이전트 프레임워크, 화면 환경, 작업 설계 및 장애 복구 전략의 영향을 받습니다. 더 높은 점수는 유용하지만, 프로덕션 시스템은 중요한 작업에 대해 엄격한 권한 및 확인 단계가 여전히 필요합니다.
지식 작업
GDPval-AA v2에서 Gemini 3.6 Flash는 1349에서 1421로 향상되었습니다.
구글은 다음과 같은 적용 시나리오를 강조했습니다:
- 문서 파싱
- 차트 해석
- 재무 데이터 분석
- 보고서 초안 작성
- 녹음 분석
- 코드 마이그레이션
- 멀티모달 연구 워크플로우
Figma, Harvey, Hebbia 및 JetBrains를 포함한 고객들은 구글의 발표에 긍정적인 평가를 제공했습니다. 이러한 추천사는 고객 경험을 반영하며 독립적인 벤치마크로 간주되어서는 안 됩니다.
지식 마감일 및 컨텍스트 윈도우
Gemini 3.6 Flash는 최대 100만 토큰의 컨텍스트 윈도우와 최대 64000 토큰의 출력을 지원합니다.
모델 카드에 명시된 지식 마감일은 2026년 3월로, 초기 Gemini 버전(마감일이 현저히 더 빠름)에 비해 개선되었습니다.
더 최신의 지식 마감일은 개발자가 수동으로 제공해야 하는 기본적인 최근 컨텍스트 정보의 양을 줄여줍니다. 그러나 이로 인해 모델이 최신 뉴스, 실시간 가격, 변화하는 법률, 소프트웨어 출시 또는 기타 시의성 있는 정보를 안정적으로 처리할 수 있는 것은 아닙니다.
신선한 정보를 처리하는 애플리케이션은 여전히 검색, 검색, 검증된 데이터베이스 또는 도구 호출을 사용해야 합니다.
큰 컨텍스트 윈도우 또한 모델이 긴 문서의 모든 부분을 동등하게 효과적으로 활용할 수 있음을 보장하지는 않습니다. 개발자는 다음 사항을 테스트해야 합니다:
- 먼 거리 간 부분의 검색 정확도
- 긴 대화에서의 일관성
- 핵심 규칙 유지 여부
- 관련 없는 자료 포함 시 성능
- 실제 컨텍스트 길이에서의 비용 및 지연 시간
Gemini 3.6 Flash의 보안 업그레이드
구글은 Gemini 3.6 Flash에 다음과 같은 항목에 대한 강화된 최첨단 안전 보호 조치가 포함되어 있다고 밝혔습니다:
- 화학, 생물학, 방사선 및 핵 오용
- 사이버 공격 오용
- 탈옥 저항
모델 카드 보고서에 따르면 Gemini 3.5 Flash와 비교하여 자동 다국어 및 콘텐츠 안전 결과가 개선되고, 상대적으로 낮은 부당 거부율을 유지했습니다.
구글은 또한 다음과 같은 몇 가지 제한 사항을 지적했습니다:
- 모델이 환각을 생성할 수 있습니다.
- 응답이 느리거나 시간 초과되는 경우가 있습니다.
- 일부 내부 테스트에서 어조가 약간 퇴보한 것으로 나타났습니다.
- 탈옥 방지는 여전히 지속적인 개선 영역입니다.
구글 최전선 안전 평가는 Gemini 3.6 Flash가 여전히 회사가 설정한 핵심 역량 수준(사이버 보안 임계값 포함) 미만이라고 결론지었습니다.
이 결론은 구글의 평가 프레임워크를 기반으로 하며, 이후 얻을 수 있는 독립적인 안전 테스트 결과와 함께 해석되어야 합니다.
Gemini 3.5 Flash-Lite: 높은 처리량 선택
Gemini 3.5 Flash-Lite는 최고 수준의 추론 깊이보다 속도, 처리량 및 비용을 더 중시하는 작업을 위해 설계되었습니다.
일반적인 적용 시나리오는 다음과 같습니다:
- 문서 추출
- 분류
- 검색
- 번역
- 데이터 라우팅
- 구조화된 JSON 생성
- 영수증 처리
- 전자상거래 데이터 분석
- 대용량 하위 작업 실행
구글은 이 모델을 Gemini 3.5 시리즈 중 가장 빠르고 비용이 가장 낮은 모델로 설명합니다.
Gemini 3.5 Flash-Lite 가격
| 토큰 유형 | 백만 토큰당 가격 |
|---|---|
| 입력 | 0.30 달러 |
| 출력 | 2.50 달러 |
기본 사고 수준은 최저이며, 처리량과 낮은 지연 시간을 우선시합니다.
자율 하위 작업, 코드 실행, 도구 호출 또는 다단계 계획의 경우 구글은 필요에 따라 사고 수준을 중간 또는 높음으로 높일 것을 권장합니다. 더 높은 설정은 작업 완료율을 향상시킬 수 있지만 일반적으로 토큰 사용량과 지연 시간이 증가합니다.
속도
구글 발표는 Artificial Analysis가 사전 출시 테스트에서 측정한 약 초당 350개의 출력 토큰 데이터를 인용했습니다.
Artificial Analysis는 이후 공급업체별 속도(시간이 지남에 따라 변경될 수 있음)를 기록했습니다. 처리량은 다음에 따라 달라집니다:
- 공급업체 용량
- 요청 크기
- 추론 설정
- 출력 길이
- 지역 라우팅
- 현재 수요
- 테스트가 보이는 출력 또는 숨겨진 추론을 측정하는지 여부
안정적인 결론은 Flash-Lite의 설계 속도가 더 큰 Flash 모델보다 현저히 빠르다는 것입니다.
벤치마크 개선
구글은 Gemini 3.1 Flash-Lite 대비 다음과 같은 향상된 결과를 보고했습니다:
| 벤치마크 | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 31% | 54% |
| GDM-MRCR v2 | 60.1% | 72.2% |
| GDPval-AA v2 | 642 | 1140 |
구글은 또한 Gemini 3.5 Flash-Lite가 여러 에이전트 및 코딩 벤치마크에서 Gemini 3 Flash를 능가했다고 보고했습니다:
- SWE-Bench Pro: 54.2% vs. 49.6%
- OSWorld-Verified: 74.0% vs. 65.1%
이로 인해 Flash-Lite는 단순한 저품질 경제형 모델이 아닙니다. 특정 좁은 고처리량 에이전트 작업의 경우 이전 Gemini 3 Flash보다 더 나은 균형을 제공할 수 있습니다.
독립적 지능 향상
Artificial Analysis는 Gemini 3.5 Flash-Lite의 지능 지수 점수를 36으로 평가하여, Gemini 3.1 Flash-Lite의 25점보다 높습니다.
이 11점 향상은 이번 출시에서 가장 두드러진 지능 향상 중 하나입니다.
Flash-Lite는 여전히 가장 강력한 최첨단 모델보다 낮지만, 모든 복잡한 추론 작업에서 경쟁하는 것이 목표는 아닙니다. 그 역할은 대량의 작업을 빠르고 경제적으로 처리하는 것입니다.
Gemini 3.5 Flash Cyber: 제한된 보안 모델
세 번째 출시 버전인 Gemini 3.5 Flash Cyber는 다른 목적을 가지고 있습니다.
Gemini 3.5 Flash를 기반으로 한 전용 모델로, 다음 기능을 위해 미세 조정되었습니다:
- 소프트웨어 취약점 찾기
- 취약점이 실제로 존재하는지 확인
- 관련 코드 경로 추적
- 패치 제안
- 반복 스캔 지원
- 대형 사이버 모델보다 낮은 비용으로 대규모 코드베이스 분석
이 모델은 Google DeepMind의 코드 보안 에이전트 CodeMender와 함께 작동합니다.
CodeMender에서 여러 Flash Cyber 에이전트가 코드베이스의 여러 부분을 검색하고 발견한 내용을 하나의 보고서로 통합할 수 있습니다.
Google은 사이버 보안 분야에서 더 작고 저렴한 모델을 사용하는 것이 가치 있다고 생각합니다. 취약점 연구는 일반적으로 많은 수의 가능한 실행 경로를 탐색해야 하기 때문입니다. 크고 비용이 많이 드는 모델을 반복적으로 호출하면 병목 현상이 발생할 수 있습니다.
CyberGym 성능
Google은 CodeMender 시스템을 통해 사용할 때 Gemini 3.5 Flash Cyber가 CyberGym에서 경쟁력 있는 최첨단 성능을 달성했다고 밝혔습니다.
이 결과는 기본 모델뿐만 아니라 완전한 에이전트 인프라에 의존합니다. 오케스트레이션, 도구, 검증 및 보고서 집계 모두 최종 점수에 기여합니다.
제한된 가용성
Gemini 3.5 Flash Cyber는 공개적으로 제공되지 않습니다
Gemini API가 광범위하게 제공됩니다.
Google은 제한된 CodeMender 파일럿 프로그램을 통해 다음 대상에게 제공할 계획입니다.
몇 분 만에 쇼케이스 사이트를 만들고 리드를 늘리세요
아이디어를 한 문장으로 입력하면 We0 AI가 쇼케이스 사이트, 페이지, CMS를 생성하고 출시 후 고객과 트래픽 확보를 돕습니다.
무료 등록을 위한 하나의 완전한 프로젝트 생성
하나의 완전한 생성 흐름을 시도하고 첫 번째 프로젝트 초안을 빠르게 보는 데 가장 적합합니다.
- 정부 기관
- 신뢰할 수 있는 파트너
- 1차 방어 보안 팀
이러한 제한된 배포는 해당 모델의 이중 용도 특성을 반영합니다. 취약점을 찾고 검증할 수 있는 시스템은 방어자가 소프트웨어를 패치하는 데 도움이 될 수 있지만, 유사한 기능이 공격적인 활동을 지원할 수도 있습니다.

Gemini 3.5 Pro는 어디에 있나요?
Google은 Gemini 3.5 Pro가 파트너와 함께 테스트 중이며, 준비가 완료되는 대로 더 광범위하게 출시될 것이라고 밝혔습니다.
AIBase의 원본 기사는 이러한 지연을 외부 보도 및 코딩 성능과 잠재적인 재훈련에 관한 온라인 소문과 연결했습니다.
Google은 해당 모델의 원래 훈련 계획이 폐기되었거나 시스템이 처음부터 다시 시작되었다는 주장을 공개적으로 확인하지 않았습니다.
확인된 정보는 제한적입니다.
- Gemini 3.5 Pro는 여전히 파트너 테스트 단계에 있습니다.
- Google은 일반 공개 일정을 발표하지 않았습니다.
- 해당 회사는 자체적으로 가장 야심찬 Gemini 4 사전 훈련 실행을 시작했습니다.
- Google은 차세대 모델의 진전에 대해 고무되었다고 밝혔습니다.
플래그십 Pro 버전의 부재는 Flash의 출시를 전략적으로 더 중요하게 만듭니다. 하이엔드 모델을 아직 사용할 수 없는 상황에서 Gemini 3.6 Flash와 Flash-Lite는 생산 요구의 더 큰 부분을 담당해야 합니다.
이것이 반드시 Google이 Gemini 3.5 Pro를 포기했거나 Gemini 4가 곧 출시된다는 것을 의미하지는 않습니다.
모델 개발 일정은 변경될 수 있으며, 사전 훈련은 하나의 단계에 불과합니다. 후속 훈련, 안전 테스트, 도구 통합, 지연 시간 최적화 및 배포 준비에는 상당한 추가 시간이 필요할 수 있습니다.
독립 테스트:
지능 향상보다 효율성 향상
인간 분석을 통한 결론은 Google의 제품 발표보다 더 절제되어 있습니다.
지능 지수
Gemini 3.6 Flash는 인간 분석 지능 지수에서 50점을 기록했습니다.
Gemini 3.5 Flash도 50점을 기록했습니다.
따라서 일부 범주에서 향상이 나타났지만, 새 모델의 해당 테스트 종합 지능 점수는 향상되지 않았습니다.
인간 분석 보고서에 따르면:
- GDPval-AA v2 점수는 더 높음
- 인간 최종 시험에서 소폭 퇴보
- 전반적인 지능 수준은 유사함
- 출력 토큰 사용량은 더 낮음
- 작업 완료 속도는 더 빠름
- 작업당 비용은 더 낮음
이는 신뢰할 수 있는 효율성 업그레이드이지만, 광범위한 지능 도약은 아닙니다.
작업당 소요 시간
인간 분석 측정 결과:
- Gemini 3.5 Flash: 약 2.7분
- Gemini 3.6 Flash: 약 1.3분
이 모델은 평가 작업 부하를 완료하는 데 걸리는 시간을 절반 이상 단축했습니다.
작업당 비용
인간 분석 추정:
- Gemini 3.5 Flash: 작업당 약 0.59달러
- Gemini 3.6 Flash: 작업당 약 0.50달러
대규모 지능형 에이전트의 경우, 특히 시스템이 수천 개의 작업을 실행할 때 이러한 비용 절감은 중요합니다.
벤치마크는 일반적인 순위로 간주되어서는 안 됩니다.
인간 분석은 여러 평가를 하나의 지수로 결합합니다. 종합 점수는 대략적인 비교에 사용될 수 있지만, 다양한 작업 부하 간의 상당한 차이를 가릴 수 있습니다.
총점이 같은 모델이라도 특정 측면에서 더 우수할 수 있습니다. 예를 들어:
- 프로그래밍
- 멀티모달 문서 처리
- 컴퓨터 조작
- 속도에 민감한 에이전트
- 긴 컨텍스트 추출
하지만 다음 측면에서는 더 약할 수 있습니다:
- 어려운 추상적 추론
- 시각적 스타일 디자인
- 특정 언어 처리
- 창의적 생성
- 심층 계획이 필요한 작업
올바른 모델을 선택하는 것은 구체적인 애플리케이션 시나리오에 따라 달라집니다.
초기 사용자 피드백이 더 부정적인 이유
원문은 소셜 미디어에서 나온 여러 비판적 반응을 수집했습니다.
사용자들이 불평한 문제는 다음과 같습니다:
- 중국어 어휘 선택이 부자연스러움
- 기억 일관성 불량
- 도구 선택 오류
- 시각적 스타일 디자인 취약
- 생성된 게임 텍스처 품질 저하
- 명령어와 시각적 출력 불일치
- 사용 제한
- 일반 지능의 뚜렷한 향상 없음
이러한 피드백이 중요한 이유는 벤치마크가 제품 품질의 모든 측면을 포괄할 수 없기 때문입니다.
모델이 코드베이스 작업에서는 뛰어난 성능을 보일 수 있지만 레이아웃 생성 효과는 좋지 않을 수 있습니다. 더 적은 토큰을 사용할 수 있지만 지나치게 간결해질 수 있습니다. 특정 프로그래밍 벤치마크에서는 더 정확할 수 있지만 특정 언어에서는 신뢰성이 떨어질 수 있습니다.
동시에 소셜 미디어 테스트에는 심각한 한계가 있습니다:
- 프롬프트가 항상 공개되는 것은 아님
- 모델 설정이 다를 수 있음
- 사용자가 다른 제품 인터페이스를 비교할 수 있음
- 미리보기 버전과 API가 다른 구성을 사용할 수 있음
- 도구 가용성이 결과에 영향을 미칠 수 있음
- 단일 실패 사례가 전반적인 퇴보를 증명하지는 않음
- 바이러스성 비판은 가장 심각한 실패 사례를 부각시키는 경향이 있음
따라서 초기 사용자 피드백은 최종 결론이 아닌 특정 테스트에 대한 신호로 간주되어야 합니다.
실용적인 평가 프레임워크
Gemini 3.6 Flash 도입을 고려하는 팀은 Google이 더 높은 벤치마크를 보고했다는 이유만으로, 또는 온라인 데모 몇 개가 실망스러웠다는 이유만으로 거부해서는 안 됩니다.
유용한 마이그레이션 테스트는 동일한 애플리케이션에서 이전 모델과 새 모델을 비교해야 합니다.
- 대표적인 작업 사용
실제 업무에서 평가 세트를 구성하십시오.
- 실제 코드 저장소
- 실제 문서
- 일반적인 도구 호출
- 일반적인 사용자 요청
- 알려진 실패 사례
- 다국어 프롬프트
- 긴 컨텍스트 예시
- 출력 품질뿐만 아니라 작업 완료도 측정
추적 대상:
- 작업 성공률
- 도구 호출 횟수
- 재시도 횟수
- 의도하지 않은 파일 변경
- 수동 수정 시간
- 지연 시간
- 출력 토큰 수
- 총 비용
- 실패 심각도
- 다양한 사고 수준 테스트
Gemini 3.6 Flash는 기본적으로 중간 사고 수준입니다.
Gemini 3.5 Flash-Lite는 기본적으로 최저 사고 수준입니다.
모델이 현재 작업에 비해 추론 설정이 너무 낮아서 성능이 부족해 보일 수 있습니다. 반대로, 간단한 정보 추출 작업에 높은 사고 수준을 사용하는 것은 시간과 비용 낭비일 수 있습니다.
- 시각적 품질과 언어 품질을 별도로 평가
코딩 벤치마크는 웹사이트가 시각적으로 훌륭한지 또는 중국어 표현이 자연스러운지 측정할 수 없습니다.
전문적인 수동 검토를 사용하여 평가하십시오.
- 시각적 계층 구조
- 브랜드 일관성
- 어조 스타일
- 번역 품질
- 문화적 적합성
- 명령어 준수
- 전체 에이전트 스택 테스트
에이전트의 실행 결과는 모델만으로 결정되지 않습니다.
비교할 항목:
- 도구 정의
- 프롬프트 구조
- 메모리 전략
- 컨텍스트 캐싱
- 재시도 규칙
- 승인 경계
- 브라우저 또는 컴퓨터 사용 환경
- 오케스트레이션 프레임워크
모델 마이그레이션에는 전체 시스템 환경을 조정해야 할 수도 있습니다.
개발자는 어떤 모델을 선택해야 할까요?
Gemini 3.6 Flash를 선택해야 하는 경우:
- 작업에 다단계 추론이 필요합니다.
- 코드 품질이 매우 중요합니다.
- 에이전트가 여러 도구를 사용합니다.
- 작업 부하에 이미지, 차트, 비디오 또는 대용량 문서가 포함됩니다.
- 컴퓨터 조작 기능(Computer Use)을 사용해야 합니다.
- 더 적은 라운드와 더 낮은 작업 지연 시간이 가치 있습니다.
- Gemini 3.5 Flash는 현재 사용 가능하지만 너무 장황하거나 비용이 많이 듭니다.
Gemini 3.5 Flash-Lite를 선택해야 하는 경우:
- 처리량이 최우선 고려 사항입니다.
- 작업이 정보 추출, 분류, 번역 또는 경로 배포와 관련됩니다.
- 많은 하위 에이전트가 병렬로 실행됩니다.
응용 프로그램은 대량의 문서를 처리해야 합니다.
- 낮은 토큰당 가격 추구
- 복잡한 작업은 더 강력한 주 모델에 위임 가능
Gemini 3.5 Flash Cyber 사용 승인을 받은 경우에만 해당:
- 조직이 Google 유한 시범 프로그램의 일부인 경우
- 워크로드가 방어적 사이버 보안인 경우
- 조치 취하기 전에 취약점 발견 결과가 검증된 경우
- 민감한 저장소가 엄격한 권한 하에 처리되는 경우
- 조직이 이중 용도 위험을 관리할 수 있는 경우
Flash 버전 출시의 더 큰 의미
Gemini 3.6 Flash는 극적인 지능적 돌파구라기보다는 운영 경험의 업그레이드로 보는 것이 더 이해하기 쉽습니다.
이는 에이전트의 비용을 높이는 낭비를 줄이기 위해 설계되었습니다:
- 과도한 추론
- 반복적인 도구 호출
- 장황한 출력
- 디버깅 루프
- 불필요한 코드 편집
- 느린 작업 완료
이러한 개선 사항은 추상적 추론 벤치마크의 미미한 향상보다 프로덕션 환경에서 더 가치가 있을 수 있습니다.
그러나 효율성이 모든 애플리케이션에서 품질을 대체할 수는 없습니다.
값싸게 작업을 완료하는 모델이라도 결과물에 많은 수동 수정이 필요하다면 무용지물입니다. 프로그래밍에서 높은 점수를 받은 모델도 설계 면에서는 실망스러울 수 있습니다. 영어 능력이 뛰어난 모델도 중국어나 다른 언어에서는 추가 검증이 필요할 수 있습니다.
Google의 새로운 Flash 시리즈는 더 전문화된 선택지를 제공합니다:
- 3.6 Flash: 더 강력한 에이전트 작업용
- 3.5 Flash-Lite: 대규모 확장용
- Flash Cyber: 통제된 보안 사용용
따라서 이번 출시는 하나의 모델이 다른 모든 모델을 대체하는 것보다는, 에이전트 시스템의 각 부분에 적절한 지능 수준과 비용을 할당하는 데 중점을 둡니다.
자주 묻는 질문
Gemini 3.6 Flash란 무엇인가요?
Gemini 3.6 Flash는 Google의 프로그래밍, 멀티모달 작업, 지식 작업 및 에이전트 워크플로우를 위한 범용 주력 모델입니다. Gemini 3.5 Flash를 기반으로 하지만 더 적은 토큰, 더 적은 상호 작용 횟수, 더 적은 도구 호출을 사용하도록 설계되었습니다.
Gemini 3.6 Flash가 Gemini 3.5 Flash보다 더 똑똑한가요?
Google은 여러 프로그래밍, 컴퓨터 사용, 머신러닝 및 지식 작업 벤치마크에서 개선되었다고 보고합니다. Artificial Analysis는 두 모델 모두에 동일한 전체 지능 지수 점수 50을 부여하므로, 가장 분명한 개선은 전체 지능의 향상보다는 효율성과 작업 완료 속도인 것으로 보입니다.
Gemini 3.6 Flash의 비용은 얼마인가요?
Google은 이 모델의 가격을 입력 토큰 100만 개당 1.50달러, 출력 토큰 100만 개당 7.50달러로 책정했습니다. 가격은 변동될 수 있으며, 에이전트의 총 비용은 추론, 컨텍스트 크기, 도구 호출, 재시도 및 출력 길이에 따라 달라집니다.
Gemini 3.5 Flash-Lite는 어떤 용도로 사용되나요?
Flash-Lite는 추출, 분류, 검색, 번역, 라우팅, 구조화된 데이터 처리 및 하위 에이전트 실행과 같은 지연 시간에 민감한 높은 처리량의 워크로드에 적합합니다. Gemini 3.6 Flash보다 저렴하고 빠르지만, 모든 어려운 작업에서 더 강력한 모델을 대체하도록 설계되지는 않았습니다.
Gemini 3.6 Flash는 이미지와 비디오를 지원하나요?
네. 모델 카드에는 텍스트, 이미지, 오디오 및 비디오 입력과 텍스트 출력을 지원하는 기능이 나열되어 있습니다. 이 모델의 컨텍스트 윈도우는 최대 100만 개의 토큰입니다.
Gemini 3.5 Flash Cyber란 무엇인가요?
취약점 발견, 검증 및 패치를 위해 훈련된 Gemini 3.5 Flash의 전문 버전입니다. Google은 CodeMender라는 제한된 시범 프로그램을 통해 정부 및 신뢰할 수 있는 방어 파트너에게 이 모델을 제공할 계획입니다.
Gemini 3.5 Pro가 취소되었나요?
Google은 취소되었다고 밝히지 않았습니다. 회사는 Gemini 3.5 Pro가 파트너와 테스트 중이며 준비되는 대로 광범위하게 제공될 것이라고 밝혔습니다.
지금 바로 Gemini 3.5 Flash에서 마이그레이션해야 하나요?
꼭 그럴 필요는 없습니다. 전환하기 전에 대표적인 프로덕션 작업에서 두 모델을 모두 실행하고 성공률, 수동 수정 시간, 도구 안정성, 지연 시간, 토큰 사용량 및 총 비용을 비교해야 합니다.
관련 도구
- Google AI Studio: Gemini 모델, 프롬프트, 도구 및 API 구성을 테스트하기 위한 Google의 브라우저 기반 환경.
- Gemini API: Gemini 모델을 애플리케이션 및 에이전트 워크플로우에 통합하기 위한 공식 API.
- Gemini 앱: Gemini 모델을 직접 사용하기 위한 Google의 소비자 대상 인터페이스.
안티그래비티 (링크: https://antigravity.google/): 코딩 워크플로우에 Gemini 3.6 Flash가 내장된 Google의 에이전트 개발 환경.
- CodeMender (링크: https://deepmind.google/models/codemender/): 소프트웨어 취약점을 발견하고 수정하기 위한 Google DeepMind의 에이전트.
- Artificial Analysis (링크: https://artificialanalysis.ai/): 지능 수준, 속도, 지연 시간, 토큰 사용량 및 가격 정보를 다루는 독립적인 모델 비교 플랫폼.
관련 링크
- Gemini Flash 공식 출시 발표: Google 제공 사양, 벤치마크 결과, 가격, 고객 사례 및 가용성 정보.
- Gemini 3.6 Flash 모델 카드: 입력, 컨텍스트 길이, 제한 사항, 안전 테스트 및 지식 마감일에 대한 공식 세부 정보.
- Gemini 3.5 Flash-Lite 모델 카드: 예상 용도, 모델 제한 사항, 안전 평가 및 배포에 대한 공식 정보.
- Gemini 3.5 Flash Cyber: 전용 사이버 보안 모델 및 제한적 시범 프로그램에 대한 Google DeepMind의 설명.
- Gemini API 최신 모델 가이드: 공식 모델 ID, 마이그레이션 가이드, API 변경 사항, 가격 및 권장 사용 사례.
- Gemini API 가격: Gemini API 모델 및 서비스에 대한 현재 공식 가격 페이지.
- Artificial Analysis 평가: 지능 수준, 단일 작업 비용, 출력 속도, 토큰 효율성 및 작업 소요 시간에 대한 독립적 분석.
요약
Google의 최신 Flash 출시는 세 가지 개별 제품으로 구성됩니다. Gemini 3.6 Flash는 복잡한 에이전트 및 코딩 시나리오를 대상으로 하고, Gemini 3.5 Flash-Lite는 높은 처리량 실행에 중점을 두며,
Gemini 3.5 Flash Cyber는 제한된 접근 하에서 방어적 취약점 연구에 집중합니다.
Gemini 3.6 Flash는 여러 작업 수준의 벤치마크를 개선하고, 출력 토큰 사용량을 줄였으며, 에이전트 작업 완료 속도를 높이고, 출력 가격을 낮췄습니다. 그러나 독립적인 테스트 결과, 종합 지능 점수는 Gemini 3.5 Flash에 비해 개선되지 않은 것으로 나타났습니다.
따라서 시장의 복잡한 반응은 이해할 수 있습니다. 이번 출시는 일반적인 능력의 비약보다는 효율성 측면에서 강력한 증거를 제시한 것입니다.
Gemini 3.6 Flash에 대한 최고의 평가는 다음과 같습니다: 모든 형태의 지능이나 출력 품질이 동시에 향상되었음을 증명하는 것이 아니라, 더 빠르고 간결한 프로덕션 모델이라는 점입니다.



