본문 바로가기
AI 도구

🚀 Google Gemini 3.6 Flash & 3.5 Flash-Lite 동시 출시: 280토큰/초, DeepSWE 49% 달성

by James AI Explorer 2026. 7. 22.
    728x90

    안녕하세요! 오늘은 구글이 2026년 7월 21일 공개한 Gemini 3.6 Flash에 대해 알아보겠습니다. Gemini 3.6 Flash는 이전 모델인 3.5 Flash 대비 출력 토큰 17% 절약, 코딩 벤치마크 DeepSWE 49% 달성, 속도 280 토큰/초를 보여주는 고성능 AI 모델입니다. 함께 발표된 Gemini 3.5 Flash-Lite3.5 Flash Cyber까지 포함하면 총 3개의 신규 모델이 동시에 출시되었으며, 특히 3.6 Flash는 에이전트 워크플로우와 코딩 작업에서 토큰 비용을 최대 65%까지 절감할 수 있습니다. 이 블로그에서는 Gemini 3.6 Flash의 핵심 기능, 3개 모델 비교, API 사용법, 실제 벤치마크 결과, 그리고 무료 체험 방법까지 상세히 설명하겠습니다. 어떻게 작동하는지, 지금부터 하나씩 파헤쳐보겠습니다.

    "이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다."

     

    🤖 Gemini 3.6 Flash란 무엇인가?

    Gemini 3.6 Flash는 구글 딥마인드가 2026년 7월 21일에 발표한 Gemini 시리즈의 최신 고효율 모델입니다. 이 모델은 코딩, 에이전트 워크플로우, 웹 및 앱 개발 등 다양한 작업에 최적화되어 있으며, 기존 3.5 Flash 대비 토큰 효율성과 성능이 크게 향상되었습니다.

    🔑 Gemini 3.6 Flash 핵심 포인트:
    • 속도 1위: 출력 속도 280 토큰/초로 Artificial Analysis 186개 모델 중 1위
    • 토큰 절약: 3.5 Flash 대비 출력 토큰 17% 절약 (Artificial Analysis Index 기준)
    • 코딩 성능: DeepSWE 49% (3.5 Flash 대비 37%), MLE Bench 63.9% (49.7%)
    • 합리적 가격: 입력 $1.50/1M, 출력 $7.50/1M (이전 $9/1M 출력 대비 17% 인하)
    • 지식 컷오프: 2025년 1월 → 2026년 3월로 대폭 업데이트

    이번 발표에서 구글은 총 3개의 신규 모델을 동시에 공개했습니다:

    모델 핵심 특징 가격 (입력/출력 per 1M) 타겟 사용자
    Gemini 3.6 Flash 범용 고성능, 코딩·에이전트 최적화 $1.50 / $7.50 개발자, 기업
    Gemini 3.5 Flash-Lite 초고속 처리, 저비용 $0.30 / $2.50 대량 처리, 문서 분석
    Gemini 3.5 Flash Cyber 보안 취약점 탐지·수정 Cloud 사용 보안 전문가

    특히 Gemini 3.6 Flash는 "더 적은 추론 단계와 도구 호출로 멀티스텝 워크플로우를 완수한다"는 구글의 설명처럼, 에이전트 기반 작업에서 실질적인 비용 절감 효과를 제공합니다.

    📊 벤치마크 성능: 숫자로 보는 3.6 Flash

    Gemini 3.6 Flash의 성능은 여러 벤치마크에서 이전 모델 대비 두드러진 향상을 보여줍니다. Artificial Analysis Intelligence Index에서는 186개 모델 중 21위에 오르며, 인텔리전스 지수 50점을 기록했습니다.

    벤치마크 Gemini 3.6 Flash Gemini 3.5 Flash 향상폭
    DeepSWE (코딩) 49% 37% +12%p
    MLE Bench (ML 리서치) 63.9% 49.7% +14.2%p
    GDPval-AA (지식 작업) 1,421 1,349 +72점
    OSWorld-Verified (컴퓨터 사용) 83% 78.4% +4.6%p
    출력 속도 280 토큰/초 ~250 토큰/초 +12%
    지식 컷오프 2026년 3월 2025년 1월 14개월 확장
    💡 참고: Artificial Analysis Intelligence Index에서 Gemini 3.6 Flash는 186개 모델 중 인텔리전스 21위, 속도 1위, 가격 61위를 기록했습니다. 같은 가격대 모델 평균 인텔리전스가 31점인데 반해 50점을 달성한 것은 인상적인 수치입니다.

    ⚡ Gemini 3.5 Flash-Lite: 초고속 처리의 새로운 기준

    함께 발표된 Gemini 3.5 Flash-Lite는 고처리량, 저지연 작업에 최적화된 모델입니다. 구글은 "3월에 출시된 3.1 Flash-Lite보다 현저히 더 나은 품질"을 제공한다고 설명하며, 에이전트형 검색이나 문서 처리 되는 작업에서 활용도가 높습니다.

    Gemini 3.5 Flash-Lite  vs Gemini 3.5 Flash 비교 영상
    벤치마크 3.5 Flash-Lite 이전 모델 비교 모델
    출력 속도 350 토큰/초 - 업계 최고 수준
    Terminal-Bench 2.1 54% 31% (3.1 Flash-Lite) +23%p
    GDM-MRCR v2 (긴 컨텍스트) 72.2% 60.1% (3.1 Flash-Lite) +12.1%p
    GDPval-AA v2 1,140 642 (3.1 Flash-Lite) +498점
    SWE-Bench Pro 54.2% - 3 Flash 대비 49.6%
    OSWorld-Verified 74.0% - 3 Flash 대비 65.1%

    Flash-Lite의 가격은 입력 $0.30/1M, 출력 $2.50/1M으로 매우 저렴합니다. 문서 처리나 검색 같은 고빈도 작업을 처리해야 하는 환경에서는 비용 효율성이 크게 높아집니다.

    🛡️ Gemini 3.5 Flash Cyber: 보안 전문 AI

    구글은 보안 분야를 위한 전용 모델인 Gemini 3.5 Flash Cyber도 함께 공개했습니다. 이 모델은 소프트웨어 취약점을 탐지하고 수정하는 데 특화되어 있으며, 구글 클라우드에서 사용할 수 있습니다.

    Flash Cyber는 경량 보안 모델로 설계되어 기존 보안 도구와 연동하여 코드베이스의 잠재적 취약점을 빠르게 식별할 수 있습니다. 보안 팀이 대규모 코드베이스를 검토할 때 상당한 시간을 절약할 수 있는 도구로 기대됩니다.

    🚀 API 사용법 및 가격 비교

    Gemini 3.6 Flash는 Google AI Studio와 Vertex AI를 통해 무료 체험이 가능합니다, API를 통해서도 바로 사용할 수 있습니다. OpenRouter를 통한 접근도 가능합니다.

    # Google AI Studio에서 Gemini 3.6 Flash 사용 예시
    import google.generativeai as genai
    
    # API 키 설정
    genai.configure(api_key="YOUR_API_KEY")
    
    # 모델 선택
    model = genai.GenerativeModel('gemini-3.6-flash')
    
    # 텍스트 생성
    response = model.generate_content(
        "Python으로 웹 크롤러를 만들어주세요. BeautifulSoup을 사용해서 뉴스 헤드라인을 수집하는 코드를 작성해주세요."
    )
    
    print(response.text)
    
     

    OpenRouter를 사용하면 여러 API 제공자를 통해 Gemini 3.6 Flash에 접근할 수 있습니다:

    # OpenRouter를 통한 Gemini 3.6 Flash 사용 예시
    import requests
    
    response = requests.post(
        "https://openrouter.ai/api/v1/chat/completions",
        headers={
            "Authorization": "Bearer YOUR_API_KEY",
            "Content-Type": "application/json"
        },
        json={
            "model": "google/gemini-3.6-flash",
            "messages": [
                {"role": "user", "content": "Gemini 3.6 Flash의 주요 특징을 설명해주세요."}
            ]
        }
    )
    
    print(response.json()["choices"][0]["message"]["content"])
    
     

    💰 3개 모델 가격 및 포지셔닝 비교

    이번에 발표된 3개 모델은 각각 다른 사용자층을 대상으로 합니다. 작업의 성격과 처리량에 따라 적합한 모델을 선택하는 것이 중요합니다.

    항목 3.6 Flash 3.5 Flash-Lite 3.5 Flash Cyber
    출력 속도 280 토큰/초 350 토큰/초 -
    입력 가격 $1.50/1M $0.30/1M Cloud 기반
    출력 가격 $7.50/1M $2.50/1M Cloud 기반
    컨텍스트 윈도우 1M 토큰 1M 토큰 -
    입력 모달리티 텍스트, 이미지, 음성, 비디오 텍스트, 이미지 텍스트, 코드
    추론 지원 ✅ (reasoning)
    적합한 작업 코딩, 에이전트, 분석 대량 처리, 검색 보안 분석, 취약점 탐지
    🔑 모델 선택 가이드:
    • 복잡한 코딩 및 에이전트 작업 → Gemini 3.6 Flash (추론 기능, 높은 성능)
    • 대량 문서 처리 및 검색 → Gemini 3.5 Flash-Lite (350 토큰/초, 저비용)
    • 보안 취약점 탐지 → Gemini 3.5 Flash Cyber (보안 전용)

     

    🆓 무료로 체험하는 방법

    Gemini 3.6 Flash는 Google AI Studio에서 무료로 체험할 수 있습니다. Google 계정만 있으면 바로 시작할 수 있으며, 월별 무료 할당량이 제공됩니다.

    1단계: Google AI Studio 접속

    # Google AI Studio 접속 주소
    https://aistudio.google.com/
    
    # Gemini 3.6 Flash 선택 경로:
    # 1. Google AI Studio 접속
    # 2. "Create New" 클릭
    # 3. 모델 선택에서 "Gemini 3.6 Flash" 선택
    # 4. 프롬프트 입력 후 테스트
    
     

    2단계: API 키 발급

    # API 키 발급 및 환경 변수 설정
    # 1. Google AI Studio에서 "Get API Key" 클릭
    # 2. 새 API 키 생성
    # 3. 환경 변수에 저장
    
    # Windows PowerShell
    $env:GOOGLE_API_KEY = "YOUR_API_KEY"
    
    # Linux/Mac
    export GOOGLE_API_KEY="YOUR_API_KEY"
    
    # Python에서 사용
    import os
    api_key = os.environ.get("GOOGLE_API_KEY")
    print(f"API 키 설정 완료: {api_key[:8]}...")
    
     

    3단계: 로컬 환경에서 테스트

    # Gemini 3.6 Flash 로컬 테스트 스크립트
    # pip install google-generativeai
    
    import google.generativeai as genai
    import os
    
    # API 키 설정
    genai.configure(api_key=os.environ.get("GOOGLE_API_KEY"))
    
    # 모델 초기화
    model = genai.GenerativeModel('gemini-3.6-flash')
    
    # 코딩 테스트
    coding_prompt = """
    다음 요구사항에 맞는 Python 함수를 작성해주세요:
    1. 리스트에서 중복을 제거하고
    2. 각 요소의 빈도를 세고
    3. 빈도 기준 내림차순으로 정렬된 딕셔너리를 반환하는 함수
    """
    
    response = model.generate_content(coding_prompt)
    print("=== 코딩 결과 ===")
    print(response.text)
    
    # 추론 테스트
    reasoning_prompt = """
    다음 수학 문제를 풀어주세요:
    공원에 나무가 있습니다. 첫날에 전체의 1/3을 심었고,
    둘째날에 나머지의 1/4을 심었으며, 셋째날에 남은 것을 모두 심었습니다.
    셋째날에 10그루를 심었다면, 전체 나무는 몇 그루인가요?
    단계별로 풀이해주세요.
    """
    
    response2 = model.generate_content(reasoning_prompt)
    print("\n=== 추론 결과 ===")
    print(response2.text)
    
     
    💡 무료 할당량 안내: Google AI Studio에서 매월 무료 토큰 할당량을 제공합니다. 3.6 Flash 기준으로 충분한 테스트가 가능하며, 더 많은 사용량이 필요하면 유료 플랜으로 업그레이드할 수 있습니다.

    🔄 이전 모델과의 실질적 차이점

    Gemini 3.6 Flash가 3.5 Flash와 비교하여 단순히 숫자가 향상된 것 외에도, 실제 사용 환경에서 체감할 수 있는 차이점들이 있습니다.

    Gemini 3.6 Flash vs  Gemini 3.5 Flash 동작속도 비교 영상

    토큰 효율성 향상

    가장 큰 변화는 토큰 효율성입니다. 3.5 Flash 대비 출력 토큰을 17% 적게 사용하면서도 동일하거나 더 나은 결과를 제공합니다. 이는 실제 비용 절감으로 직결됩니다.

    시나리오 3.5 Flash 토큰 사용량 3.6 Flash 토큰 사용량 비용 절감
    코딩 에이전트 (1시간) 약 500K 토큰 약 415K 토큰 약 17% 절감
    멀티스텝 워크플로우 추론 단계 8회 + 도구 호출 12회 추론 단계 5회 + 도구 호출 7회 단계 37% 감소
    장기 엔지니어링 작업 기준 비용 최대 65% 절감 대폭 절감

    코딩 정확도 대폭 향상

    3.6 Flash는 "더 적은 불필요한 코드 수정과 줄어든 실행 루프로 더 높은 정확도"를 제공한다고 구글은 설명합니다. 실제 벤치마크에서도 이를 확인할 수 있습니다.

    🔑 코딩 성능 비교:
    • DeepSWE: 49% → 이전 37% 대비 12%p 향상 (실제 소프트웨어 엔지니어링 작업)
    • MLE Bench: 63.9% → 이전 49.7% 대비 14.2%p 향상 (머신러닝 리서치)
    • 생산 코드 품질: 더 신뢰할 수 있는 프로덕션 레디 코드 생성

    🤖 에이전트 워크플로우에서의 활용

    Gemini 3.6 Flash의 가장 주목할 만한 특징은 에이전트 기반 워크플로우에서의 성능입니다. 구글은 "멀티스텝 워크플로우를 수행하는 데 더 적은 추론 단계와 도구 호출이 필요하다"고 밝혔습니다.

    이는 AI 에이전트가 여러 단계를 거쳐 작업을 완수할 때, 각 단계에서 사용하는 토큰 양이 줄어든다는 것을 의미합니다. 특히 장기 엔지니어링 작업에서는 토큰 비용이 최대 65%까지 절감된다고 합니다.

    # 에이전트 워크플로우 예시: Gemini 3.6 Flash 활용
    import google.generativeai as genai
    
    model = genai.GenerativeModel('gemini-3.6-flash')
    
    # 멀티스텝 에이전트 작업
    agent_prompt = """
    다음 순서로 코드 리뷰를 수행해주세요:
    
    1단계: 아래 Python 코드를 분석하고 잠재적 버그를 찾으세요
    2단계: 각 버그에 대한 수정 권장사항을 제시하세요
    3단계: 수정된 코드를 작성하세요
    4단계: 수정된 코드의 테스트 케이스를 작성하세요
    
    코드:
    def calculate_average(numbers):
        total = 0
        for n in numbers:
            total += n
        return total / len(numbers)
    """
    
    response = model.generate_content(agent_prompt)
    print(response.text)
    
     

    📋 주요 AI 모델과의 가격 비교

    Gemini 3.6 Flash의 가격 경쟁력을 다른 주요 모델과 비교해보면 다음과 같습니다.

    모델 입력 ($/1M) 출력 ($/1M) 속도 컨텍스트
    Gemini 3.6 Flash $1.50 $7.50 280 토큰/초 1M
    Gemini 3.5 Flash $1.50 $9.00 ~250 토큰/초 1M
    Gemini 3.5 Flash-Lite $0.30 $2.50 350 토큰/초 1M
    Claude 3.5 Haiku $0.80 $4.00 ~150 토큰/초 200K
    GPT-4o Mini $0.15 $0.60 ~100 토큰/초 128K
    DeepSeek V3 $0.27 $1.10 ~60 토큰/초 128K
    ⚠️ 가격 참고사항: 위 가격은 각 모델의 공식 API 가격 기준이며, 실제 사용 비용은 작업 유형, 컨텍스트 길이, 배치 크기 등에 따라 달라질 수 있습니다. 특히 Gemini 3.6 Flash의 출력 가격은 이전 3.5 Flash 대비 17% 인하된 수치입니다.

    💡 Gemini 3.6 Flash 활용 사례

    Gemini 3.6 Flash는 다양한 실무 환경에서 활용할 수 있습니다. 특히 코딩, 문서 처리, 분석 작업에서 강점을 보입니다.

    실무 활용 사례 1: 코드 리팩토링 에이전트

    # Gemini 3.6 Flash를 활용한 코드 리팩토링 에이전트
    import google.generativeai as genai
    
    model = genai.GenerativeModel('gemini-3.6-flash')
    
    # 레거시 코드 리팩토링
    legacy_code = """
    def process_data(data):
        result = []
        for item in data:
            if item['type'] == 'A':
                if item['value'] > 100:
                    result.append(item['value'] * 2)
                else:
                    result.append(item['value'] + 50)
            elif item['type'] == 'B':
                if item['value'] > 200:
                    result.append(item['value'] * 1.5)
                else:
                    result.append(item['value'] + 100)
            else:
                result.append(0)
        return result
    """
    
    refactor_prompt = f"""
    다음 레거시 Python 코드를 모던한 방식으로 리팩토링해주세요:
    1. 타입 힌트 추가
    2. 함수 분리
    3. 상수 처리
    4. 테스트 코드 작성
    
    코드:
    {legacy_code}
    """
    
    response = model.generate_content(refactor_prompt)
    print(response.text)
    
     

    실무 활용 사례 2: 대량 문서 분석

    대량의 문서를 빠르게 분석해야 한다면 Gemini 3.5 Flash-Lite를 사용하는 것이 비용 효율적입니다. 350 토큰/초의 초고속 출력과 $0.30/1M의 저렴한 입력 가격으로 대규모 처리에 적합합니다.

    # Flash-Lite를 활용한 대량 문서 분석
    import google.generativeai as genai
    
    model = genai.GenerativeModel('gemini-3.5-flash-lite')
    
    # 여러 문서 일괄 분석
    documents = [
        "문서 1: 2026년 1분기 실적 보고서...",
        "문서 2: 2026년 2분기 실적 보고서...",
        "문서 3: 2026년 3분기 실적 보고서...",
    ]
    
    analysis_prompt = f"""
    다음 {len(documents)}개의 실적 보고서를 분석하고:
    1. 분기별 핵심 지표를 표로 정리하세요
    2. 주요 변화 트렌드를 3가지로 요약하세요
    3. 향후 전망을 제시하세요
    
    분석 대상:
    {chr(10).join(documents)}
    """
    
    response = model.generate_content(analysis_prompt)
    print(response.text)
    
     

    🎯 맺음말

    지금까지 Gemini 3.6 Flash에 대해 알아보았습니다. Gemini 3.6 Flash는 280 토큰/초의 업계 최고 속도, DeepSWE 49%의 높은 코딩 성능, 1M 컨텍스트 윈도우, 그리고 3.5 Flash 대비 출력 토큰 17% 절약이라는 실질적인 향상을 보여주는 모델입니다. 함께 발표된 3.5 Flash-Lite(350 토큰/초, $0.30/1M)와 3.5 Flash Cyber(보안 전용)는 각각 대량 처리와 보안 분야에서 활용 가치가 큽니다.

    🔑 핵심 요약:
    • Gemini 3.6 Flash: 코딩·에이전트 작업에 최적화된 범용 모델 (입력 $1.50, 출력 $7.50)
    • 3.5 Flash-Lite: 초고속 처리에 최적화 (350 토큰/초, $0.30/1M)
    • 3.5 Flash Cyber: 보안 취약점 탐지·수정 전용 모델
    • 지식 컷오프: 2026년 3월로 대폭 업데이트
    • 무료 체험: Google AI Studio에서 바로 가능

    다만 현재 3.6 Flash는 Google AI Studio와 Vertex AI를 통해서만 접근 가능하며, 완전한 오픈소스 모델은 아닙니다. 로컬 환경에서 완전한 제어가 필요한 경우에는 다른 오픈소스 모델도 고려해볼 수 있습니다.

    여러분도 한번 Gemini 3.6 Flash를 Google AI Studio에서 직접 체험해보시길 추천드리면서 저는 다음 시간에 더 유익한 정보를 가지고 다시 찾아뵙겠습니다. 감사합니다.

    https://fornewchallenge.tistory.com/

     

     


    📚 참고 문헌 및 출처

     

    728x90