본문 바로가기
AI 도구

나노-바나나: 구글의 차세대 이미지 생성 및 편집 모델, Gemini 2.5 Flash Image 분석

by James AI Explorer 2025. 8. 28.
    728x90

    안녕하세요! 최근 AI 이미지 생성 및 편집 분야에서 Nano-banana라는 코드명으로 알려진 혁신적인 모델이 등장하여 큰 주목을 받고 있습니다. 한때 미스터리 모델로 불리며 성능에 대한 궁금증을 자아냈던 Nano-banana는 이제 Google DeepMind가 개발한 Gemini 2.5 Flash Image 모델의 정식 명칭으로 밝혀졌습니다. 이 모델은 기존의 이미지 생성 모델이 가졌던 한계를 뛰어넘는 기능들을 제공하며, 개발자와 사용자 모두에게 새로운 창작의 지평을 열어줄 것으로 기대를 모으고 있습니다. 본 블로그에서는 Gemini 2.5 Flash Image(Nano-banana)의 주요 특징, 기능, 벤치마크 결과, 그리고 실제 성능 테스트를 상세히 살펴보겠습니다.

    나노-바나나: 구글의 차세대 이미지 생성 및 편집 모델, Gemini 2.5 Flash Image 분석

     


    1. Nano-banana 개요

    Nano-banana는 Google이 발표한 차세대 이미지 생성 및 편집 모델인 Gemini 2.5 Flash Image의 코드명입니다. 이 모델은 이미지 생성 및 편집 능력이 크게 강화되었으며, 특히 사용자에게 더 높은 품질의 이미지와 강화된 창의적 제어 기능을 제공합니다. 초기에는 LMArena라는 AI 모델 평가 플랫폼에 등장하여 뛰어난 성능으로 커뮤니티의 관심을 집중시켰으며, 그 정체가 Google의 비공개 프로젝트일 것이라는 추측을 낳았습니다. 이는 Google이 내부적으로 과일 이름을 코드명으로 사용하는 경향이 있기 때문입니다.

     

    Gemini 2.5 Flash Image는 빠른 속도(낮은 지연시간)와 비용 효율성, 그리고 사용 용이성을 목표로 개발되었던 Gemini 2.0 Flash의 장점을 계승하면서도, 사용자 피드백을 반영하여 이미지 품질과 창의적 제어 기능을 더욱 향상시켰습니다. 현재 개발자들은 Gemini API, Google AI Studio, Vertex AI를 비롯하여 OpenRouter, fal.ai와 같은 다양한 플랫폼을 통해 이 모델을 즉시 사용할 수 있습니다. 모든 결과물에는 보이지 않는 디지털 워터마크인 SynthID가 삽입되어 AI 생성물임을 감지할 수 있도록 합니다.

    https://blog.google/intl/en-mena/product-updates/explore-get-answers/nano-banana-image-editing-in-gemini-just-got-a-major-upgrade/

     

    Nano Banana! Image editing in Gemini just got a major upgrade

    Today in the Gemini app, we're unveiling a new image editing model from Google DeepMind. People have been going bananas over it already in early previews — it's the top-…

    blog.google

    728x90

    2. Nano-banana 특징 및 주요 기능

    Gemini 2.5 Flash Image는 이미지 생성 및 편집 과정에서 여러 혁신적인 기능을 제공하여 사용자가 원하는 결과물을 더욱 쉽고 정확하게 얻을 수 있도록 돕습니다.

    1) 캐릭터 일관성 유지 (Character Consistency):

    • 기존 이미지 생성 모델의 큰 과제 중 하나였던 동일한 캐릭터의 외형 유지를 효과적으로 지원합니다.
    • 같은 인물을 다양한 환경에 배치하거나, 제품을 여러 각도 및 장소에서 표현하고, 브랜드 자산의 일관성을 확보하는 데 유용합니다.
    • 예를 들어, 사진 속 인물의 옷을 바꾸거나, 다른 장소에 배치하더라도 얼굴 특징이 변형되지 않고 유지됩니다. 이는 여러 이미지를 연속적으로 편집하거나, 다중 패널 만화, 광고 이미지 등에서 스타일과 개성을 일관되게 유지하는 데 매우 효과적입니다.

    2) 자연어 기반 부분 편집 (Natural Language-based Partial Editing):

    • 사용자는 자연어 지시만으로 이미지의 특정 부분을 세밀하게 변형할 수 있습니다.
    • 배경 블러 처리, 티셔츠 얼룩 지우기, 인물 삭제, 포즈 변경, 흑백 이미지를 컬러로 변환하는 등의 작업이 가능합니다.
    • 샌드위치를 햄버거로 바꾸거나, 커피컵을 스타벅스 컵으로 교체하는 등 이미지 내의 특정 객체를 정확하게 인식하고 수정할 수 있습니다.

     

    3) 세계 지식 기반 네이티브 활용 (World Knowledge Utilization):

    • 기존 모델들이 미적인 이미지 생성에 강점이 있었던 반면, 현실 세계에 대한 의미론적 이해는 부족했습니다.
    • Gemini 2.5 Flash Image는 Gemini의 세계 지식을 기반으로 손으로 그린 다이어그램 인식, 실제 세계 질문 대응, 복잡한 편집 명령 수행 등이 가능합니다. 이는 모델이 단순히 픽셀을 조작하는 것을 넘어 이미지의 맥락과 의미를 이해하여 더욱 정교한 편집을 가능하게 합니다.

    4) 멀티 이미지 융합 (Multi-image Fusion):

    • 여러 이미지를 이해하고 자연스럽게 합성할 수 있습니다.
    • 상품을 새로운 배경에 삽입하거나, 방 전체의 컬러 톤 및 질감을 변경하고, 단일 프롬프트로 이미지를 융합하는 것을 지원합니다.
    • 예를 들어, 한 여성의 단독 사진과 강아지의 단독 사진을 합성하여 마치 둘이 함께 안고 있는 것처럼 보이게 만들 수 있습니다. 이 기능은 복잡한 구도를 생성하거나 광고 콘텐츠 제작에 유용합니다.

    5) 인페인팅(In-painting) 및 아웃페인팅(Out-painting):

    • 인페인팅은 기존 장면에 사람이나 객체를 추가하는 것을 의미하며, 아웃페인팅은 이미지의 경계를 확장하여 새로운 디테일을 추가하는 것을 의미합니다.
    • 이 모델은 이미지의 내용을 보존하면서 장면을 확대하거나 축소하여 새로운 요소를 자연스럽게 통합할 수 있습니다.

    6) 장면 일관성 보존 (Scene Preservation):

    • 이미지 내의 캐릭터를 변경하더라도 배경 장면(창문, 램프, 그림, 식물 등)이 일관되게 유지됩니다.
    • 이 모델은 원본 이미지에 없는 많은 세부 정보를 추가하거나 환각을 일으키지 않으려고 노력합니다.

    7) 현실감 (Realism) 및 디테일 (Detail):

    • 현실적인 이미지 생성 및 편집에 특화되어 있습니다. 특히 얼굴의 현실감과 세부 묘사가 뛰어납니다.
    • 다만, 때때로 생성된 이미지의 디테일이 비논리적으로 나타나는 경우가 있다는 지적도 있습니다.

    8) 개발자 친화적 환경 (Developer-friendly Environment):

    • Google AI Studio의 “Build Mode” 업그레이드를 통해 앱 개발이 더 간편해졌습니다.
    • 개발자는 사용자 정의 AI 앱을 빠르게 제작, 테스트, 리믹스할 수 있으며, Google AI Studio에서 직접 배포하거나 코드를 GitHub에 저장할 수 있습니다.
    • Gemini API, Google AI Studio, Vertex AI, OpenRouter, fal.ai 등 다양한 플랫폼에서 바로 사용할 수 있습니다.

    9) 디지털 워터마크 (Digital Watermark):

    • Gemini 2.5 Flash Image로 생성 및 편집된 모든 이미지에는 보이지 않는 SynthID 디지털 워터마크가 삽입되어, 해당 이미지가 AI 생성물임을 감지할 수 있습니다. 이 워터마크는 압축, 크롭, 리사이즈, 색 보정, 오버페인팅에도 남아있어 이미지의 출처를 추적하는 데 도움이 됩니다.

     


    3. Nano-banana 벤치마크 결과

    Nano-banana, 즉 Gemini 2.5 Flash Image는 LMArena와 같은 커뮤니티 리더보드에서 최고 등급의 이미지 편집 모델로 평가받으며, 놀라운 성능을 입증했습니다. 일부에서는 이를 이미지 편집 모델의 "GPT-4 순간"과 같다고 평가하기도 했습니다.

    1) LMArena 순위: Nano-banana는 현재 LMArena에서 1,147점이라는 높은 점수로 랭킹 상단을 차지하고 있습니다. 이는 다른 최상위 이미지 모델들에 비해 높은 승률을 보여줍니다. 

    Nano-banana LMArena 순위

    2) 속도 (Speed): ChatGPT의 이미지 생성 모델보다 훨씬 빠른 속도를 자랑합니다. 테스트 결과에 따르면, Nano-banana는 초당 108 토큰을 생성하여 o4-mini(110 t/s)와 비슷한 수준이며, Gemini 2.5 Pro(72 t/s)나 다른 모델보다 빠릅니다. 이처럼 빠른 속도는 추가적인 사고(thinking) 과정으로 인한 지연 시간을 보상하기 위해 더 높은 속도로 출력하기 때문인 것으로 추정됩니다.

    3) 비용 (Pricing): Gemini 2.5 Flash Image의 가격은 100만 출력 토큰당 30달러, 이미지 한 장당 약 0.039달러로 책정되어 있습니다.

    4) 해상도 (Resolution): Gemini 2.5 Flash Image의 출력 해상도가 상대적으로 낮아 품질이 저하될 수 있다는 단점이 여러 테스트에서 확인되었습니다. 원본 이미지를 1메가픽셀 정도로 다운스케일하는 경향이 있으며, 이로 인해 선명도와 디테일이 손실될 수 있습니다. 이러한 문제점을 해결하기 위해 SUPIR 애플리케이션을 통한 업스케일링이 효과적인 해결책으로 제시되었습니다. SUPIR를 사용하면 Gemini로 편집된 이미지를 4배 해상도로 업스케일하여 놀라운 디테일과 현실감을 얻을 수 있습니다.

    5) 종횡비 (Aspect Ratio) 문제: 테스트 결과, Gemini 2.5 Flash Image는 정사각형 종횡비(1:1)로 이미지를 생성하는 경향이 있으며, 16:9와 같은 다른 종횡비로 이미지를 생성하도록 지시하더라도 따르지 않는 문제가 있었습니다. 이 문제를 해결하기 위해 원하는 종횡비의 마스크를 제공하는 방법이 제안되기도 했습니다.


    4. Nano-banana 사용방법

    1) Gemini API

    nano-banana-image-fusion.zip
    0.01MB

     

    위 압축파일은 Gemini API를 활용하여 Build apps with Gemini(https://aistudio.google.com/apps) 사이트에서 만든 앱입니다. 압축을 풀고 아래 순서에 따라 의존성을 설치한 후, API KEY를 설정하고 실행하면 됩니다. 

    사전 준비 사항: Node.js

    • 1. 의존성 설치: `npm install`
    • 2. API KEY 설정: .env.local 파일의 `GEMINI_API_KEY`에 발급받은 API KEY를 설정합니다. 
    • 3. 앱 실행: `npm run dev`명령을 실행한 후, http://localhost:5173/ 주소에서 아래와 같이 이미지 생성 앱이 열립니다. 

    npm run dev 명령 실행
    Gemini API를 이용한 이미지 편집

    2) Google AI Studio

    https://aistudio.google.com/에 접속 후, 우측 모델 리스트에서 Gemini 2.5 Flash Image Preview를 선택하고, 아래 화면처럼 이미지와 프롬프트를 입력하면 됩니다. 

    Google AI Studio에서 Nano-banana를 이용한 이미지 편집


    5. 맺음말

    Google의 Gemini 2.5 Flash Image, 즉 Nano-banana는 이미지 생성 및 편집 분야에서 놀라운 성능과 잠재력을 보여주는 모델입니다. 특히 캐릭터 일관성, 자연어 기반의 정밀 편집, 세계 지식 활용, 그리고 다중 이미지 융합 능력은 기존 모델들이 해결하기 어려웠던 문제들을 효과적으로 해결합니다. LMArena에서 최고 등급의 이미지 편집 모델로 자리매김하며, 빠른 속도와 효율적인 비용 구조를 제공합니다.

     

    Nano-banana는 개발자들에게 사용자 정의 AI 앱을 구축할 수 있는 강력한 도구를 제공하며, 광고 제작, 가상 시착, 이미지 복원 등 다양한 실제 시나리오에서 활용될 수 있습니다. Gemini 2.5 Flash Image는 이미지 생성 AI 시장의 경쟁 구도를 바꾸고, 앞으로 창의적인 작업과 개발 경험을 한층 더 확장시켜 줄 중요한 도구가 될 것 같습니다.

     

    여러분도 Nano-banana를 이용해서 직접 이미지를 편집해 보시길 추천드리면서 그럼 저는 다음 시간에 더 유익한 정보를 가지고 다시 찾아뵙겠습니다. 감사합니다. 

     

    https://fornewchallenge.tistory.com/

     

    2025.02.24 - [AI 도구] - ✨🖼️구글 위스크(Whisk): 이미지 조합으로 이미지를 생성하는 AI 도구

     

    ✨🖼️구글 위스크(Whisk): 이미지 조합으로 이미지를 생성하는 AI 도구

    안녕하세요! 오늘은 구글에서 새롭게 공개한 생성형 AI 이미지 생성 도구, 위스크(Whisk)에 대해 살펴보겠습니다. 기존 AI 이미지 생성 도구들은 텍스트 프롬프트를 입력했지만, 위스크는 이미지

    fornewchallenge.tistory.com

     

    728x90