2026년 8월 7일 xAI가 Grok Imagine Image 2.0(grok-imagine-image-2.0)을 공식 발표했다. Imagine Image 2.0 발표와 API 문서 기준, 이 모델은 복잡한 프롬프트 준수·이미지 내 텍스트·국소 편집·다중 레퍼런스·화면비 확장을 한 세대에 묶은 실무형 이미지 모델이다.
이 문서는 Grok 웹 UI에서 동일 모델로 11종 스트레스 테스트 프롬프트를 돌린 뒤, 생성물을 AI 이미지 갤러리에 등록하고 난이도·체감 품질을 정리한 생성 테스트 보고서다. Arena Text-to-Image 1316±12, Image Edit 1439±8 수치와 1세대 대비 변화·Reddit 여론은 조사본을 압축해 함께 적었다.
1. 한눈에 보는 테스트 요약
| 항목 | 내용 |
|---|---|
| 모델 | grok-imagine-image-2.0 (xAI · Grok Imagine Quality Mode 계열) |
| 테스트 일 | 2026-08-12 |
| 프롬프트 수 | 11종 (영문 9 + 한글 2) |
| 출력 해상도 | 1792×1008 (대부분 16:9) |
| 생성 경로 | Grok Imagine Image 2.0 UI |
| 갤러리 등록 | 11장 · platform: xAI · ai_model: grok-imagine-image-2.0 |
| 최고 난이도 통과 | 한글 인포·전단, 영문 제품 타이포, 거울 반사 장면 |
| 주의 구간 | 인원 수·소품 개수 등 정량 지시는 육안 재확인 |
1.1. 난이도별 결과 한줄 평
| 난이도 | 테스트 | 체감 |
|---|---|---|
| 최상 | 주식 경고 한글 인포 | 레이아웃·한글 문장 모두 강점 |
| 상 | 마트 전단·AURELIA 제품·발레 거울 | 텍스트·반사·제품 구도 우수 |
| 중상 | 가족 저녁·중세 일식·불가능 도서관·2087 서울 | 복합 장면·군중·공간 연출 양호 |
| 중 | 수중 연구소·로봇 벌새·천문학자 다락 | SF·매크로·역사 소품 안정 |
2. Image 2.0이란 — 1세대에서 무엇이 바뀌었나
xAI 이미지 계보는 Grok-2 + FLUX.1 → 자체 Aurora → Grok Imagine(Speed/Fast) → Quality Mode → Imagine Image 2.0 순으로 이어진다. Reddit에서 말하는 「1.0」은 공식 버전명이라기보다 2.0 이전 Grok Imagine 이미지 전체를 가리키는 경우가 많다.
| 영역 | 1세대/Fast 계열 | Image 2.0 |
|---|---|---|
| 목표 | 빠른 탐색·밈·스냅 | 포스터·제품·편집·레이아웃 |
| 프롬프트 준수 | 분위기 중심 | 세부 지시·텍스트·배치 |
| 자연스러운 인물 | 우연히 매우 자연스러움 | 정제된 광고·CG 느낌으로 갈 수 있음 |
| 타이포·인포 | 불안정 | 이번 테스트에서 가장 큰 차이 |
| 편집 | 전체가 같이 변함 | 국소 보존·레퍼런스 편집 강화 |
| 가격(API) | ~$0.02/장(기본) | 1K Low $0.04 · 2K Medium $0.08 |
Image 2.0은 「한 장을 더 예쁘게」보다 지시를 지키며 반복 편집 가능한 제작 도구 쪽으로 기울었다. Reddit 초기 반응도 「새 그림 생성기」보다 원본을 조각하는 편집 모델로 쓰면 낫다는 조언이 반복된다.
3. 테스트 방법 — 11종 프롬프트 설계
프롬프트는 이미지프롬프트 매칭.txt의 영문 9종과 한글 2종을 그대로 사용했다. 각 프롬프트는 아래 능력을 동시에 겨냥한다.
- 공간·원근: 다층 교차로, 불가능 도서관, 수중 유리벽
- 반사·굴절: 발레 거울, 가족 식탁 거울, 제품 거울, 비 오는 아스팔트
- 텍스트·레이아웃: AURELIA 영문 라벨, 마트 전단, 주식 경고 인포
- 군중·동물·역사: 중세 시장·일식, 17세기 소품, 로봇 매크로
갤러리 업로드 시 모델 메타는 grok-imagine-image-2.0 · platform: xAI로 통일했다. 원본 JPEG는 img.min-inter.co.kr/ai-image-gallery/original/2026/08/12/ 경로에 보관된다.
4. 생성 결과 — 텍스트·레이아웃 (최상~상)
4.1. 주식 본전 경고 한글 인포그래픽
스트레스 포인트: 한글 타이포·복합 레이아웃·아이콘 그리드
그림 1. 제목·사이클·7대 오류·그래프·체크리스트까지 한글 문장이 대체로 읽힌다. 인포그래픽 밀도가 높아도 섹션 구분이 유지된다. 투자·법적 문구는 최종 원고와 대조 검수가 필요하다.
프롬프트가 요구한 「본전 회복 심리의 위험」 주제가 제목·사이클 다이어그램·7대 오류·실패 그래프·체크리스트까지 한 장의 교육용 인포로 압축됐다. 한글 AI 이미지에서 흔한 깨진 글자 대신 문장 단위 가독성이 확보됐다. 다만 투자·법적 고지는 픽셀 텍스트이므로 Figma·Canva에서 최종 원고를 덮어쓰는 워크플로가 안전하다.
4.2. 동네 마트 주간 특가 전단
스트레스 포인트: 한글 가격·날짜·그리드 레이아웃
그림 2. 이번 주 알뜰 특가, 날짜, 품목·가격(삼겹살 1,280원 등)이 지정대로 렌더링됐다. 실제 전단 수준의 정보 계층과 제품 사진 그리드가 한 장에 정리됐다.
날짜(8월 11일–17일), 품목명, g/kg/ml 단위, 원화 가격이 그리드 레이아웃과 함께 정리됐다. 마케팅 전단 시안·교육 자료 초안으로 바로 쓸 만한 수준이다.
4.3. AURELIA 럭셔리 티 제품 사진
스트레스 포인트: 영문 타이포·개수 지정·거울 반사
그림 3. AURELIA — CEYLON NIGHT — 24 SACHETS 철자가 맞고, 티포트 1·컵 2·티스푼·잎사귀 배치가 프롬프트와 일치한다. 원형 거울 반사도 각도가 자연스럽다.
영문 브랜드 타이포·개수 지정(티포트 1, 컵 2, 잎 5)·원형 거울 반사가 상업 제품 촬영 구도로 정리됐다. Image 2.0의 「글자를 레이아웃의 일부로 계획한다」는 공식 설명과 이번 결과가 맞닿는다.
5. 생성 결과 — 반사·해부학·다인물 (상~중상)
5.1. 발레 스튜디오 거울·유리벽
스트레스 포인트: 거울·유리 반사·해부학
그림 4. 아라베스크 포즈와 거울 속 역상이 일치하고 손·발·튜튜 질감이 안정적이다. 반사·유리벽·바닥 그림자까지 photoreal 수준으로 정리됐다.
거울 반사는 AI 이미지의 고전적 약점인데, 이번 샷에서는 아라베스크 역상·손가락·포인트 슈가 안정적이다. Reddit에서 지적되는 「플라스틱 피부」보다 조명이 부드러운 실내 장면에서는 자연스러움을 유지했다.
5.2. 1950년대 가족 저녁·거울 반사
스트레스 포인트: 다인물·거울·1950s 소품
그림 5. 벽거울 반사와 은 teapot, 빵·사과 등 행동 묘사가 살아 있다. 프롬프트는 5인 가족이나 결과는 6명으로 보여 인원 수 지시는 재확인 대상이다.
할머니·아버지·어머니·아이 등 역할별 행동과 벽거울·은주전자 반사가 한 장면에 담겼다. 인원 수(5명 지시 vs 6명 결과)처럼 정량 조건은 여전히 검수 포인트다.
5.3. 중세 시장·총일식
스트레스 포인트: 군중·일식 조명·역사 소품
그림 6. 일식 코로나·고딕 대성당·상인·말·닭 등 역사 장면 요소가 한 프레임에 모였다. 군중 밀도와 이클립스 조명 대비가 강점이다.
일식 코로나 아래 군중·말·닭·상점 소품이 역사 드라마 한 컷처럼 읽힌다. 복잡 군중 장면에서도 중심 피사체(관측자·어머니·말)가 분리된다.
6. 생성 결과 — 공간·SF·매크로 (중상~중)
6.1. 불가능 도서관
스트레스 포인트: 공간 추론·계단·원근
그림 7. 나선형 책장·중앙 아트리움·계단 교차 구조가 판타지 공간으로 읽힌다. 불가능 건축이지만 원근과 스케일감은 유지된다.
6.2. 2087년 서울 야경
스트레스 포인트: 다층 교차로·반사·SF 한옥
그림 8. 한옥·유리 다리·자기부상 열차·비 반사 네온이 겹친 SF 서울 장면. 깊이감 있는 교차로와 인물 스케일 변화가 프롬프트 방향과 맞다.
6.3. 수중 투명 연구소
스트레스 포인트: 굴절·유리·내외부 일관
그림 9. 유리벽 너머 연구실과 바깥 고래상어·물고기·드론 빛이 한 장면에 담겼다. 굴절·수중 caustic 표현이 SF 일러스트로 정리됐다.
6.4. 로봇 장인·기계 벌새
스트레스 포인트: 미세 기계·재질 분리·매크로
그림 10. 돋보기 램프·톱니·에나멜 날개·벌새 눈 등 미세 디테일이 구분된다. cluttered workshop 분위기와 재질 대비가 잘 살아 있다.
6.5. 17세기 천문학자 다락방
스트레스 포인트: 소품 7개·촛불·황동
그림 11. 황동 astrolabe·왁스 봉인 편지·모래시계·깃펜 등 17세기 소품 밀도가 높다. Rembrandt식 명암과 재질(황동·가죽·나무) 대비가 뚜렷하다.
7. Arena·공식 스펙과 이번 테스트의 관계
| 항목 | 공식·Arena | 이번 테스트에서 확인된 점 |
|---|---|---|
| Text-to-Image Arena | 1316±12 (low 품질 표기) | 복합 장면·텍스트 프롬프트를 한 번에 소화 |
| Image Edit Arena | 1439±8 (2위권) | UI 생성만 테스트 — 편집 API는 별도 검증 필요 |
| 해상도 | API 1K·2K | UI 출력 1792×1008 |
| 품질 | low · medium | UI Quality Mode 사용 |
| 출력 | 최대 10장/요청 | 11종 각 1장 생성 |
Arena Elo는 블라인드 선호 투표 기준이라 한국어 철자·SKU·브랜드 가이드·픽셀 단위 편집을 대신 보장하지 않는다. 이번 11장은 프롬프트 준수·타이포·반사 쪽에서 1세대 대비 체감 차이가 큰 편이었다.
8. Reddit·커뮤니티 평가 (압축)
조사 시점 r/grok 스레드에서는 Image 2.0 출시 직후 부정 반응이 많았다. 반복 키워드는 plastic/waxy skin, 추가 팔다리, 구형 프롬프트 무력화, Quality가 Fast보다 딱딱하다는 불만이다.
긍정 쪽에서는 프롬프트 준수·얼굴 유지·부분 편집·업스케일이 Nano Banana 계열과 견줄 만하다는 평가도 있다. 여론을 한쪽으로만 읽기보다 작업 유형별로 모델을 나누는 것이 현실적이다.
| 작업 | 추천 |
|---|---|
| 포스터·인포·전단·제품 | Image 2.0 |
| 자연스러운 스냅·짧은 프롬프트 탐색 | Fast/Speed 병행 |
| 특정 부분만 수정 | Image 2.0 편집 (원본 보존) |
| 최종 인쇄·광고 | 2.0 초안 → Figma/Photoshop 텍스트 교체 |
9. API·가격·도입 시 체크리스트
xAI 직접 API 기준(2026-08):
| 작업 | 예상 비용 |
|---|---|
| 텍스트→1K Low | $0.04 |
| 텍스트→2K Medium | $0.08 |
| 이미지 1장 편집→2K Medium | $0.09 |
Kie.ai 등 중개 API는 홍보 페이지와 공개 문서의 모델 ID·품질 파라미터가 어긋날 수 있다. 프로덕션에서는 응답 메타의 upstream 모델 ID·실패율·크레딧 로그를 50~100건 먼저 측정하는 편이 낫다.
Magic Wand·Segmentation·Smart Resize·배경 제거는 xAI 발표에는 있으나 일반 API 문서에 전용 파라미터가 아직 명확하지 않다. UI 전용일 수 있으므로 API 연동 전 문서를 다시 확인해야 한다.
10. 상황별 선택표
| 상황 | 선택 |
|---|---|
| 한글·영문 타이포가 핵심 | Image 2.0 + 최종 디자인 툴 검수 |
| 거울·반사·군중 스트레스 | Image 2.0, 실패 시 시드·프롬프트 단순화 |
| 인물 스냅·피부 질감 우선 | Fast와 A/B 비교 |
| 동일 캐릭터 연속 제작 | 레퍼런스 고정 + 큰 포즈 변경은 수동 검수 |
| 장기 프로덕션 | API 모델 ID 고정·회귀 테스트 |
11. 마무리
앞에서 다룬 Grok Imagine Image 2.0 생성 테스트의 핵심만 짧게 정리한다.
- 11종 스트레스 프롬프트 중 한글 인포·전단·영문 제품 타이포·거울 반사 장면에서 1세대 대비 가장 큰 체감 향상이 있었다.
- 복합 장면(일식 시장·2087 서울·도서관)도 스토리텔링용 단일 컷으로 충분히 쓸 만했다.
- 정량 지시(인원 수·소품 개수)와 법·투자 문구는 여전히 사람이 검수해야 한다.
- Reddit 여론은 인물 중심 부정과 편집·레이아웃 긍정이 공존한다. 목적에 맞게 Fast와 2.0을 혼합하는 편이 낫다.
- Arena 순위·Kie 홍보 문구만 믿지 말고 실제 모델 ID·과금·실패 로그로 검증한다.
- 생성물 11장은 AI 이미지 갤러리에서
grok-imagine-image-2.0필터로 확인할 수 있다.
「Image 2.0은 예쁜 그림기보다 지시를 지키는 제작·편집 엔진에 가깝다」 — 포스터·제품·인포·반사 테스트에서는 그 방향이 이번 11장 결과와 맞닿았다. 자연스러운 인물 스냅만 필요하면 Fast와 병행하고, 텍스트·레이아웃은 반드시 디자인 툴에서 최종 확정하자.
자주 묻는 질문
- Grok Imagine Image 2.0은 무엇인가요?
xAI의 최신 이미지 생성·편집 모델로 API ID는 grok-imagine-image-2.0입니다. 2026년 8월 7일 발표됐으며 복잡한 프롬프트 준수, 타이포그래피, 국소 편집, 다중 레퍼런스, 화면비 확장을 강화한 실무형 모델입니다.
- 이번 테스트에서 사용한 프롬프트는 몇 종인가요?
총 11종입니다. 영문 복합 장면 9종(발레 거울, 2087 서울, 불가능 도서관, 중세 일식, 제품 사진, 수중 연구소, 가족 저녁, 로봇 벌새, 천문학자 다락)과 한글 2종(주식 경고 인포, 마트 전단)을 Grok Imagine Image 2.0 UI로 각 1장 생성했습니다.
- 어떤 난이도에서 Image 2.0이 두드러졌나요?
한글·영문 타이포와 레이아웃(주식 인포, 마트 전단, AURELIA 제품), 거울 반사(발레, 가족 식탁)에서 1세대 대비 체감 향상이 가장 컸습니다. 복합 군중·SF 장면도 스토리텔링용 단일 컷으로 충분했습니다.
- 1세대 Grok Imagine과 Image 2.0의 차이는?
1세대/Fast는 빠른 탐색·자연스러운 스냅·창의적 우연성에 강하고, Image 2.0은 프롬프트 준수·텍스트·레이아웃·국소 편집·제품·포스터 등 실무 제작에 맞춰졌습니다. 인물 피부는 Reddit에서 Fast가 더 낫다는 의견도 있습니다.
- 생성 이미지는 어디에서 볼 수 있나요?
11장 모두 min-inter.co.kr AI 이미지 갤러리에 grok-imagine-image-2.0 · platform xAI 메타로 등록됐습니다. 갤러리에서 모델 필터를 선택하면 원본 JPEG CDN URL로 확인할 수 있습니다.
- Arena 점수와 이번 테스트 결과는 같나요?
Arena Text-to-Image 1316±12, Image Edit 1439±8은 사용자 선호 투표 기준 Elo입니다. 이번 11장은 프롬프트 준수·타이포·반사에 초점을 둔 실측이며, 한국어 철자·법적 문구·정량 지시는 Arena가 보장하지 않으므로 별도 검수가 필요합니다.
- Image 2.0 API 가격은 어느 정도인가요?
xAI 공식 가격 기준 텍스트→1K Low는 $0.04, 2K Medium은 $0.08입니다. 이미지 편집은 입력 이미지당 $0.01이 추가됩니다. Kie 등 중개 API는 별도 크레딧 체계이므로 소량 테스트 후 실제 과금을 확인해야 합니다.
- 어떤 작업에 Image 2.0을 쓰고 피해야 하나요?
포스터·인포·전단·제품 사진·거울·레이아웃 지시에는 Image 2.0이 유리합니다. 자연스러운 인물 스냅·짧은 프롬프트 탐색은 Fast/Speed와 A/B 비교를 권장합니다. 최종 광고·인쇄물은 Figma·Photoshop에서 텍스트를 교체하는 워크플로가 안전합니다.
테크·IT