영상·팟캐스트·회의 녹음을 텍스트(SRT·txt) 로 바꾸는 STT(음성 인식) 엔진과 API 모델을 2026년 6월 기준으로 정리한 문서다. GPU 설치·WhisperX 실측·Vrew GUI 비교는 유튜브 자막 뽑는 방법 | CPU·GPU·Vrew 실험 에 담겨 있다. 그 글은 「어떻게 뽑았는가(실행·로그·속도)」이고, 이 글은 「무엇을 고를까(모델·API·벤치·과금)」 다. 두 글을 섞어 읽지 말 것.
OpenRouter 오디오 입력 모델 목록에서 Transcription(전사 전용) 과 오디오 입력 LLM 을 구분한다. 요율·모델 ID는 연동 직전 UI에서 재대조한다 — 공개 API /api/v1/models에는 전사 전용 ID가 일부만 노출되는 경우가 있다(2026-06-20 확인).
1. 이 글과 실험 위키의 차이
| 구분 | 실험 위키 | 이 글 |
|---|---|---|
| 관점 | Colab CLI · WhisperX CPU 46분 실측 · Vrew grep 비교 | STT 모델·API·벤치·과금 지도 |
| 독자 | WhisperX 설치·Windows 함정·alignment 대기 | GPU 없음 · API 연동 · 서비스 설계 |
| 수치 | RTF·로그 타임스탬프·IT 키워드 grep | OpenRouter 요율 · CER/WER · 2시간 비용 환산 |
| 산출 | SRT 뽑는 실전 노트 | 엔진 선택·하이브리드 설계 |
실험 위키에서 이미 확인된 사실(WhisperX가 IT 용어에 강함, API는 분할·병합 필요, alignment는 WhisperX 강점)은 전제로 두고, 여기서는 어떤 API·상용 STT를 붙일지 를 다룬다.
2. STT가 만드는 것 — 자막 vs 원고
| 산출물 | 용도 | STT에서 중요한 축 |
|---|---|---|
| SRT·VTT | 유튜브·숏폼·방송 자막 | 세그먼트·단어 타임스탬프 |
| plain txt | 위키·블로그·검색·요약 입력 | 문자 정확도·고유명사 |
| JSON 세그먼트 | 앱·RAG·회의록 | 화자 분리·메타데이터 |
같은 MP3라도 「자막용」이면 타임코드 정밀도, 「원고용」이면 Next.js·GitHub 같은 영문 표기 보존이 더 중요하다. 실험 위키의 grep 비교는 후자에 해당한다.
3. CER·WER — 벤치마크 숫자 읽는 법
3.1. WER (Word Error Rate, 단어 오류율)
(치환+삭제+삽입) ÷ 정답 단어 수. 낮을수록 좋다. 영어권 리더보드의 기본 지표다.
3.2. CER (Character Error Rate, 글자 오류율)
한국어·중국어·일본어(CJK)에 더 공정하다. WER은 한 글자만 틀려도 어절 전체가 오답 처리되기 쉽다.
| CER 대략 | 체감 |
|---|---|
| ~5% | 교정 거의 불필요(인간 수준에 가까움) |
| 5~10% | 가벼운 교정으로 실무 가능 |
| 10~15% | IT·고유명사에서 손이 많이 감 |
| 20%+ | 실무 재전사 검토 권장 |
주의: 스튜디오 녹음 vs 잡음·다화자 조건에 따라 같은 모델도 2~3배 차이 난다.
3.3. WER 숫자 두 종류 — 혼동 금지
같은 Whisper라도 표에 적힌 WER이 다르게 보인다. 측정·출처가 다르다.
| 출처 | Whisper Large v3 | Whisper Large v3 Turbo | 의미 |
|---|---|---|---|
| OpenRouter 모델 카드 표기 | ~10.3% | ~12% | 제품 설명·마케팅 WER. 과거 벤치·특정 코퍼스 기준 |
| Artificial Analysis AA-WER | ~4.1% | ~4.6% | 2026년 통일 벤치·영어 중심. 리더보드 비교용 |
독자 안내: OpenRouter 카드 WER과 AA-WER를 한 표에서 직접 비교하지 않는다. 카드 수치는 「모델 스펙 요약」, AA-WER는 「2026 글로벌 순위」로만 쓴다.
3.4. 한국어 CER 참고 (리턴제로 공개 벤치)
| 모델·서비스 | 평균 CER | 비고 |
|---|---|---|
| 리턴제로 sommers | 5.91% | 한국어 상용 1위권 |
| 리턴제로 파인튜닝 Whisper | 6.59% | |
| Naver Clova Speech | 7.52% | |
| OpenAI Whisper | 11.39% | 오픈소스 Whisper 계열 |
| Google STT v2 | 11.50% | |
| Deepgram Nova-2 | 21.02% | 한국어 부적합 — 영어 최적화 |
| Gemini 2.0 Flash | 16.58% | (표에 없던 구세대) |
연식 단서 (중요): 위 CER은 Nova-2·Gemini 2.0·Whisper·STT v2 등 2024~2025년 전후 벤치에 가깝다. 본문에서 Nova-3·Gemini 3.x·GPT-4o Transcribe 를 논할 때 이 표의 순위를 그대로 대입하지 않는다 — 최신 세대 한국어 CER은 공개 벤치가 제한적이므로 5~10분 샘플 grep으로 보완한다.
운영 주체가 벤치를 제공하므로 상대 비교용으로만 쓴다.
4. STT 모델 연혁 — 원본 출시 vs OpenRouter 등록
「옛날 모델」과 「OpenRouter에 올라온 날」은 다르다. 아래 원본 출시는 모델·API 역사, OR 등록은 Transcription 필터 카드에 표시된 등록일(2026-06 UI 기준)이다.
| 계열 | 원본 출시(과거) | OpenRouter Transcription 등록 | 비고 |
|---|---|---|---|
| OpenAI Whisper (오픈소스) | 2022년 9월 | — (로컬·WhisperX) | large-v2/v3/turbo 가중치 |
| whisper-1 API | 2022년~ (과거부터) | 2026-04-28 | 구 API명, 25MB 제한 |
| Whisper Large v3 | 2023년 11월 | 2026-05-01 | 1,550M params |
| Whisper Large v3 Turbo | 2024년 10월 | 2026-05-01 | 디코더 경량화·속도 우선 |
| GPT-4o Transcribe | 2025년 (OpenAI Audio API) | 2026-04-28 | LLM 기반 전사 |
| GPT-4o Mini Transcribe | 2025년~ | 2026-05-02 | 저가형 |
| faster-whisper | 2023년~ | — | CTranslate2, CLI 표준 |
| WhisperX | 2023년~ | — | alignment·VAD·화자 분리 |
| Mistral Voxtral Small 24B | 2025년 7월 | (멀티모달·오디오 입력) | 전사+이해 |
| Voxtral Mini Transcribe | 2025~ | 2026-05-16 | 전사 API 전용 |
| Google Chirp 3 | 2025~ | 2026-05-06 | Google Cloud STT 계열 |
| Qwen3 ASR Flash | 2025~ | 2026-05-14 | Alibaba ASR API |
| NVIDIA Parakeet TDT 0.6B v3 | 2025년 | 2026-05-27 | EU 25개어, 한국어 미지원 |
| Microsoft MAI-Transcribe 1.5 | 2025~ | 2026-06-03 | Azure Speech fast |
| Deepgram Nova-2 | 과거 | — | 한국어 CER 표 |
| Deepgram Nova-3 | 2025년~ | OpenRouter 밖·별도 | AA-WER·실시간 영어 |
| 리턴제로 sommers | 상용 | OpenRouter 미등록 | 한국어 CER 1위권 |
5. 글로벌 STT 판도 (2026년 6월 · AA-WER)
영어·다국어 평균 기준 Artificial Analysis Speech-to-Text 리더보드. 아래는 AA-WER만 사용한다.
| 순위권 | 모델·서비스 | AA-WER | 특징 |
|---|---|---|---|
| 1~2 | Fun-Realtime-ASR, ElevenLabs Scribe v2 | ~2%대 | 자막·배치 |
| 3~5 | MS MAI-Transcribe, Voxtral, Gemini 3 | ~2.5~3% | 상용·멀티모달 |
| — | GPT-4o Transcribe | ~4% | LLM 전사 |
| — | Whisper Large v3 Turbo | ~4.6% | 초저가·초고속 |
| — | Deepgram Nova-3 | ~5% | 실시간 영어, 한국어 CER 별도 |
| — | Parakeet TDT 0.6B v3 | ~4.5% | 983×, EU 언어 |
순수 Whisper 단독 「정확도 왕」 시대는 글로벌에선 지났다. Whisper 계열의 남은 가치는 오픈 가중치 + WhisperX alignment + Turbo 초저가 API 쪽에 가깝다.
6. OpenRouter Transcription — 확인 방법과 표
6.1. 발행·연동 전 체크리스트
| # | 확인 |
|---|---|
| 1 | models?input_modalities=audio → Transcription 태그 |
| 2 | 카드 모델 ID·분/초/토큰 요율 스크린 또는 Activity 샘플 호출 |
| 3 | 공개 /api/v1/models 와 UI 목록 불일치 가능 — UI를 정본으로 |
| 4 | 채팅 Completions SDK ≠ Audio Transcription API 엔드포인트 |
| 5 | 한국어·IT 강의는 5분 샘플 grep (실험 위키 방식) |
6.2. A. UI Transcription 탭 (2026-06-20 카드·스크린 기준)
OpenRouter 웹 Transcription 필터에 보이는 전사 전용 모델과 카드 표시 요율. OR 등록일은 UI 카드 하단 날짜.
| 모델 | OR 등록 | 카드 요율 | 2시간 환산 | 한국어 | 카드 WER·메모 |
|---|---|---|---|---|---|
| Whisper Large V3 Turbo | 2026-05-01 | $0.04/시간 | ~$0.08 | 99+ 언어 | 카드 WER ~12% |
| Whisper Large V3 | 2026-05-01 | $0.0015/분 | ~$0.18 | 99+ 언어 | 카드 WER ~10.3%, word·segment TS |
| OpenAI Whisper 1 | 2026-04-28 | $0.006/분 | ~$0.72 | 50+ | 25MB, 2022년~ API |
| GPT-4o Transcribe | 2026-04-28 | $2.50/$10 per M tok | ~1,000원 | 지원 | ~25분·25MB 분할 |
| GPT-4o Mini Transcribe | 2026-05-02 | $1.25/$5 per M tok | 수백 원대 | 지원 | Mini 절반가 |
| Mistral Voxtral Mini Transcribe | 2026-05-16 | $0.003/분 | ~$0.36 | 전사 API | 회의·팟캐스트 |
| Google Chirp 3 | 2026-05-06 | $0.016/분 | ~$1.92 | 24 GA + preview | 노이즈·구두점 |
| Qwen3 ASR Flash | 2026-05-14 | $0.000035/초 | ~$0.25 | 11개어(한국어) | context text bias |
| NVIDIA Parakeet TDT 0.6B v3 | 2026-05-27 | $0.0015/분 | ~$0.18 | 한·중·일 미지원 | EU 25개어 |
| Microsoft MAI-Transcribe 1.5 | 2026-06-03 | $0.36/시간 | ~$0.72 | 100+ BCP-47 | Azure fast API |
토큰 과금 2시간 추정은 출력 토큰량에 ±50% 흔들릴 수 있다. 연동 전 UI 재확인 필수.
6.3. B. API /api/v1/models 에서 audio 필드 확인 (2026-06-20)
공개 모델 API를 조회했을 때 pricing.audio 가 명시된 항목은 아래가 대표적이다. UI Transcription 목록과 1:1로 같지 않을 수 있다.
| 모델 ID | audio 요율(API) | 2시간 환산 | 비고 |
|---|---|---|---|
| mistralai/voxtral-small-24b-2507 | $0.0001/초 | ~$0.72 | (= $100 per 1M audio-seconds) |
Voxtral Small 과금 주의: $0.0001/초 × 7200초 = $0.72는 산술상 맞다. 다만 Artificial Analysis 벤치에는 Voxtral Small $4.00/1000분 견적도 있어, 과금 경로·프롬프트+오디오 혼합·벤치 산식이 다를 수 있다. 실제 청구는 OpenRouter Activity·소액 테스트로 확인한다.
| 항목 | Voxtral Small 24B |
|---|---|
| AA-WER (글로벌) | ~2.8% |
| 텍스트 (OR API) | prompt $0.10/M · completion $0.30/M |
| 용도 | 전사·번역·오디오 이해 — 순수 Transcription API와 엔드포인트 다를 수 있음 |
6.4. C. OpenRouter 밖 — 한국어·상용 (CER·실무)
| 서비스 | 경로 | 한국어 | 비고 |
|---|---|---|---|
| 리턴제로 sommers | RTZR API | CER 5.91% (벤치) | 통화·회화 |
| Naver Clova Speech | 네이버 클라우드 | CER 7.52% | 국산 |
| Deepgram Nova-3 | Deepgram 직접 | 한국어 CER 미검증 | 영어 실시간 |
| ElevenLabs Scribe v2 | ElevenLabs | AA-WER 상위 | 자막·배치 |
7. Groq(그록) vs Grok(그록)
| 이름 | 정체 | STT |
|---|---|---|
| Groq | LPU 추론 회사 | Whisper Turbo 프로바이더 ($0.04/시간급) |
| Grok | xAI 텍스트 LLM | 전사 아님 |
8. 오디오 입력 LLM vs Transcription API
Gemini 3.5 Flash, GPT Audio, Qwen3.5 Omni 등은 오디오 입력 LLM. 1M 컨텍스트·요약·QA에는 유리하고, 자막용 세밀 타임코드는 Transcription API + WhisperX alignment가 낫다.
| 구분 | Transcription API | 오디오 LLM |
|---|---|---|
| 목적 | 받아쓰기·SRT | 대화·요약·추론 |
| 과금 | 분·초·시간·전사 토큰 | 입·출력 토큰 |
| 2시간 통짜 | chunk 필요(대부분) | Gemini 등은 가능 |
| 타임스탬프 | v3·Chirp 일부 | 약함 |
9. 클라우드 Whisper Large v3 — OpenRouter·Groq·WaveSpeed (2026-06-20 실측)
OpenRouter 카드의 Whisper Large v3, Groq 직접 API, WaveSpeed openai-whisper 는 모두 같은 계열 STT이지만 엔드포인트·타임스탬프·과금 단위가 다르다. min-inter.co.kr에서 29분 한국어 강의(사주팔자 롱폼) 자막 싱크를 맞추려다 2026년 6월 20일 아래 결과를 확인했다. 이 절은 벤치 표가 아니라 실제 호출·청구·산출물 기록이다.
9.1. 같은 모델, 다른 API — 한눈 표
| 제공자 | 환경변수 | API | 타임스탬프 | 롱폼(~30분) | 과금(문서·실측) |
|---|---|---|---|---|---|
| OpenRouter | OpenRouter API 키 | POST openrouter.ai/.../audio/transcriptions | ❌ text만 (실측) | 15분 미만 검증·probe | $0.0015/분 (카드) |
| Groq | Groq API 키 | POST api.groq.com/.../audio/transcriptions | ✅ verbose_json segment | 25MB → 10분 FLAC 청크 | v3 $0.111/시간 (~29분 ~$0.05) |
| WaveSpeed | WaveSpeed API 키 | POST api.wavespeed.ai/.../openai-whisper | ✅ enable_timestamps (word) | ~60분/파일 | $0.001/초 (= $3.6/시간) |
자막(SRT·SBV) 정본 → Groq segment TS 가 2026-06-20 기준 검증됨. OpenRouter는 문구 grep 검증만. WaveSpeed는 문서·스킬에 기록했으나 롱폼 가성비는 Groq 대비 30배 이상 비쌈.
9.2. API 키 관리 (공개 문서 주의)
각 게이트웨이는 서로 다른 API 키를 쓴다. 키 이름·저장 경로·로컬 스크립트 위치는 위키에 적지 않는다 — 저장소 커밋·스크린샷·Activity 캡처에도 노출하지 않는다.
| 게이트웨이 | 용도 (2026-06) |
|---|---|
| OpenRouter | 짧은 클립·probe·text 전사 |
| Groq | 롱폼 segment 타임스탬프 자막 정본 |
| DeepInfra | GPU 없이 segments·words TS·최저가 |
| WaveSpeed | word TS·~60분 파일·비동기 poll (비용 높음) |
연동 전 각 콘솔에서 키를 발급하고, 앱·서버의 비밀 저장소에만 둔다. 값은 로그·위키에 출력하지 않는다.
9.3. OpenRouter 경유 — 실측 (Together 프로바이더)
| 항목 | 확인 내용 |
|---|---|
| 모델 ID | openai/whisper-large-v3 |
| OpenRouter Activity (2026-06-20) | Provider: Together · App: 내부 probe 앱 |
| 요율 | 호출당 $0.0015 = 1분 분량 과금이 대부분 (카드 $0.0015/분과 일치) |
| 응답 본문 | { text, usage } 만 반환 |
responseformat: verbosejson | 무시됨 |
timestamp_granularities (segment/word) | 무시됨 |
| provider passthrough / probe | 동일 — 세그먼트·단어 타임코드 없음 |
짧은 구간(1~3분) 은 plain text로 Vrew SBV 문구 대조에는 쓸 수 있다. 자막 파일로 쓰면 안 된다.
9.3.1. 29분 롱폼 OpenRouter 시도 — 실패 원인
- 29분 mp4를 60초 청크로 잘라 OpenRouter에 반복 호출 (probe·longform 스크립트).
- API가 타임스탬프를 주지 않아 문장 길이에 비례해 가짜 타임코드를 붙이는 방식으로 SRT/SBV 생성.
- 쇼츠 구간(5·6·8편 등) 음성 대비 자막 싱크 불일치 — 앵커 시각과 어긋남.
- 교훈: OpenRouter Whisper는 롱폼 자막 파이프라인에 넣지 말 것. 비용만 나가고 싱크는 맞지 않는다.
9.3.2. OpenRouter Activity 샘플 (2026-06-20, min-inter)
동일 날짜 Whisper Large v3 · Together 호출 요약. (전체 50회 이상 — probe + 60초 청크 반복)
| 청구 패턴 | 의미 | 대표 Cost |
|---|---|---|
| $0.0015 | ~1분 오디오 1회 | 다수 (60초 청크 1개) |
| $0.0002 ~ $0.0003 | ~8~20초 짧은 probe | 타임스탬프 옵션 실험 |
| $0.0075 | ~5분 분량 | 중간 길이 샘플 |
| $0.021 | ~14분 분량 | 긴 단일 호출 시험 |
| 합계(추정) | 당일 probe + 실패 롱폼 | 약 $0.08 ~ $0.12 |
Groq로 동일 29분을 segment TS 포함 전사한 비용(~$0.05)보다 OpenRouter probe가 더 나갔고, 자막 품질은 타임코드 없음으로 실패했다.
9.4. Groq 직접 — 롱폼 자막 정본 (실측 성공)
| 항목 | 값 |
|---|---|
| 모델 | whisper-large-v3 |
| API | OpenAI 호환 /audio/transcriptions |
response_format | verbose_json |
timestamp_granularities | segment |
| 파일 한도 | Personal 25MB → 10분 FLAC 청크 × 3 (29분 영상) |
| 산출 | ~630 segment → SBV/SRT · segments-groq.json |
| 비용 | 약 $0.05 (1733초 × $0.111/시간) |
| 싱크 검증 | 쇼츠 앵커(5:43, 18:08, 25:51 등) 대략 일치 |
후처리: refine-groq-captions — SBV 통째 교체 금지, IT 용어 보정 + 큐당 최대 36자 분할 (630 → ~818 cue). API 재호출 없이 raw 청크 JSON에서 재생성 가능.
9.5. WaveSpeed wavespeed-ai/openai-whisper — 문서·스킬 기록 (미실측 청구)
Groq와 같은 Whisper Large v3 이지만 WaveSpeed AI 게이트웨이다.
| 항목 | 내용 |
|---|---|
| 엔드포인트 | `POST https://api.wavespeed.ai/api/v3/wavespeed-ai/openai-whisper` |
enable_timestamps: true | word-level 타임스탬프 (처리 시간·비용 2배) |
enable_timestamps: false | text만 — $0.001/초 |
| 타임스탬프 ON | $0.002/초 (= $7.2/시간) |
| 길이 | 문서 기준 최대 ~60분/파일 |
| 응답 | 비동기 — prediction id → poll → outputs[0] JSON URL |
| 29분 환산 | TS 없음 ~$1.73 · word TS ~$3.47 |
Groq v3 29분 ~$0.05 와 비교하면 WaveSpeed는 30~70배 비쌈. 한 파일 60분·word TS·업로드 URL이 꼭 필요할 때만 후보. 롱폼 한국어 자막 기본값은 Groq 유지.
9.6. 자막 싱크 — API 선택 의사결정 (실측 요약)
| 목적 | 1순위 | 피할 것 |
|---|---|---|
| 롱폼 SRT/SBV + 싱크 | Groq verbose_json segment | OpenRouter 60초 청크 + 가짜 TS |
| 짧은 클립 문구 검증 | OpenRouter v3 (15분 미만) | OpenRouter로 SBV 교체 |
| word 단위 TS (비용 감수) | WaveSpeed enable_timestamps | WaveSpeed를 Groq 대체 기본값으로 |
| 정밀 cue 싱크 | WhisperX alignment (실험 위키) | API만으로 Vrew - NEXT - 정책 무시 |
9.7. OpenRouter vs Groq vs WaveSpeed — 타임스탬프·비용
| OpenRouter | Groq | WaveSpeed | |
|---|---|---|---|
| Whisper v3 | ✅ | ✅ | ✅ |
| Segment TS | ❌ (실측) | ✅ | word → 가공 필요 |
| Word TS | ❌ | ✅ (옵션) | ✅ enable_timestamps |
| 29분 한 파일 | 청크만 | 3×10분 청크 | ✅ ~60분 |
| 29분 비용(대략) | probe ~$0.1+ (실패) | ~$0.05 | ~$1.7 ~ $3.5 |
| 동기 응답 | ✅ | ✅ | poll / enablesyncmode |
10. OpenRouter · Groq · WaveSpeed — 3종 차이와 비용 (2026-06-20)
세 경로 모두 Whisper Large v3 계열 STT이지만 게이트웨이·타임스탬프·과금 단위가 다르다. 아래는 min-inter OpenRouter Activity 실측 + 각 공식 문서 요율을 1 USD = 1,550원으로 맞춘 표다.
10.1. 한눈에 — 무엇이 다른가
| OpenRouter | Groq | WaveSpeed | |
|---|---|---|---|
| 역할 | 여러 프로바이더 라우팅 허브 | LPU 직접 STT API | WaveSpeed 전용 게이트웨이 |
| 인증 | OpenRouter API 키 | Groq API 키 | WaveSpeed API 키 |
| 엔드포인트 | openrouter.ai/.../audio/transcriptions | api.groq.com/.../audio/transcriptions | api.wavespeed.ai/.../openai-whisper |
| 2026-06 실측 프로바이더 | Together (Activity) | Groq 자체 | WaveSpeed 자체 |
| 타임스탬프 | ❌ text만 (실측) | ✅ verbose_json segment·word | ✅ enable_timestamps word |
| 과금 단위 | 분 ($0.0015/분) | 시간 (v3 $0.111/h) | 초 ($0.001/s) |
| 동기/비동기 | 동기 JSON | 동기 JSON | poll (비동기) |
| 파일 한도 | 스크립트 15분 컷 | 25MB → 10분 FLAC 청크 | ~60분/파일 |
| App 태그 (실측) | 내부 probe 앱 | — | — |
Groq(그록) ≠ Grok(그록). Groq는 LPU STT 회사, Grok은 xAI 텍스트 LLM이다.
---
10.2. 공식 요율 → 분당·2시간 환산 (1550원)
| 제공자 | 모델 | 공식 요율 | 분당 USD | 2시간 USD | 2시간 KRW |
|---|---|---|---|---|---|
| DeepInfra | whisper-large-v3 | $0.00045/분 | 0.00045 | 0.054 | ~84원 |
| Groq | whisper-large-v3-turbo | $0.04/시간 | 0.000667 | 0.08 | ~124원 |
| OpenRouter | whisper-large-v3 (Together) | $0.0015/분 | 0.0015 | 0.18 | ~280원 |
| Groq | whisper-large-v3 | $0.111/시간 | 0.00185 | 0.222 | ~344원 |
| WaveSpeed | openai-whisper (표준) | $0.001/초 | 0.06 | 7.20 | ~11,160원 |
| WaveSpeed | + enable_timestamps | $0.002/초 | 0.12 | 14.40 | ~22,320원 |
Groq는 최소 10초 과금 — 10초 미만 청크도 10초분 청구된다.
가격 순 (2시간·TS 필요 시): DeepInfra (~84원) < Groq turbo (~124원) < OpenRouter (~280원, TS 없음) < Groq v3 (~344원) ≪ WaveSpeed (수천~만원+).
---
10.3. OpenRouter Activity 실측 — 하루 로그 패턴 (2026-06-20)
min-inter 전용 API 키 · App 내부 probe 앱 · Model Whisper Large V3 · Provider Together.
| 패턴 | Cost (USD) | 해석 |
|---|---|---|
| $0.0015 × 다수 | 60초(1분) 청크 1회 | 카드 $0.0015/분과 1:1 |
| $0.00133 ~ $0.00155 | 53~62초 구간 | 분 과금 반올림 |
| $0.000187 ~ $0.00154 | 짧은 probe 6건 | 합계 $0.005097 ≈ 7.9원 |
| $0.021 | ~14분급 단일 호출 | 롱폼 일부 구간 |
| $0.0075 | ~5분급 | 중간 청크 |
| $0.0002 ~ $0.0003 | ~8~12초 | 짧은 테스트 |
0 tok 표시는 정상 — Whisper는 토큰이 아니라 오디오 길이(분) 과금이다.
29분 롱폼을 60초 청크로 쪼개면 약 29회 × $0.0015 ≈ $0.044(약 68원) + α — Groq v3 29분 실측 ~$0.05와 비슷하지만, OpenRouter는 타임스탬프 없어 자막 정본 불가.
---
10.4. Groq 공식 — v3 vs turbo
Groq Speech to Text (2026-06 문서):
| 모델 | Cost/hour | WER | 번역 | TS |
|---|---|---|---|---|
| whisper-large-v3 | $0.111 | 10.3% | ✅ | verbose_json segment·word |
| whisper-large-v3-turbo | $0.04 | 12% | ❌ | verbose_json segment·word |
29분 롱폼 실측 (v3): 10분 FLAC 3청크 · ~630 segment · ~$0.05(약 78원) — min-inter 자막(SRT·SBV) 정본.
2시간 v3: $0.111 × 2 = $0.222 ≈ 344원 (이전 표의 「~54원」은 DeepInfra 2h 달러액 $0.054를 잘못 붙인 오류).
---
10.5. WaveSpeed 공식 — 초당 과금
WaveSpeed openai-whisper (2026-06 UI):
| 모드 | 단가 | 60초 | 10분 | 29분 | 2시간 |
|---|---|---|---|---|---|
| 표준 | $0.001/s | $0.06 | $0.60 | ~$1.74 | ~$7.20 |
| enable_timestamps | $0.002/s | $0.12 | $1.20 | ~$3.48 | ~$14.40 |
플레이그라운드 짧은 샘플 1회 ~$0.0087 (약 8~9초 분량) — ~114회/$1 표기와 일치.
Groq v3 29분 ~$0.05 대비 WaveSpeed 표준 ~$1.74 = 약 35배, word TS ~$3.48 = 약 70배.
WaveSpeed 강점: 한 파일 ~60분, word TS, 업로드 URL·비동기 poll. 단 롱폼 기본값은 Groq/DeepInfra.
---
10.6. 언제 무엇을 쓰나 (2026-06-20 정리)
| 목적 | 1순위 | 이유 |
|---|---|---|
| GPU 없음 + TS + 최저가 | DeepInfra | ~0.7원/분 · segments·words |
| 롱폼 자막 + segment TS (검증됨) | Groq v3 | verbose_json · 29분 ~78원 실측 |
| 저가 + TS + 속도 | Groq turbo | $0.04/h · WER 12% |
| 짧은 클립 문구만 grep | OpenRouter | 15분 미만 · TS 없음 |
| ~~word TS + 60분 통짜~~ | 비권장(탈락) | WaveSpeed 만원대/2h — DeepInfra word·Groq로 대체 |
| 정밀 forced alignment | OR txt + WhisperX CPU | GPU 불필요 · 느림 |
11. OpenRouter Activity 실측 — 분당 약 2.3원 (2026-06-20)
min-inter OpenRouter Activity에서 Whisper Large V3 · Provider Together 호출을 확인했다. Whisper는 토큰 과금이 아니라 오디오 길이(분) 기준이라 Usage에 0 tok으로 보이지만 Credits(USD)는 정상이다.
11.1. 샘플 6건 합산 (로그 발췌)
| Cost (USD) | 추정 길이 |
|---|---|
| $0.000187 | ~7초 |
| $0.000374 ~ $0.000675 | ~15~45초 |
| $0.000961 ~ $0.00154 | ~40초~1분 |
| 합계 $0.005097 | 6회 |
1 USD = 1,550원 기준이면 6건 합계 약 7.9원, 건당 평균 약 1.3원(짧은 청크 기준). 가장 비싼 1건($0.00154)은 약 2.4원 ≈ 1분 — 카드 $0.0015/분과 일치한다.
11.2. 길이별 환산 (OpenRouter v3, Together)
| 길이 | USD | 1,550원 |
|---|---|---|
| 1분 | ~$0.0015 | ~2.3원 |
| 10분 | ~$0.015 | ~23원 |
| 1시간 | ~$0.09 | ~140원 |
| 2시간 | ~$0.18 | ~280원 |
$1(1,550원) 크레딧이면 이 단가로 수백~천 건급 짧은 청크 또는 대략 10시간+ 분량까지 여유가 있다. 「2시간 약 250원」 추정과 실청구가 맞물린다.
---
12. OpenRouter에서 타임스탬프가 안 되는 이유
OpenAI Audio Transcriptions API 기준 타임스탬프 조건은 두 가지다.
responseformat=verbosejsontimestamp_granularities[]에word또는segment
2026-06-20 min-inter 실측: OpenRouter 경유(openai/whisper-large-v3, Together)는 { text, usage }만 반환. verbosejson·timestampgranularities·provider passthrough 전부 무시.
| 원인 | 설명 |
|---|---|
| 라우팅 | OpenRouter는 여러 프로바이더로 표준화 라우팅 — 전사 전용 옵션이 누락되기 쉬움 |
| 프로바이더 차이 | 같은 v3라도 Together 등 백엔드마다 TS 지원 다름 |
| gpt-4o-transcribe | OpenAI 공식도 json만 — verbose_json·TS 불가 |
OpenAI whisper-1 직접 호출은 verbose_json+TS 가능하지만 $0.006/분(약 9원) — OpenRouter v3(2.3원/분)보다 약 4배.
12.1. GPU 없을 때 타임스탬프 해결 경로
| 경로 | TS | GPU | 분당(대략) |
|---|---|---|---|
| DeepInfra v3 | ✅ segments·words | ❌ | $0.00045 (~0.7원) |
| Groq v3 | ✅ segment | ❌ | ~$0.00185 |
| Together 직접 | ✅ (옵션) | ❌ | OR와 유사 |
| OpenRouter + WhisperX align | ✅ forced align | ❌ CPU | OR + 로컬 대기 |
| OpenRouter 단독 | ❌ | ❌ | 2.3원/분 |
---
13. OpenAI 플랫폼 — TTS 화면에 Whisper가 없는 이유
OpenAI Developers Audio 탭(Realtime / Translate / Text to speech)은 TTS(텍스트→음성) 전용이다. tts-1, gpt-4o-mini-tts 등 낭독 모델만 보인다.
| 방향 | OpenAI 제품 | 콘솔 |
|---|---|---|
| STT (음성→텍스트) | whisper-1, gpt-4o-transcribe | API·문서 중심 — Speech to text 가이드 |
| TTS (텍스트→음성) | tts-1, gpt-4o-mini-tts | Audio 플레이그라운드 |
받아쓰기를 찾다 TTS 메뉴를 연 것과 같다. 이미 OpenRouter v3로 전사 중이면 OpenAI 콘솔 GUI보다 API 경로(DeepInfra/Groq/OR)가 저렴하다.
---
14. CPU WhisperX vs API — 같은 작업이면?
| OpenRouter API | CPU WhisperX (실험 위키) | |
|---|---|---|
| 2h14m 처리 | 수십 초~수 분 | 45분+ (alignment ~19분) |
| 비용 | ~280원/2h | 전기료 수원~십원 |
| 설치 | 키만 | venv·ffmpeg·cp949 함정 |
| TS 품질 | OR 단독 ❌ | forced alignment 최고 |
짧은 클립·가끔 → API(DeepInfra/OpenRouter txt)가 시간·수고 압승. 대량·민감 데이터·WhisperX급 싱크 → CPU 로컬 또는 OR txt + WhisperX align 하이브리드.
---
15. DeepInfra openai/whisper-large-v3 — GPU 없이 TS + 최저가
DeepInfra ASR — Whisper Large v3, 네이티브 segments[]·words[], 클라우드 GPU(사용자 GPU 불필요).
| 항목 | 값 |
|---|---|
| API | `POST https://api.deepinfra.com/v1/inference/openai/whisper-large-v3` |
| 인증 | DeepInfra API 키 |
| 요율 | $0.00045/분 (OpenRouter v3의 약 1/3) |
chunk_level | segment / word |
chunklengths | 1~30 (내부 분할) |
| 2시간 환산 | ~$0.054 ≈ 84원 (1,550원/USD) |
15.1. OpenRouter · Groq · DeepInfra · WaveSpeed (2026-06)
| 제공자 | 인증 | TS | 2h (1550원) | 29분 |
|---|---|---|---|---|
| DeepInfra | DeepInfra API 키 | ✅ seg·word | ~84원 | ~20원 |
| OpenRouter | OpenRouter API 키 | ❌ text | ~280원 | probe ~8원+ |
| Groq v3 | Groq API 키 | ✅ segment | ~344원 | ~78원 |
| WaveSpeed | WaveSpeed API 키 | ✅ word | ~11,160원+ | ~2,700원+ |
WhisperX wav2vec2 alignment보다 단어 정밀도는 낮을 수 있음 — 일반 자막·숏폼에는 DeepInfra/Groq로 충분. karaoke·cue 초정밀 → Groq 또는 OpenRouter+WhisperX hybrid.
---
16. OpenRouter + WhisperX 하이브리드 (요약)
OpenRouter text만 + WhisperX alignment CPU → GPU 없이 정밀 SRT. 비용은 OR 분당 2.3원 + 로컬 46분급 대기.
openrouter-whisperx-hybrid.mjs — 산출 {stem}-orx.srt. DeepInfra가 TS+가격 모두 나은 경우가 많아 하이브리드는 정밀 싱크가 꼭 필요할 때 우선 검토.
---
17. GPU 없을 때 — 크리에이터 선택표 (2026-06-20 개정)
min-inter 롱폼 자막 정본: DeepInfra(최저가·segments·words) 또는 Groq v3(verbose_json·29분 실측 검증). OpenRouter는 텍스트 전사·probe·grep에 두고, 타임스탬프가 필요하면 DeepInfra·Groq·WhisperX 중 하나를 고른다. WaveSpeed는 초당 과금이 커 기본 후보에서 제외(탈락) 했다.
17.1. API 우선순위 — GPU 없을 때
| 순위 | 제공자 | 쓰는 때 | TS | 2h (1,550원/USD) |
|---|---|---|---|---|
| 1 | DeepInfra v3 | 자막·배치·최저가 + TS | ✅ seg·word | ~84원 |
| 2 | Groq v3 | 롱폼 자막 검증 정본 | ✅ segment·word | ~344원 |
| 3 | Groq turbo | 속도·저가·WER 여유 | ✅ segment | ~124원 |
| 4 | OpenRouter v3 | 텍스트만·짧은 grep·Activity | ❌ text | ~280원 |
| — | ~~WaveSpeed~~ | word TS·60분 통짜 — 비용 과다 | ✅ word | ~11,160원+ |
Groq(그록) ≠ Grok(그록). Groq는 LPU STT, Grok은 xAI 텍스트 LLM이다.
17.2. 상황별 추천
| 상황 | 추천 | 이유 |
|---|---|---|
| 당일 GUI·설치 싫음 | Vrew | 실험 위키 — 당일 SRT, IT 용어는 교정 부담 |
| GPU 없음 + TS + 최저가 | DeepInfra v3 | segments·words · 2h ~84원 · 사용자 GPU 불필요 |
| 롱폼 자막(29분+) 실측 | Groq v3 verbose_json | min-inter SRT·SBV 정본 · 29분 ~78원 실측 |
| 저가 + TS + 속도 | Groq turbo | ~124원/2h · WER 12% |
| 텍스트만·probe·5분 grep | OpenRouter v3 | TS 없음 · 분당 ~2.3원 · Activity로 실청구 확인 |
| OR만 있고 TS가 꼭 필요 | OpenRouter txt + WhisperX align | CPU 46분급 대기 · GPU 불필요 |
| 한국어 CER 최우선 | 리턴제로 sommers · Clova | OpenRouter Transcription 밖 |
| IT·영문 혼용 | GPT-4o Transcribe / WhisperX | LLM 전사 또는 로컬 grep |
| 로컬 GPU·Colab 있음 | faster-whisper / WhisperX CLI | API 비용 대신 전기료 · 대량·민감 데이터 |
| 정밀 karaoke·cue | WhisperX alignment | API segment만으로는 한계 |
| ~~WaveSpeed~~ | 비권장(탈락) | Groq v3 29분 대비 30~70배 · 롱폼 기본값 아님 |
---
18. OpenRouter — 텍스트 전사 + 다른 API 조합
OpenRouter는 Transcription 라우터이자 LLM 허브다. 2026-06 min-inter 실측: Whisper Large v3(Together)는 { text, usage }만 — verbosejson·timestampgranularities 무시.
| 단계 | API | 산출 |
|---|---|---|
| 1 | OpenRouter Whisper v3 | txt만 (저렴·빠름·probe) |
| 2a | 같은 키로 Qwen·GPT 등 | 요약·교정·번역 (Transcription 밖) |
| 2b | DeepInfra / Groq | segment·word TS → SRT |
| 2c | CPU WhisperX --no_transcribe | forced alignment SRT |
자막 실무 권장: SRT가 목표면 처음부터 DeepInfra 또는 Groq로 뽑는다. OpenRouter는 5분 샘플 grep·비용 실험용. TS가 필요한데 OpenRouter만 쓰면 가짜 타임코드·청크 drift로 실패하기 쉽다 — 실험 위키의 Groq 정본 사례 참고.
WhisperX 하이브리드: OpenRouter txt + alignment는 정밀 싱크가 꼭 필요할 때만. DeepInfra가 가격·TS를 동시에 주는 경우가 많아 하이브리드는 2순위다.
---
19. STT 서비스·앱 설계
19.1. API 연동 체크리스트
| # | 항목 | 이유 |
|---|---|---|
| 1 | 25MB·25분 | ffmpeg chunk·오프셋·병합 — Groq 10분 FLAC 등 프로바이더별 상이 |
| 2 | 과금 단위 | 분(DeepInfra·OR) vs 시간(Groq) vs 초(WaveSpeed) — 견적 스크립트 분리 |
| 3 | TS 필요 여부 먼저 | TS 있으면 DeepInfra/Groq · txt만이면 OpenRouter |
| 4 | UI 모델 ID = 프로덕션 허용 목록 | Transcription 태그만 — 채팅 모델과 혼동 금지 |
| 5 | word vs segment | 자막 앱은 segment 최소 · karaoke는 word |
| 6 | ZDR·학습 정책 | OpenRouter ZDR · 업체별 보존 |
| 7 | chunk 실패 overlap 재시도 | rate limit·25MB 초과 |
19.2. 2시간 파이프라인 (2026-06 권장)
- ffmpeg — mono 16kHz, 용량 축소(mp3/flac)
- TS 필요: DeepInfra 통짜 또는 Groq 10분 FLAC chunk +
verbose_json - txt만: OpenRouter 60초~15분 chunk (TS 기대 금지)
- chunk별 API 병렬(rate limit) → 오프셋 가산 → overlap dedupe
- (선택) WhisperX alignment only — OpenRouter txt·DeepInfra coarse TS 정밀화
- Vrew·영상 편집 자동화로 컷·숏폼
WaveSpeed는 이 파이프라인 기본값에 넣지 않는다 — 초당 $0.001~0.002는 2시간에 만원대다.
---
20. 오픈소스·로컬과 API 조합
| 계층 | GPU 없음 | 로컬 GPU·Colab 있음 |
|---|---|---|
| 전사 + TS | DeepInfra · Groq v3/turbo | faster-whisper large-v3 |
| 텍스트만 | OpenRouter v3 | faster-whisper (배치) |
| 타임코드 정밀화 | WhisperX alignment (CPU) | WhisperX full 또는 align only |
| GUI | Vrew | Vrew |
| 자동화 | 로컬 전사 스크립트 + ffmpeg | WhisperX CLI · CI |
하이브리드 예 (GPU 없음): OpenRouter txt → WhisperX alignment → SRT. 더 나은 예: DeepInfra/Groq로 처음부터 SRT → grep 교정 → 편집 파이프라인.
하이브리드 예 (GPU 있음): faster-whisper 초벌 → WhisperX align → IT 용어 grep — 실험 위키 CPU 46분·GPU Colab 사례.
---
21. 상황별 최종 선택 (2026-06-20)
| 목적 | 1순위 | 2순위 |
|---|---|---|
| 2h 최저가 + TS | DeepInfra v3 | Groq turbo |
| 롱폼 자막 SRT (검증) | Groq v3 verbose_json | DeepInfra |
| 2h txt만·probe | OpenRouter v3 Turbo/UI | OpenRouter v3 |
| 한국어 CER | 리턴제로 sommers | Clova · Qwen ASR(샘플 검증) |
| IT·영문 키워드 | GPT-4o Transcribe / WhisperX | Groq v3 + grep |
| 자막 싱크 최고 | WhisperX (로컬) | DeepInfra word · Groq segment |
| 영어 실시간 | Deepgram Nova-3 | Parakeet (한국어 X) |
| 전사+요약 | Gemini 3 Flash (LLM) | OpenRouter txt + LLM 2단계 |
| 대량·민감·오프라인 | 로컬 GPU WhisperX | CPU WhisperX |
| ~~WaveSpeed~~ | 사용 안 함 | Groq·DeepInfra로 대체 |
---
22. 벤치마크 외 STT 평가 축
| 축 | 설명 |
|---|---|
| 정확도 | WER/CER + 본인 도메인 5분 샘플 |
| 타임스탬프 | segment vs word · OpenRouter 단독 ❌ |
| 비용 | 분·시간·초 단위 혼동 금지 — 2h 표로 통일 |
| 속도(RTF) | Groq LPU · DeepInfra · 로컬 GPU |
| 언어·방언 | Parakeet 한국어 X · Qwen·Chirp 확인 |
| 화자 분리 | WhisperX pyannote vs API 부가 |
| 구두점·숫자 | 업체별 편차 — grep 교정 |
| 커스텀 어휘 | Qwen context text · Vrew 수동 |
| 데이터·규정 | ZDR · 국내 개인정보 · 로컬 GPU |
23. 실전 — 5분 샘플 grep
- 5~10분 mp3 추출
- 후보 2~3개 동일 파일
- Next.js·GitHub·Vercel grep — 실험 위키
- 2h 견적 = 5분 비용 × 24 × 1.1
24. 관련 문서
| 글 | 관점 | |
|---|---|---|
| [유튜브 자막 뽑는 방법 | CPU·GPU·Vrew 실험](/wiki/korean-stt-gpu-colab-whisperx-vrew-2026/) | 어떻게 뽑았는가 — WhisperX CPU 46분 실측·Vrew grep·Windows 함정 (이 글은 모델·API·과금 지도) |
| [영상 편집 자동화 | Vrew·Whisper·FFmpeg·Remotion](/wiki/video-editing-automation-whisper-ffmpeg-remotion/) | SRT 이후 컷·숏폼·Remotion 파이프라인 |
25. 마무리
앞에서 다룬 STT 모델·API·벤치의 핵심만 짧게 정리한다.
- 실험 위키 = 실행·실측 · 이 글 = 모델·과금·선택.
- OpenRouter 카드 WER ≠ AA-WER — 출처를 섞지 않는다.
- 한국어 CER 표는 Nova-2·Gemini 2.0 등 구세대 — Nova-3·Gemini 3에 그대로 대입 금지.
- 원본 출시(2022 Whisper 등) ≠ OR Transcription 등록(2026) — 연혁 표 참고.
- UI Transcription 요율은 2026-06 카드 기준 — 연동 전 모델 ID 재대조.
- 3종 요율: DeepInfra ~84원/2h · Groq v3 ~344원/2h · OpenRouter ~280원(TS❌) · WaveSpeed ~11,160원/2h — 과금 단위(분·시간·초)가 다름.
- Groq ~54원 오류 정정: $0.054는 DeepInfra 2h — Groq v3 2h는 ~344원.
- DeepInfra: 분당 ~0.7원, segments·words TS — OpenRouter TS 불가 우회·GPU 불필요.
- OpenRouter Activity 실측: 6건 ~8원, 2h ~280원 추정과 일치 — 0 tok은 정상(분 과금).
- OpenAI 콘솔 Audio = TTS — Whisper STT는 API 문서 경로.
- 2026-06-20 실측: OpenRouter Whisper = text만 · Groq = segment TS · WaveSpeed = word TS 옵션·초당 과금 비쌈.
- 롱폼 자막 싱크는 Groq verbose_json — OpenRouter 60초 청크 + 가짜 TS는 실패.
- Groq ≠ Grok. 자막 싱크는 WhisperX alignment 하이브리드.
- Voxtral Small $0.0001/초(2h ~$0.72)는 API 필드 기준 — Activity로 실청구 확인.
「UI에서 모델 ID를 확인하고, 5분 grep으로 고른 뒤, 자막이면 WhisperX alignment까지 연결한다.」 — GPU 실측은 실험 위키, 엔진·API 지도는 이 글.
자주 묻는 질문
- OpenRouter 카드 WER 10.3%와 Artificial Analysis 4.1%는 왜 다른가?
측정 코퍼스·연도·영어/다국어 혼합 기준이 다르다. OpenRouter 카드 WER은 제품 스펙 요약, AA-WER는 2026년 통일 벤치로 리더보드 비교용이다. 같은 Whisper v3라도 숫자를 한 표에 직접 대입하지 말고 출처를 구분한다.
- 한국어 CER 표에 Nova-3나 Gemini 3가 없는 이유는?
표는 리턴제로 벤치의 Nova-2·Gemini 2.0·Whisper 등 구세대 기준이다. Nova-3·Gemini 3.x 한국어 CER은 공개 벤치가 제한적이므로 본문 순위를 그대로 대입하지 않고, 5~10분 샘플 grep으로 보완한다.
- Whisper는 언제 나왔고 OpenRouter에는 언제 올라왔나?
오픈소스 Whisper는 2022년 9월, large-v3는 2023년 11월, Turbo는 2024년 10월 출시다. OpenRouter Transcription 카드 등록은 whisper-1·GPT-4o Transcribe 2026-04-28, large-v3·Turbo 2026-05-01 등으로 UI에 표시된다. OR 등록일 ≠ 모델 최초 출시일이다.
- OpenRouter API /api/v1/models와 UI Transcription 목록이 다른데 어느 쪽을 믿나?
연동·견적의 정본은 OpenRouter 웹 UI Transcription 탭과 Activity 청구다. 2026-06-20에 공개 API를 조회하면 pricing.audio가 있는 mistralai/voxtral-small-24b-2507 등 일부만 보일 수 있다. 프로덕션 허용 모델 ID는 UI에서 재확인한다.
- Voxtral Small 2시간 $0.72와 Artificial Analysis $4/1000분이 맞지 않는 이유는?
OpenRouter API의 audio 필드는 $0.0001/초(7200초≈$0.72)다. AA의 $4/1000분은 다른 벤치 산식·경로일 수 있다. Voxtral Small은 멀티모달(텍스트+오디오) 과금이 섞일 수 있어 소액 테스트·Activity로 실청구를 확인한다.
- Parakeet·Qwen3 ASR·Chirp 3를 한국어 2시간 강의에 써도 되나?
Parakeet TDT 0.6B v3는 OpenRouter 카드 기준 EU 25개어 중심으로 한·중·일 미지원이다. Qwen3 ASR Flash는 11개어(한국어 포함)로 UI에 표시되나 IT grep은 샘플 검증이 필요하다. Chirp 3는 Google STT 계열로 언어·preview 정책을 카드에서 확인한다.
- 이 글과 CPU·GPU·Vrew 실험 위키의 차이는?
실험 위키는 WhisperX 46분 실측·Vrew grep·Windows 함정 등 실행 기록이다. 이 글은 OpenRouter·CER/WER·출시 연혁·API 선택·서비스 설계다. 같은 주제지만 관점이 다르므로 섞어 읽지 않는다.
- 2시간 한국어 전사 OpenRouter UI 기준 최저가는?
2026-06 OpenRouter Transcription 카드 기준 Whisper Large V3 Turbo $0.04/시간으로 약 $0.08(110원)이다. 정확도를 올리면 Whisper Large V3 $0.0015/분(약 $0.18)이 카드 WER ~10.3%로 Turbo보다 유리하다. 연동 전 UI 요율을 재확인한다.
- Groq와 Grok은 같은가?
다르다. Groq는 Whisper Turbo 등 STT를 제공하는 LPU 추론 프로바이더이고, Grok은 xAI의 텍스트 LLM으로 음성 전사 모델이 아니다.
- STT API만으로 WhisperX 수준 SRT를 얻을 수 있나?
Whisper v3 API word timestamp가 있어도 WhisperX wav2vec2 forced alignment만큼 cue 단위로 안정적이지 않은 경우가 많다. API로 txt를 뽑고 WhisperX alignment만 돌리는 하이브리드가 자막 실무에 안전하다.
- CER과 WER 중 한국어에는 어느 쪽을 보나?
한국어·CJK는 CER(글자 오류율)이 공정하다. WER은 조사·띄어쓰기 때문에 한 글자 오류도 어절 전체 오답으로 잡히기 쉽다. 글로벌 영어 AA-WER 순위와 한국어 CER 표는 순위가 다를 수 있다.
- STT 서비스를 만들 때 OpenRouter에서 무엇을 먼저 확인하나?
Transcription 태그·모델 ID·분/초/토큰 요율, 25MB/25분 제한, 한국어 지원, ZDR, rate limit이다. UI 목록과 공개 API 불일치 가능성을 전제하고, 2시간 파일은 chunk·오프셋 파이프라인을 먼저 구현한 뒤 5분 샘플로 모델을 고른다.
- OpenRouter Whisper Large v3로 자막 타임스탬프를 받을 수 있나?
2026-06-20 min-inter 실측 기준 OpenRouter 경유(Together 프로바이더) 응답은 text와 usage만 반환했다. verbosejson, timestampgranularities, provider passthrough probe 모두 세그먼트·단어 타임코드를 주지 않았다. 짧은 클립 문구 검증만 가능하고 SRT·SBV 정본에는 부적합하다.
- 29분 한국어 강의 자막 싱크에는 어떤 API를 썼나?
Groq whisper-large-v3에 verbose_json과 segment 타임스탬프를 요청했다. 25MB 한도로 10분 FLAC 3청크로 나눴고 약 630 segment, 비용 약 0.05달러였다. OpenRouter 60초 청크와 가짜 타임코드 방식은 싱크가 맞지 않아 중단했다.
- WaveSpeed openai-whisper는 Groq보다 얼마나 비싼가?
WaveSpeed는 초당 0.001달러(시간당 3.6달러), 타임스탬프 켜면 0.002초(시간당 7.2달러)다. Groq v3는 시간당 0.111달러라 29분 기준 Groq 약 0.05달러 대비 WaveSpeed는 타임스탬프 없이도 약 1.73달러, word TS면 약 3.47달러로 30배 이상 비싸다. 60분 한 파일·word TS가 꼭 필요할 때만 검토한다.
- OpenRouter·Groq·WaveSpeed·DeepInfra API 키는 어떻게 다르나?
세 키는 서로 다른 게이트웨이다. OpenRouter는 짧은 구간 text 전사·probe, Groq는 롱폼 segment 타임스탬프 자막 정본, WaveSpeed는 enable_timestamps word 옵션과 60분 파일·비동기 poll용이다. 로컬 비밀 저장소에만 두고 로그에 출력하지 않는다.
- OpenRouter Activity에서 Together가 보이는 이유는?
OpenRouter는 동일 whisper-large-v3 모델도 라우팅 프로바이더가 다를 수 있다. 2026-06-20 min-inter 호출은 Activity에 Provider Together로 기록됐다. 모델 ID는 openai/whisper-large-v3이며 요율은 분당 0.0015달러 패턴이었다.
- Groq 전사 후 SBV를 통째로 바꿔도 되나?
권장하지 않는다. Vrew - NEXT - 구간 마커와 기존 편집 정책을 유지하고 IT 용어 보정과 짧은 큐 분할(refine-groq-captions, 큐당 최대 36자)만 적용한다. 통째 교체 시 20초짜리 한 줄 자막이 늘어나 숏폼 가독성이 떨어졌다.
- OpenRouter Whisper로 타임스탬프를 받을 수 없는 이유는?
OpenAI 공식은 verbosejson과 timestampgranularities가 필요하지만, 2026-06-20 min-inter 실측에서 OpenRouter 경유(Together)는 text와 usage만 반환했다. 라우팅·프로바이더가 전사 옵션을 누락하기 쉽다. GPU 없이 TS가 필요하면 DeepInfra segments/words, Groq verbose_json, 또는 OpenRouter txt+WhisperX alignment를 쓴다.
- DeepInfra Whisper v3는 OpenRouter보다 얼마나 싼가?
DeepInfra는 분당 0.00045달러(1550원 환율 약 0.7원/분), OpenRouter v3는 분당 0.0015달러(약 2.3원/분)다. 2시간 기준 DeepInfra 약 84원, OpenRouter 약 280원. DeepInfra는 segments와 words 타임스탬프를 JSON으로 주며 DeepInfra API 키로 호출한다.
- OpenRouter Activity 6건 0.005달러는 한국 돈으로 얼마인가?
1달러 1550원 기준이면 0.005097달러는 약 7.9원이다. 건당 평균 약 1.3원이며 가장 비싼 1건(약 2.4원)은 1분 내외 오디오와 카드 0.0015달러/분과 일치한다. 0 tok 표시는 Whisper가 분 단위 과금이라 정상이다.
- OpenAI 플랫폼 Audio 탭에 Whisper가 없는 이유는?
해당 화면은 Text to speech(TTS, 텍스트를 읽어주기) 전용이다. Whisper와 gpt-4o-transcribe는 Speech to text(STT)로 API 문서와 /audio/transcriptions 엔드포인트에서 호출한다. TTS와 STT는 입출력 방향이 반대라 메뉴가 분리된다.
- 1550원 크레딧으로 Whisper v3 전사를 얼마나 돌릴 수 있나?
OpenRouter v3(2.3원/분) 기준 1550원은 약 670분(11시간+)이다. DeepInfra(0.7원/분)면 약 2200분(37시간+)이다. 짧은 1분 클립은 건당 2원 내외, 2시간 롱폼은 OpenRouter 약 280원·DeepInfra 약 84원 수준이다.
- CPU WhisperX 대신 API만 쓰면 손해인가?
비용만 보면 API(DeepInfra/OpenRouter)와 CPU 전기료는 둘 다 거의 무료에 가깝다. 차이는 시간과 수고다. 2시간+14분을 CPU WhisperX로 돌리면 실측 45분+alignment 19분이 걸리지만 API는 수분 이내다. 짧은 작업·가끔 전사는 API, WhisperX급 forced alignment가 꼭 필요할 때만 CPU 하이브리드가 낫다.
- OpenRouter·Groq·WaveSpeed Whisper v3 비용 차이는?
과금 단위가 다르다. OpenRouter는 분당 0.0015달러(2시간 약 280원, TS 없음). Groq v3는 시간당 0.111달러(2시간 약 344원, segment TS). Groq turbo는 시간당 0.04달러(2시간 약 124원). WaveSpeed는 초당 0.001달러(2시간 약 7.2달러=11160원), 타임스탬프 켜면 2배. DeepInfra는 분당 0.00045달러(2시간 약 84원, seg·word TS).
- Groq v3 2시간 전사는 54원인가 344원인가?
344원이 맞다. Groq v3는 시간당 0.111달러라 2시간이 0.222달러, 1550원 환율로 약 344원이다. 54원(0.054달러)은 DeepInfra 2시간 비용이며 이전 표에 Groq와 혼동되어 잘못 기재된 적이 있다.
- OpenRouter Activity에서 0.0015달러가 반복되는 이유는?
Whisper Large v3 Together 라우팅의 분당 0.0015달러 요율이다. 60초 청크 1회당 0.0015달러가 찍힌다. 0 tok은 Whisper가 토큰 과금이 아니라 오디오 길이 과금이라 정상이다. 타임스탬프는 반환되지 않는다.
- WaveSpeed openai-whisper 67초 테스트 0.0087달러는 정상인가?
정상이다. WaveSpeed는 초당 0.001달러(표준)라 약 8~9초 샘플이 0.0087달러 수준이다. 67초면 약 0.067달러, 29분이면 약 1.74달러, Groq v3 29분 약 0.05달러보다 30배 이상 비싸다.
- Groq turbo와 v3 중 어느 쪽이 싼가?
turbo가 약 2.8배 싸다. turbo는 시간당 0.04달러(2시간 약 124원), v3는 0.111달러(2시간 약 344원). turbo WER 12%로 v3 10.3%보다 낮지만 한국어 IT 강의 자막은 v3+verbose_json segment가 min-inter 롱폼 정본으로 검증됐다.
- GPU 없을 때 자막 SRT는 어디부터 고르나?
DeepInfra whisper-large-v3가 2시간 약 84원에 segments·words 타임스탬프를 준다. 롱폼 검증 정본은 Groq v3 verbose_json(2시간 약 344원, 29분 실측 약 78원). OpenRouter는 텍스트만 나와 자막 정본으로 쓰지 않는다.
- OpenRouter로 전사한 뒤 타임스탬프는 어떻게 맞추나?
OpenRouter Whisper는 text만 반환한다. 타임스탬프가 필요하면 DeepInfra·Groq로 다시 전사하거나, OpenRouter txt에 WhisperX forced alignment를 얹는 하이브리드를 쓴다. 자막이 목표면 처음부터 DeepInfra·Groq가 낫다.
- WaveSpeed Whisper는 왜 추천하지 않나?
초당 0.001~0.002달러 과금이라 2시간이 약 7~14달러(만원대)다. Groq v3 29분 약 0.05달러 대비 30~70배 비싸 min-inter 기본 파이프라인에서 탈락시켰다. word TS·60분 통짜가 꼭 필요할 때만 예외 검토한다.
- 로컬 GPU가 있으면 API 대신 무엇을 쓰나?
faster-whisper나 WhisperX CLI로 대량·민감 데이터를 API 비용 없이 처리한다. 정밀 자막은 WhisperX alignment가 최고다. GPU가 없으면 DeepInfra·Groq API가 시간 대비 비용이 낫고, CPU WhisperX는 2시간에 45분+ 걸릴 수 있다.
크리에이터 팁