DeepSeek의 가장 저렴한 모델이 이제 볼 수 있습니다. 2026년 8월 21일, DeepSeek은 텍스트 전용 모델과 동일한 가격으로, 동일한 프로덕션 API를 통해 이미지를 수용하고 이미지당 최대 384개의 입력 토큰으로 요금이 청구되는, 비전 기능을 지원하는 V4-Flash 빌드인 deepseek-v4-flash-vision-exp를 출시했습니다. 공식 출시 노트는 이를 명확하게 설명합니다. V4-Flash와 동일한 텍스트 기능에 더해, DeepSeek은 멀티모달 에이전트 성능을 Opus 4.8에 가깝게 만든다고 말하는 이미지 이해 능력이 추가되었습니다.
이 가이드는 이 모델이 무엇인지, 이름에 붙은 "Exp"가 프로덕션 사용에 무엇을 의미하는지, 이미지를 전송하는 세 가지 방법, 주의해야 할 제한 사항, 그리고 멀티모달 요청을 올바르게 테스트하는 방법을 다룹니다. 비전 요청은 콘텐츠 유형이 혼합되고 빠르게 용량이 커지기 때문에, 터미널에서 JSON을 수동으로 편집하는 대신 Apidog에서 구축할 가치가 있는 API 호출 유형입니다.
deepseek-v4-flash-vision-exp란 무엇인가
이 모델은 이미지 인코더가 부착된 V4-Flash-0731입니다. DeepSeek에 따르면, 이 모델은 에이전트 워크로드, 추론, 세계 지식을 포함한 텍스트 작업에서 기본 모델과 일치하므로, V4-Flash가 이미 수행했던 기능을 잃지 않고 이 모델로 대체할 수 있습니다. OpenRouter 목록에서는 총 284B개 중 13B개의 활성 매개변수를 가진 희소한 MoE(Mixture-of-Experts) 모델로 설명합니다.
중요한 배경: V4-Flash는 DeepSeek의 보급형 라인입니다. 저희는 DeepSeek V4-Flash API 가이드에서 텍스트 모델이 출시될 때 다루었으며, 경제성은 변하지 않았습니다. 플래시 가격의 비전 기능은 시장에 나와 있는 거의 모든 멀티모달 API의 가격을 낮춥니다. 이것이 DeepSeek 자체 주장의 "멀티모달 에이전트 벤치마크에서 Opus 4.8에 가깝다"는 주장이 주목을 받은 이유입니다. 공급업체의 벤치마크 주장은 주장으로 받아들이세요. 어떤 것을 이전하기 전에 자신의 문서로 직접 평가를 실행하십시오.
실험적이라는 라벨에도 불구하고, 이것은 샌드박스 장난감이 아닙니다. 이 모델은 다른 V4 모델과 동일한 속도 제한 및 SLA(서비스 수준 계약)를 가진 프로덕션 API 엔드포인트에서 실행되며, 대기 목록이나 특별 접근 요청이 필요하지 않습니다.
가격: 플래시 요율, 이미지 포함
DeepSeek의 가격 페이지에 따르면, 요금표는 텍스트 전용 deepseek-v4-flash와 동일합니다:
| 비피크 시간 | 피크 시간 | |
|---|---|---|
| 입력, 캐시 히트 (100만 토큰당) | $0.007 | $0.014 |
| 입력, 캐시 미스 (100만 토큰당) | $0.22 | $0.44 |
| 출력 (100만 토큰당) | $0.66 | $1.32 |
이미지는 각 384개 토큰까지 요금 계산을 위해 토큰화되며 입력 요율로 청구됩니다. 피크 시간 캐시 미스 요금으로 계산하면, 최대 비용 이미지 하나당 약 $0.00017입니다. 이미지 천 장은 커피 한 잔 값보다 저렴합니다.
텍스트 모델에서 두 가지 가격 책정 방식이 이어집니다. 비피크 시간 요율은 피크 시간의 절반이며, 피크 시간은 평일 UTC 01:00부터 04:00까지, 06:00부터 10:00까지이므로, 해당 시간 외에 예약된 배치 비전 작업은 절반 비용이 듭니다. 그리고 반복되는 입력에는 컨텍스트 캐싱이 적용되는데, 이는 다양한 이미지에 대해 동일한 시스템 프롬프트를 다시 보낼 때 중요합니다. 가격 페이지에는 V4 라인에 대해 1M 토큰 컨텍스트 창이 명시되어 있지만, 실제 출력은 그보다 훨씬 적게 제한됩니다.
이미지를 전송하는 세 가지 방법
이 모델은 DeepSeek의 표준 Chat Completions 엔드포인트인 https://api.deepseek.com/chat/completions를 통해 작동합니다 (V4-Flash 응답 API 출시에서 확립된 바와 같이 메시지 스타일 및 응답 스타일 호출도 지원됩니다). 이미지는 사용자 메시지의 content 배열에 포함되며, 세 가지 전송 옵션이 있습니다.
1. Base64 인라인. 이미지를 데이터 URL로 인코딩합니다. 간단하고 자체 포함되며, 이미지당 32MiB로 제한됩니다:
import base64
from openai import OpenAI
client = OpenAI(api_key="YOUR_DEEPSEEK_KEY", base_url="https://api.deepseek.com")
with open("invoice.png", "rb") as f:
b64 = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "Extract the line items and totals as JSON."},
{"type": "image_url", "image_url": {"url": f"data:image/png;base64,{b64}"}}
]
}]
)
print(response.choices[0].message.content)
2. 외부 URL. 인코딩하는 대신 공개적으로 접근 가능한 링크(최대 8,192자)를 전달합니다:
{"type": "image_url", "image_url": {"url": "https://example.com/chart.png"}}
3. 파일 API 참조. 한 번 업로드하고 ID로 재사용합니다. DeepSeek의 Files API는 이제 이미지 업로드를 무료로 허용하며, file_id 참조를 통해 동일한 이미지를 여러 요청에 걸쳐 다시 업로드하는 것을 건너뛰고, 이미지당 64MiB의 더 높은 상한이 있습니다:
{"type": "file", "file": {"file_id": "file-api-xxxxxxxxxxxxxxxx"}}
일회성 호출에는 Base64를 사용하고, 이미지가 CDN에 있는 경우에는 URL을 사용하며, 동일한 이미지를 여러 번 사용하는 모든 워크플로에는 파일 ID를 사용하십시오.
detail 매개변수
각 이미지의 선택적 detail 필드는 전처리를 제어합니다:
"low": 512x512로 다운스케일링합니다. 가장 저렴하고 빠르며, 분류 수준 질문에 적합합니다."high"/"original": 원본 치수를 유지하여, 밀집된 문서 및 작은 텍스트에 적합합니다."auto": API가 결정하도록 합니다.
내부적으로 이미지는 토큰 계산을 위해 대략 800x800으로 정규화되며, 이로 인해 이미지당 384토큰 상한이 유지됩니다. 영수증이나 대시보드에서 OCR 관련 작업을 수행하는 경우, 실제 코퍼스에서 "low"와 "high"를 테스트하십시오. 이 가격에서는 비용 차이가 작지만, 정확도 차이는 클 수 있습니다.
프로덕션 전에 알아두어야 할 제한 사항
| 제한 사항 | 값 |
|---|---|
| 요청당 최대 이미지 수 | 600 |
| 인라인(Base64) 이미지 크기 | 32 MiB |
| Files API 이미지 크기 | 64 MiB |
| 총 요청 본문 | 48 MiB |
| 이미지 치수 | 각 면당 8,192px (요청에 15개 이상의 이미지가 포함된 경우 4,096px) |
| 외부 URL 길이 | 8,192 characters |
| 이미지 배치 | user 메시지만 해당 |
마지막 행은 실제로 400 오류를 발생시킵니다. system 또는 assistant 메시지의 이미지는 거부됩니다. 다중 이미지 요청이 지원되며 텍스트와 자유롭게 섞일 수 있어, 스크린샷을 찍고, 추론하고, 행동하는 에이전트 루프에 이 모델을 사용할 수 있게 합니다. 이러한 루프를 조율한다면, DeepSeek은 같은 날 DeepSeek Harness 0.1.1에 이 모델에 대한 기본 지원을 제공했습니다. 저희 DeepSeek Harness 개요에서 해당 스택을 다룹니다. 또한, 저희 함수 호출 가이드에 설명된 텍스트 모델의 흐름과 동일하게, 툴 호출 기능이 비전 기능과 함께 작동한다는 점도 참고하십시오.
"Exp"가 당신에게 의미하는 것
이 접미사는 지불 장벽이 아닌 정직한 라벨링입니다. 이전의 실험적 DeepSeek 엔드포인트와 마찬가지로, 이 모델은 예고 없이 수정되거나 교체될 수 있습니다. 실용적인 대비책:
- 12곳에 모델 ID를 하드코딩하지 마세요.
deepseek-v4-flash-vision-exp를 하나의 설정 값 또는 환경 변수에 넣으십시오. - 텍스트 전용 대체 모델을 유지하세요. 이 모델은 텍스트에서
deepseek-v4-flash와 일치하므로, 이미지 없는 트래픽을 안정적인 ID로 라우팅하는 데 비용이 들지 않습니다. - 평가를 스냅샷으로 저장하세요. 비실험적 후속 모델이 출시되면, 공급업체의 것이 아닌 자체 작업에 대한 이전/이후 비교가 필요할 것입니다.
예제: 문서 파이프라인 비용은 얼마인가요?
숫자로 가격을 구체화해 봅시다. 한 달에 스캔한 청구서 50,000장을 처리한다고 가정해 봅시다. 각 청구서마다 이미지 하나, 200토큰의 지시 프롬프트, 그리고 호출당 약 400토큰의 JSON 출력이 있다고 가정합니다:
- 이미지 입력: 50,000 x 384 토큰 = 19.2M 토큰. 피크 시간 캐시 미스 요율($0.44/1M)로 계산하면 $8.45입니다.
- 텍스트 입력: 50,000 x 200 = 10M 토큰, 피크 시간 약 $4.40. 반복되는 지시 블록에 컨텍스트 캐싱을 적용하면, 대부분은 캐시 히트 요율($0.014/1M)로 떨어지므로 약 $0.14입니다.
- 출력: 50,000 x 400 = 20M 토큰, $1.32/1M이므로 $26.40입니다.
총계: 피크 시간 요율로 한 달에 대략 $35에서 $40이며, 배치 작업이 평일 UTC 01:00에서 10:00 시간 외에 실행되면 그 절반 정도입니다. 출력 토큰이 비용의 대부분을 차지하는데, 여기서 얻을 수 있는 유용한 교훈은 이처럼 저렴한 이미지로는 이미지 다운스케일링이 아닌 응답 형식을 더욱 엄격하게 하여 비전 파이프라인을 최적화한다는 것입니다. 산문 형식의 설명 대신 간결한 JSON을 요청하는 것이 어떤 이미지 전처리보다도 비용을 더 절감할 수 있습니다.
이러한 비용 프로필은 또한 모델이 에이전트 루프의 계산 방식을 변경하는 이유이기도 합니다. 최고급 멀티모달 모델에서 지속적으로 실행하기에는 너무 비쌌던 스크린샷-추론-행동 사이클이 프레임당 384토큰으로 실행 가능해집니다.
Apidog에서 멀티모달 요청 테스트하기
비전 요청은 수동으로 반복하기가 어렵습니다. Base64 블롭은 원시 JSON을 읽기 어렵게 만들고, detail 설정을 비교하는 것은 거의 동일한 페이로드를 조작하는 것을 의미합니다. 더 깔끔한 루프:
- 요청을 한 번 저장하세요.
{{model_id}},{{detail}}, 이미지 페이로드를 변수로 사용하여 Apidog 프로젝트에 요청을 한 번 저장합니다. 테스트 이미지나 detail 수준을 변경하는 것은 드롭다운 변경으로 가능해집니다. - 인코딩을 스크립트화하세요. 사전 요청 스크립트가 이미지를 읽고 Base64 문자열을 주입하여, 표시되는 요청 본문이 읽기 쉬운 상태를 유지합니다.
- 느낌이 아닌 구조를 단언하세요. JSON 출력(항목, 바운딩 설명, 차트 값)을 요청하는 경우, 응답을 구문 분석하고 필드를 확인하는 어설션을 추가하세요. 이는 "모델이 괜찮아 보인다"는 것을 모든 Exp-모델 수정 후 다시 실행할 수 있는 통과/실패로 바꿉니다.
- 프롬프트가 여전히 조정 중인 동안 프런트엔드용으로 응답 형태를 모의하세요. Apidog의 스마트 목업은 API 호출을 소모하지 않고 스키마를 제공합니다.
Apidog를 무료로 다운로드하면 전체 설정을 몇 분 안에 마칠 수 있으며, DeepSeek이 실험 모델을 수정할 때 다시 실행하는 것은 한 번의 클릭으로 가능합니다.
자주 묻는 질문
deepseek-v4-flash-vision-exp는 무료인가요? 아닙니다, 하지만 거의 무료에 가깝습니다. 이 모델은 텍스트 모델의 플래시 요율과 정확히 동일하게 요금이 청구되며, 이미지는 각 384개의 입력 토큰으로 제한됩니다. DeepSeek의 Files API 이미지 저장소는 무료입니다. 이미지가 요청에 포함될 때만 비용을 지불합니다.
deepseek-v4-flash를 대체하나요? 아닙니다. 텍스트 모델은 안정적인 ID로 유지됩니다. 비전 빌드는 텍스트 작업에서 텍스트 모델과 일치하므로, 실험적인 변화를 감수한다면 비전 ID로 통합할 수 있지만, 보수적인 방식은 이미지 관련 트래픽만 이 모델로 라우팅하는 것입니다.
Anthropic 스타일 API 형식으로 사용할 수 있나요? 네. DeepSeek의 V4 엔드포인트는 Chat Completions, Messages 형식, Responses 형식 호출을 모두 허용하므로, 세 가지 스타일 중 어느 하나를 사용하는 기존 클라이언트도 요청 방식을 변경하지 않고 이미지 블록을 추가할 수 있습니다. 저희 V4 Pro API 상세 가이드는 전체 제품군에서 공유되는 엔드포인트 메커니즘을 보여줍니다.
GPT 또는 Claude 비전과 가격은 어떻게 비교되나요? 384토큰 이미지와 함께 100만 입력 토큰당 $0.22에서 $0.44의 가격으로, 이는 최고급 멀티모달 요율보다 한 자릿수 낮은 수준입니다. 미해결 과제는 귀하의 워크로드에서의 정확도이며, 이는 위 평가 시나리오가 존재하는 이유입니다.
요약
DeepSeek은 동일한 전략을 계속 실행합니다. 모든 사람이 프리미엄 요금을 부과하는 기능을 플래시 가격으로 출시하고, 안정화되는 동안 정직하게 라벨을 붙이는 것입니다. deepseek-v4-flash-vision-exp는 이미지당 몇 센트의 아주 적은 비용으로 세 가지 입력 경로와 설계 가능한 실제 제한 사항을 통해 프로덕션 엔드포인트에서 이미지 이해 기능을 제공합니다. Apidog에서 요청을 한 번 만들고 어설션을 고정하면, 오늘 Exp 모델을 사용하는 것은 물론 후속 모델이 출시되는 날에도 이를 평가할 준비가 될 것입니다.
