DeepSeek-v4-flash-vision-exp 비전 API

4 hours ago 2

텍스트와 이미지를 함께 처리해 사진 설명, 스크린샷 문자 판독, 차트 분석 등을 수행하는 비전 모델임 OpenAI 호환 Chat Completions에서 Base64 데이터 URL, 외부 URL, Files API file_id 로 이미지를 전달하며 Responses API와 Anthropic 호환 API도 지원함 JPEG·PNG·GIF·WebP를 실제 파일 내용으로 판별하고, 이미지당 최대 384 토큰을 텍스트 토큰과 함께 과금함 요청 본문은 48 MiB, 일반 단일 이미지는 32 MiB, file_id 이미지는 64 MiB까지이며 요청당 최대 600개 이미지, 전체 최대 200 MiB를 허용함 이미지는 허용된 메시지 위치에서 비전 모델에만 전달할 수 있으며, 지원하지 않는 모델이나 system·assistant 메시지에 넣으면 400 오류가 발생함 모델과 지원 형식 deepseek-v4-flash-vision-exp는 이미지와 텍스트를 함께 처리해 사진 설명, 스크린샷 문자 판독, 차트 분석 등을 수행함 JPEG, PNG, GIF, WebP를 지원하며 파일명이나 선언된 MIME 타입이 아닌 실제 파일 내용으로 형식을 감지함 예제의 API base_url은 https://api.deepseek.com임 세 가지 이미지 입력 방식 OpenAI 호환 Chat Completions에서는 content를 문자열 대신 블록 배열로 구성해 이미지를 전달함 Responses API도 같은 세 가지 방식을 input_image 콘텐츠 부분으로 지원함 Base64 인라인 이미지 로컬 파일을 Base64로 인코딩한 data: URL을 요청에 직접 삽입하는 가장 단순한 방식임 인코딩된 데이터도 48 MiB 요청 본문 제한에 포함됨 image_url.url에 data:image/jpeg;base64,... 형태로 지정함 외부 이미지 URL 공개적으로 접근 가능한 HTTP(S) URL을 전달하면 모델이 이미지를 내려받음 URL은 최대 8,192자, 이미지 파일은 최대 32 MiB이며 다운로드가 60초 안에 완료돼야 함 URL이 더 길면 Base64 데이터 URL이나 Files API를 사용해야 함 Files API 파일 참조 이미지를 Files API에 한 번 업로드한 뒤 file-api-... 형태의 file_id 를 file 콘텐츠 블록에 지정함 같은 이미지를 여러 요청에서 재사용하거나 인라인 이미지 때문에 요청 본문이 48 M...

Read Entire Article