DeepSeek, 멀티모달 'DeepSeek-V4-Flash-Vision-Exp' API 공개
V4 Flash 기반 시각 인식 모델. 저렴한 비용으로 Claude Opus 4.8 수준의 성능을 목표함.
요약
DeepSeek가 멀티모달 기능을 갖춘 새로운 모델인 'DeepSeek V4 Flash Vision'을 출시했다. 이 모델은 기존 V4 Flash와 동일한 텍스트 처리, 추론, 에이전트 및 세계 지식 능력을 유지하면서 이미지 인식, 차트 분석, 문서 시각화 처리 등 시각적 이해 능력을 추가했다. 멀티모달 에이전트 벤치마크 테스트 결과, Anthropic의 최상위 모델인 Claude Opus 4.8에 근접한 성능을 보이고 있다. 이미지 처리는 최대 384토큰을 소비하며 매우 저렴한 V4 Flash 가격 정책이 적용된다. 또한 새롭게 도입된 Files API를 통해 파일을 무료로 업로드하고 반복 재사용할 수 있어 효율적인 워크플로우 구축이 가능하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @VaibhavSisinty: DeepSeek can now see. And its multimodal agent performance is approaching Claude Opus 4.8. At a fraction of the cost. 🤯 DeepSeek
원문 보기 ↗