Mistral AI가 공개한 Mistral OCR 4는 단순히 문서에서 글자만 뽑아내는 기존 OCR의 한계를 넘어, 바운딩 박스, 블록 분류, 인라인 신뢰도 점수까지 함께 반환하는 문서 이해(document understanding) 모델이다. 10개 언어 그룹의 170개 언어를 지원하고, 단일 컨테이너에서 자체 호스팅까지 가능해 데이터 주권과 컴플라이언스가 중요한 조직의 수집 파이프라인에 자연스럽게 끼워 넣을 수 있다. 사람 선호도 평가에서 평균 72% 승률을 기록했고, 공개 벤치마크 OlmOCRBench 85.20, OmniDocBench 93.07 같은 수치도 함께 확보했다.

OCR 4가 반환하는 구조화 문서 표현
OCR 4의 가장 큰 변화는 깨끗한 텍스트와 표 변환에만 머물지 않고 구조화 표현(structured representation)을 함께 제공한다는 점이다. 응답 안의 각 블록에는 바운딩 박스, 블록 유형, 페이지·단어 단위 인라인 신뢰도 점수가 포함된다. 이 덕분에 다운스트림 시스템은 문서의 내용뿐 아니라 각 요소의 위치, 역할, 신뢰 수준까지 활용해 후처리 로직을 설계할 수 있다.
- RAG용 의미 단위 청킹: 정리·분류된 블록을 검색 단위로 바로 사용
- 에이전트용 구조 프리미티브: 양식 작성, 청구서 처리, 컴플라이언스 점검 지원
- 커넥터용 구조화 콘텐츠: 수집·인덱싱 파이프라인에 일관된 타입 출력 제공
형식, 언어, 배포 방식
입력 형식은 PDF, DOC, PPT, OpenDocument 같은 일반적인 엔터프라이즈 문서를 폭넓게 커버한다. 10개 언어 그룹의 170개 언어를 지원해, 다른 시스템이 자주 무너지는 전문·저자원 언어도 평가 범위에 들어간다. 모델은 단일 컨테이너에 배포할 수 있을 만큼 작아 비용 민감형·고처리량 환경에 그대로 올릴 수 있고, 완전한 자체 호스팅 실행을 지원하므로 데이터 주권을 지키고 싶은 조직은 문서 데이터를 자체 인프라 안에 유지할 수 있다. 자체 관리형 배포 옵션은 엔터프라이즈 고객에게 제공된다.
가격과 사용 경로
개발자는 API로 모델을 통합할 수 있고, 팀은 Mistral Studio의 Document AI를 통해 같은 엔진을 노코드 애플리케이션 방식으로 활용할 수 있다. 요금은 다음 세 가지 경로로 나뉜다.
| 경로 | 가격 (1,000페이지당) | 적합한 상황 |
|------|----------------------|-------------|
| OCR 4 API | $4 | 원시 추출·바운딩 박스·신뢰도 점수만 필요한 일반 파이프라인 |
| Batch API (50% 할인) | $2 | 야간 수집·대량 인덱싱처럼 처리량과 비용이 핵심인 배치 |
| Document AI | $5 | 구조화 JSON·이미지 주석·커스텀 프롬프트가 필요한 고급 워크플로 |
OCR 4는 Mistral Search Toolkit의 수집 컴포넌트로도 통합돼 RAG와 엔터프라이즈 검색용 수집·검색·평가 워크플로에 인용 가능한 입력을 그대로 흘려보낸다.
평가 결과와 벤치마크 한계
평가는 AI 네이티브 OCR 모델, 범용 프런티어 모델, 엔터프라이즈 문서 서비스, Mistral OCR 3와의 비교로 진행됐다. 사람 선호도 평가는 12개 이상 언어의 600개 이상 문서로 구성됐고, 독립 주석자가 각 시스템의 출력을 문서별로 블라인드 비교했다. 그 결과 테스트된 모든 시스템에 대해 대부분의 문서에서 OCR 4를 더 선호했고, 평균 승률은 72%에 달한다. 공개 OlmOCRBench에서는 최고 전체 점수 85.20을, 내부 Crawl Multilingual 평가에서는 .98로 AI 네이티브·엔터프라이즈 솔루션보다 앞섰다. OmniDocBench는 93.07을 기록했다.

다만 두 벤치마크 모두 일부 채점 방식에 알려진 한계가 있다. 정답 자체에 누락·추가 텍스트, 가려진 영역의 전사, 오타가 포함되는 경우가 있고, 같은 LaTeX라도 문자열이 다르면 불일치로 계산된다. 하나의 수식을 통째로 내보내는지 여러 인라인 조각으로 나누는지에 따라 정답 매칭이 흔들리고, 다중 컬럼의 컬럼 경계에서 단어가 나뉠 때도 올바른 추출이 실패로 채점될 수 있다. 헤더·푸터를 제거한 뒤에도 페이지 제목 같은 문자열을 테스트가 잘못 플래그하는 경우도 있다. 이런 산물은 수학·과학·다중 컬럼 문서에 집중되며, 모든 경쟁사 점수는 내부 재현 결과이므로 실제 도입 전에는 자체 문서로 직접 평가하는 편이 안전하다.
다국어 성능
내부 다국어 평가에서 OCR 4는 English, Western Europe, Eastern Europe, Middle Eastern, Chinese, East Asian, Southeast Asian, Hindi 8개 언어 그룹 모두에서 앞섰다. 일본어, Georgian, Bengali, Armenian, Hebrew, Greek, Gujarati, Tamil, Malayalam, Kannada, Telugu 같은 전문·저자원 언어 격차는 가장 컸지만, 경쟁 시스템이 급격히 저하되는 영역에서도 OCR 4는 비교적 높은 정확도를 유지했다.
권장 사용 사례와 제외 범위
OCR 4는 고처리량 파이프라인과 대화형 문서 워크플로 양쪽을 모두 지원한다. 권장 사례는 다음과 같다.
- 복잡한 다국어 문서의 파싱·추출
- RAG용 구조화·분류·인용 가능 콘텐츠 생성
- Search Toolkit과 결합한 검색 파이프라인 입력
- 양식 작성, 청구서 처리, 컴플라이언스 점검 같은 에이전트 워크플로
- 신뢰도 점수를 활용한 사람 검증 기반(human-in-the-loop) 구조화 데이터 파이프라인
- 엔터프라이즈 검색과 지식 베이스용 데이터 소스 컴포넌트
초기 사용자는 OCR 4를 청구서의 구조화 필드 변환, 회사 아카이브 디지털화, 기술·과학 보고서의 깨끗한 텍스트 추출, 엔터프라이즈 검색 적용에 활용하고 있다. 반면 OCR 4는 문서 이해 모델이지 의사결정자가 아니므로 의료 진단, 법률 조언이나 판단, 고위험 금융 결정, 안전 중요 시스템, 실시간·지연 민감 처리, 원시 오디오·비디오 같은 비문서 입력에는 의도되지 않는다. 이런 영역은 별도의 도메인 모델과 사람이 함께 검증해야 한다.
OCR 4 API와 Document AI 선택 기준
OCR 4는 단일 API 엔드포인트로 제공되며 모든 요청은 같은 기본 OCR 모델을 실행한다. 기본 응답에는 추출 콘텐츠, 바운딩 박스, 블록 유형, 신뢰도 점수, Markdown 구조 텍스트가 항상 포함된다. 순수 추출 모드는 빠르고 정확한 문서 추출을 애플리케이션·에이전트·데이터 파이프라인에 직접 내장하고 싶을 때, Batch API로 처리량과 비용을 통제하고 싶을 때, 엄격한 데이터 프라이버시·주권·컴플라이언스가 필요해 자체 호스팅을 택해야 할 때 적합하다.
- Document AI 기능은 같은 엔드포인트에 추가 매개변수를 넣어 활성화한다. 문서와 함께 JSON 스키마를 전달하면 OCR 출력이
mistral-small-2603에 입력되어 지정한 명세에 맞는 구조화 JSON을 생성한다. 이미지 주석 스키마를 전달하면 감지된 이미지마다 추가 비전-언어 모델 호출로 구조화 JSON을 만들고, JSON 스키마와 함께 커스텀 프롬프트를 사용해 전체 문서의 추출 콘텐츠 해석이나 요약을 안내할 수도 있다. 이 경로는 비즈니스 사용자·솔루션 팀·파일럿 프로젝트가 별도 후처리 파싱 로직 없이 구조화 결과를 만들 수 있다는 강점이 있다. 정리하면 원시 추출 콘텐츠가 필요하면 OCR 4를 그대로 쓰고, 구조화 형식 재가공·도메인 필드 주석·커스텀 지시 처리가 필요하면 Document AI 매개변수를 추가*하면 된다.
제공 채널과 시작 방법
Mistral OCRv4와 OCRv4 기반 Document AI는 API, Mistral Studio, Amazon SageMaker, Microsoft Foundry에서 사용할 수 있다. Snowflake Parse Document 지원은 곧 제공될 예정이고, 민감한 정보를 자체 인프라 안에 유지해야 하는 조직을 위해 자체 호스팅 옵션도 함께 제공된다. 시작을 위한 리소스도 공개돼 있다.
| 리소스 | 용도 |
|--------|------|
| Getting Started with OCR 4 Cookbook | 첫 추출, 바운딩 박스 작업, 블록 분류 실습 |
| OCR4 in Production webinar | 7월 7일 오후 6시 CET 데모와 Q&A |
| Contact Sales | 엔터프라이즈 도입·자체 호스팅·추가 옵션 문의 |
정리
Mistral OCR 4는 단순한 텍스트 추출을 넘어 위치·유형·신뢰도 메타데이터를 함께 돌려주는 문서 이해 모델로 포지셔닝된다. 170개 언어, 단일 컨테이너 자체 호스팅, 72% 사람 선호도, 1,000페이지당 $4의 합리적 가격은 RAG·에이전트·엔터프라이즈 검색 파이프라인의 기본 수집 컴포넌트로 자연스럽게 들어갈 수 있음을 보여준다. 단, OlmOCRBench·OmniDocBench 점수는 채점 한계 때문에 참고용으로 보고, 실제 도입 전에는 자체 문서 코퍼스로 직접 승률과 정확도를 평가하는 것이 안전하다. 원시 추출만 필요하면 OCR 4 API, 구조화 JSON·주석·커스텀 프롬프트가 필요하면 Document AI 경로를 선택하는 것이 정석이다.
'AI 뉴스' 카테고리의 다른 글
| Show GN: gh-orbit – 여러 worktree의 PR·CI·diff를 한 터미널에서 다루는 gh 익스텐션 (0) | 2026.06.24 |
|---|---|
| LLM Wiki와 본유적 부하 — 자동 연결이 오히려 무거워지는 이유 (0) | 2026.06.24 |
| postmarketOS v26.06 Alpen Avocado 출시 — 모바일 리눅스 메인라인 진영의 새 이정표 (0) | 2026.06.24 |
| 오픈 모델로 갈아타는 데 따른 단점은 크지 않음 — 실무자가 평가하는 전환 비용의 실제 (0) | 2026.06.23 |
| GLM 5.2 vs Opus — 원샷 WebGL 게임 빌드로 드러난 두 모델의 진짜 차이 (0) | 2026.06.23 |