01
Native-text First
PDF text layer, DOCX, HWPX, TXT, XLSX 등은 OCR보다 원본 구조를 우선 활용하는 방향으로 설계합니다.
DOCUMENT AI PLATFORM
개발·검증 중 · Phase 2Universal Document Recognition Layer
문서를 읽는 OCR에서, 문서를 이해하고 검증 가능한 지식으로 만드는 Document AI로.
단일 OCR 엔진이 아닌 ATPIA AI Box의 공통 문서 인식 계층입니다. PDF·DOCX·HWPX·TXT·XLSX부터 스캔 PDF, 촬영문서, 손글씨, 혼합문자와 세로쓰기 고문서까지 하나의 상위 Document Recognition Schema에서 다루는 것을 목표로 개발합니다.
적합한 Parser·OCR·Vision Language Model을 선택하고 confidence와 provenance를 보존합니다. 불확실한 결과를 정답으로 바꾸지 않고 Human Review로 연결하여 원문 근거를 추적할 수 있도록 설계합니다.
ARCHITECTURE
하나의 거대 모델에 모든 문서를 맡기지 않습니다. 문서의 구조·언어·문자·작성방식에 맞춰 전문 Provider를 선택하는 Multi-engine Document AI Architecture입니다. 아래는 목표 처리 흐름입니다.
Document
Native Parser / Image Preflight
Layout Analysis
Script · Style · Domain Router
Specialized OCR / VLM
Validation
Human Review
RAG / Search / Business Pack
범용 Document AI Platform. 전문 인식 결과를 공통 스키마로 통합합니다.
Specialized Historical Document Recognition Provider. 세로쓰기·고한자·고문헌을 담당하는 전문 기술로 재사용을 지향합니다.
원문·페이지·영역·좌표·모델 출처를 보존하고 검색·RAG·법률·행정·회계·기술업무로 연결하는 구조입니다.
로컬 GPU 기반 이미지·PDF 문서 구조 인식을 검증하는 Research Beta를 운영합니다. 상위 플랫폼과의 Provider 연동은 후속 연구 과제입니다.
ATPIA PaddleOCR-VL 베타 소개 →INTERACTIVE DOCUMENT AI
다양한 문서가 분석·인식·검증되어 AI가 활용할 수 있는 지식으로 변환되는 과정을 살펴보세요.
Research & Development · Baseline Validation
현재 홈페이지 내 데모를 이용할 수 없어 기술 흐름 미리보기를 제공합니다. 각 단계를 펼쳐 개발 방향을 살펴보세요.
PDF · 스캔 · 사진 · 손글씨 · 한글·영문·한자 혼합문서
Native-text First로 원본 텍스트와 구조를 우선 활용하고, 이미지 문서는 분석을 준비합니다.
Layout Analysis · Document Understanding
Printed OCR, Handwriting Recognition, Mixed Hangul / Hanja, Historical OCR, Document VLM을 전문 Provider로 연결하는 구조입니다.
Human Review · Provenance
원문과 인식 결과를 보존하고 불확실한 영역을 사람이 검토하여 근거를 추적할 수 있도록 설계합니다.
RAG / Knowledge → ATPIA AI Box → Enterprise AI
검증 가능한 문서 지식을 검색·법률·행정·회계·기업업무 자동화로 연결하는 것을 목표로 합니다.
외부 데모는 새 창에서 확인할 수 있습니다. 외부 서비스의 공개 상태에 따라 접근이 제한될 수 있습니다.
Interactive Demo 열기 ↗CAPABILITIES & DESIGN
01
PDF text layer, DOCX, HWPX, TXT, XLSX 등은 OCR보다 원본 구조를 우선 활용하는 방향으로 설계합니다.
02
문서 특성에 따라 인쇄체 OCR, 한글 손글씨 OCR, 혼합 한자·한글 OCR, Historical OCR, Document VLM을 선택하는 구조입니다.
03
제목·본문·표·그림·수식·코드·도장·서명·각주 등 문서 영역의 구조화를 목표로 합니다.
04
Raw OCR은 보존하고 model·checkpoint·dataset·pre/postprocess 등 인식 과정의 provenance를 추적하도록 설계합니다.
05
낮은 confidence 결과를 REVIEW_REQUIRED로 분리하고 원문·bbox·후보·Raw OCR·Reviewed Text를 검토하는 흐름을 제공합니다. 원문 이미지 위 bbox overlay는 후속 과제입니다.
06
page·region·bbox citation을 보존하며 Chunking·Embedding·pgvector·RAG로 연결합니다. Legal/Finance/Technical 업무 Pack 연계는 상위 아키텍처의 목표입니다.
TARGET DOCUMENT SCOPE
아래는 개발 목표 범위이며, 모든 문서군의 지원·정확도가 검증되었다는 의미는 아닙니다. 문서군별 baseline과 평가 데이터를 확장하고 있습니다.
DEVELOPMENT PROGRESS
Phase 2 보고 기준의 검증 성과입니다. 학습 smoke는 전체 fine-tuning 완료나 인식 정확도 평가를 의미하지 않습니다.