한컴, PDF 추출 핵심 기술 글로벌 오픈소스로 공개

1 month ago 7

한컴, PDF 추출 핵심 기술 글로벌 오픈소스로 공개

한글과컴퓨터가 인공지능(AI) 학습·활용 과정에서 고질적인 난제로 지적돼 온 PDF 문서 데이터 처리 병목 현상을 해소할 핵심 기술을 글로벌 오픈소스로 공개했다.

이번에 공개된 '오픈데이터로더 PDF'는 한컴이 오랜 기간 축적한 문서 처리 기술력을 바탕으로 개발한 PDF 데이터 추출 엔진이다.

최근 허깅 페이스는 PDF 문서를 기반으로 한 약 4억 7500만건 규모 대규모 데이터셋 '파인PDFs'를 공개했고, 이를 활용하려는 기업들의 움직임도 본격화되고 있다.

PDF는 세계적으로 AI 학습에 가장 널리 사용되는 문서 포맷이지만, 복잡한 내부 구조 때문에 학습용 데이터 추출이 쉽지 않다.

이번 오픈소스 프로젝트는 이러한 문제를 해결하기 위해 한컴이 지난 7월 PDF 기술 전문 기업 듀얼랩과 체결한 업무협약 첫 결실이다. 양사는 오픈소스 기반 PDF 데이터로더를 공동 개발하며 AI 생태계 확장을 목표로 하고 있으며, 이번 기술 공개를 통해 본격적인 확산에 나섰다.

공동 개발한 오픈데이터로더 PDF는 PDF 문서 내 텍스트, 표, 이미지, 레이아웃 정보를 높은 정확도와 빠른 성능으로 추출해, AI 학습에 즉시 활용할 수 있는 정형화된 데이터(JSON, Markdown, HTML)로 변환한다는게 회사측 설명이다.

한컴은 이번 오픈소스 공개를 단순한 기술 공유에 그치지 않고, AI 생태계 전반의 오픈소스 확산과 기술 고도화를 추진한다. 이를 위해 챗GPT, 제미나이, 랭체인 등 주요 AI 프레임워크와의 연동·호환성을 강화하고, 깃허브를 통한 글로벌 개발자 커뮤니티와의 협력을 이어갈 계획이다.

김지선 기자 river@etnews.com

Read Entire Article