← 2026년 10월 9일 브리핑 · 04:00 업데이트로 추가

Tencent, 문서·이미지·오디오·영상을 하나의 JSON으로 파싱하는 5B 모델 'Youtu-Parsing-Omni' 공개(커뮤니티 전언)

무슨 일인가

Reddit에 공유된 Hugging Face 모델 카드에 따르면 Tencent가 5B 규모의 옴니모달 파싱 모델 'Youtu-Parsing-Omni'를 공개했다. 문서 페이지, 자연 이미지, 차트·흐름도, 기하 도형, 오디오 클립, 영상을 입력받아 하나의 구조화된 JSON으로 출력한다. 출력에는 레이아웃, 텍스트, 표, 수식, 바운딩 박스, 타임스탬프, ASR, OCR, 음향 이벤트, 카메라 움직임 같은 인식 결과와 캡션·서술·보고서 같은 이해 결과가 함께 담긴다. 어떤 결과를 낼지는 작업 프롬프트로 고른다.

의미

문서 OCR·ASR·영상 분석을 따로 하던 파이프라인을 작은 모델 하나로 합칠 수 있어, RAG·데이터 전처리 비용을 줄일 수 있다.

신뢰도 보통 · 공식 출처 확인 전

출처

Tencent 관련 다른 소식