← 2026년 10월 9일 브리핑 · 04:00 업데이트로 추가
Tencent, 문서·이미지·오디오·영상을 하나의 JSON으로 파싱하는 5B 모델 'Youtu-Parsing-Omni' 공개(커뮤니티 전언)
무슨 일인가
Reddit에 공유된 Hugging Face 모델 카드에 따르면 Tencent가 5B 규모의 옴니모달 파싱 모델 'Youtu-Parsing-Omni'를 공개했다. 문서 페이지, 자연 이미지, 차트·흐름도, 기하 도형, 오디오 클립, 영상을 입력받아 하나의 구조화된 JSON으로 출력한다. 출력에는 레이아웃, 텍스트, 표, 수식, 바운딩 박스, 타임스탬프, ASR, OCR, 음향 이벤트, 카메라 움직임 같은 인식 결과와 캡션·서술·보고서 같은 이해 결과가 함께 담긴다. 어떤 결과를 낼지는 작업 프롬프트로 고른다.
의미
문서 OCR·ASR·영상 분석을 따로 하던 파이프라인을 작은 모델 하나로 합칠 수 있어, RAG·데이터 전처리 비용을 줄일 수 있다.
신뢰도 보통 · 공식 출처 확인 전
출처
- 커뮤니티 tencent/Youtu-Parsing-Omni · Hugging Face Reddit
Tencent 관련 다른 소식
-
딥시크, IPO 전 투자 유치 규모를 74억 달러에서 최대 150억 달러로 확대 검토(보도)
로이터·CNBC 보도를 인용한 AI타임스에 따르면 딥시크는 상장을 앞두고 진행 중인 투자 라운드에서 당초 목표 74억 달러보다 많은 120억~150억 달러 조달을 논의하고 있다. CATL과 텐센트가 가장 큰 투자자로 참여하고, 지리자동차와 투자...