분야
멀티모달
텍스트·이미지·음성·영상을 함께 다루는 모델, 임베딩
3건 · 최신순
2026년 10월 7일
-
OpenAI, 결정 전용 모델 'gpt-6-luna' 기반 'Decisions API' 출시…입력 100만 토큰당 0.1달러, 출력 무과금(커뮤니티 전언)
Simon Willison에 따르면 OpenAI는 지난주 DevDay에서 예고한 'Decisions API'를 출시했다. API는 Jev와 같은 방식이며, 결정용 모델 gpt-6-luna를 쓴다. 이 모델은 텍스트와 함께 이미지 입력도 받는다....
-
트웰브랩스, 1인칭 영상을 로봇 학습 데이터로 바꾸는 VLM '페가수스 1.6' 출시(보도)
트웰브랩스는 피지컬 AI 학습 데이터 수집에 특화된 비전언어모델 '페가수스 1.6'을 출시했다고 밝혔다. 작업자가 액션캠이나 스마트 글래스로 찍은 1인칭(에고센트릭) 영상을 이해하고, 행동 분할·라벨링과 상세 캡션 생성을 자동화하는 기능이...
-
Google, 이미지 생성·편집 모델 '나노 바나나 2.1' 공개…생성 비용 절반 수준으로(보도)
AI타임스 보도에 따르면 Google은 6일(현지시간) 이미지 생성·편집 모델 'Nano Banana 2.1'을 공개했다. '제미나이 3.6 플래시'를 바탕으로 개발했으며, 1K·2K·4K 해상도에서 화질과 사실감, 편집 정확도를 높였고 여러...