연구
매일 커뮤니티 추천을 많이 받은 최신 AI 논문을 골라 문제·방법·결과·한계로 정리하고, 매주 분야별 주목 논문(의료 분야는 PubMed Central·bioRxiv·medRxiv 포함)을 모읍니다. 모두 무료로 읽을 수 있는 오픈 액세스 논문입니다.
이번 주 분야별 주목 논문 2026년 9월 30일 ~ 2026년 10월 6일
분야별 바로가기 · 고른 논문이 많은 분야부터
언어 모델
-
교사 모델은 종착지가 아니라 방향이다: 온폴리시 증류에서 강화학습이 만든 표현 변화 외삽하기
The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
출력 확률 대신 은닉 표현 공간에서 강화학습이 만든 변화를 외삽해, 학생 모델이 교사를 넘어서도록 하는 증류를 더 안정적으로 만든다.
-
같은 계열 모델 간 온폴리시 증류의 스케일링 특성
Scaling Properties of Same-Family On-Policy Distillation
큰 모델에서 작은 모델로, 작은 모델에서 큰 모델로 증류할 때 초기 학습에서 정확도가 KL 거리의 제곱근에 거의 비례해 오르는 규칙성을 찾았다.
arXiv 2609.32722 · 추천 323 · 2026-09-26 · PDF
-
트랜스포머는 너무 일찍 생각을 멈춘다, 작은 LoRA 하나로 고친다
Transformers Stop Thinking Too Early, and a Tiny LoRA Fixes It
한 층에 붙인 rank-8 LoRA만으로 Qwen3-8B의 24줄 참조 추적 정확도를 15.5%에서 99%로 높이고, 그 내부 작동 방식까지 분석했다.
생성형 미디어
-
MaLiang-Harness: 프로그램으로 이미지와 영상을 만드는 길
MaLiang-Harness: A Programmable Path to Image and Video Generation
코드는 실행되는데 결과 화면이 요청과 다른 문제를 정의하고, 만들고 확인하고 고치는 과정을 계속 이어 가는 생성 프레임워크를 제안한다.
-
적응형 보상 라우팅: 오디오-비디오 동시 생성을 위한 다중 보상 강화학습
Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL
화질, 소리와 화면의 의미 일치, 싱크 같은 여러 보상을 학습 중에 어디에 어떻게 반영할지 고정하지 않고 계속 조정한다.
arXiv 2609.37200 · 추천 138 · 2026-09-29 · PDF
-
점수 매기기 전에 생각하라: 시각 생성을 위한 사고형 보상 모델
Think Before You Score: Thinking Reward Model for Visual Generation
생성 결과를 평가하기 전에 사례마다 무엇을 볼지 기준표를 먼저 세우고, 그에 따라 세밀한 점수를 매기는 보상 모델이다.
컴퓨터 비전
-
OneStreamer: 실시간 영상 대화에서 인식·기억·선제 응답 통합
OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction
스트리밍 영상을 보면서 시간 정보가 담긴 계층형 캡션 기억을 만들고, 근거가 충분해지면 먼저 응답하는 영상 LLM이다.
-
LEGO-Anything: 코딩 에이전트로 3D 장면 재구성하기
LEGO-Anything: Coding Agents for 3D Scene Reconstruction
이미지 한 장을 보고 블렌더 코드를 쓰고 고쳐 가며 편집 가능한 3D 장면 프로그램을 만들고, 208장 이미지로 된 평가셋도 함께 공개했다.
arXiv 2609.36380 · 추천 137 · 2026-09-28 · PDF
-
타임라인을 넘어: 사물별 '일대기'로 긴 영상 기억 강화하기
Beyond the Timeline: Augmenting Long-Video Memory with Grounded Entity Biographies
긴 영상에서 같은 물체가 나오는 장면들을 하나의 일대기로 묶어, 여러 시간과 날짜에 걸친 질문에 답할 수 있게 하는 기억 프레임워크다.
멀티모달
-
LoopVL: 반복 연산으로 생각하는 시각 지능
LoopVL: Recurrent Visual Intelligence
공유 모듈을 반복해서 실행하는 루프 트랜스포머를 시각-언어 모델로 확장해, 비슷한 크기와 더 큰 일반 모델보다 시각 추론 성능이 높았다.
-
UniEvo-VL: 멀티모달 모델의 자기 개선을 위한 온폴리시 자기 증류 레시피
UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement
별도의 교사 모델 없이 한 멀티모달 모델이 스스로 쓴 비평을 활용해 교사와 학생 역할을 함께 맡으며 학습하는 방법이다.
arXiv 2609.38721 · 추천 292 · 2026-09-30 · PDF
-
잠재 시각 추론 다시 보기: 잠재 추론을 시각 근거에 묶어두기
Rethinking Latent Visual Reasoning: Grounding Latent Reasoning in Visual Evidence
말 대신 잠재 토큰으로 추론할 때 이미지 변화에 거의 반응하지 않는 문제를 찾아내고, 시각 근거에 맞춘 지도 신호로 이를 보완한다.
에이전트
-
가짜 진전: 스스로 진화하는 검색 에이전트의 '공모 부정' 진단과 완화
False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents
문제를 내는 모델과 푸는 모델이 같은 오류에 합의해 보상만 오르는 실패를 밝히고, 학습 전에 문제를 검증하는 다중 샘플 검증법을 제안한다.
arXiv 2609.39102 · 추천 671 · 2026-09-30 · PDF
-
Raven: 조합형 에이전트 지능을 위한 하네스들의 하네스
Raven: The Harness of Harnesses for Composable Agentic Intelligence
분야별 에이전트 하네스를 자동으로 만들고 경험으로 개선해 여러 분야에 걸쳐 조율하는 오픈소스 멀티 에이전트 생태계를 공개했다.
-
Omni-IO Skills: 에이전트를 모든 모달리티에 맞게 만드는 하네스
Omni-IO Skills: Harnessing Your Agent Omni-Native
모델을 다시 학습하지 않고도 기존 에이전트가 텍스트·이미지·오디오·영상·3D·코드 산출물을 다룰 수 있게 하는 플러그인 방식 하네스다.
피지컬 AI·로봇
-
월드 액션 모델은 무엇 덕분에 일반화하는가? 추론 중 미래 예측에 관한 실증 연구
What Makes World Action Models Generalize? An Empirical Study of Test-Time Future Modeling
추론할 때 미래 영상을 생략하는 잠재형 모델은 학습 분포 안에서는 성능이 같아도 일반화 이점을 잃는다는 것을 통제 실험으로 보였다.
-
MotorMind: 범용 시각-언어 모델로 학습 없이 로봇 조작하기
MotorMind: Scaffolding General Vision Language Models for Zero-Shot Robot Manipulation
전용 학습이나 많은 외부 도구 없이, 범용 VLM이 사람 원격 조작자처럼 관찰하며 직접 로봇 동작을 내리도록 돕는 구조를 제안한다.
arXiv 2609.38078 · 추천 97 · 2026-09-29 · PDF
-
PanoVLN: 파노라마 영상을 활용한 시각-언어 내비게이션
PanoVLN: Towards Effective Panoramic Vision-and-Language Navigation
파노라마로 바꾸기만 해서는 효과가 작다는 점을 진단하고, 넓은 시야를 제대로 활용해 경로를 정하는 내비게이션 방법을 제시한다.
강화학습
-
사후 학습의 '날카로워지기 세금'
Sharpening Tax in Post-Training
간단한 하네스를 붙인 사전학습 모델이 한 번에 맞히는 정확도는 낮아도, 여러 번 시도하면 사후 학습 모델보다 더 많은 문제를 푸는 경우가 많았다.
-
직접 샘플링하지 않은 것에서도 배우기: 모델 간 궤적 교환 강화학습
Learning Beyond What You Sample: Off-Policy-Aware Cross-Model Trajectory Exchange for RLVR
모든 시도가 실패한 문제에서 다른 모델이 성공한 풀이를 빌려와, 별도의 강한 교사 없이 서로 배우게 하는 GRAFT를 제안한다.
arXiv 2609.37868 · 추천 63 · 2026-09-29 · PDF
-
EasyPPO: 핵심은 크리틱 안정화
EasyPPO: Stabilizing the Critic Is Key
LLM용 PPO를 불안정하게 만드는 크리틱의 두 가지 실패 원인, 즉 잘린 응답 필터링과 프롬프트별 노이즈 차이를 찾아 해결한다.
arXiv 2609.36802 · 추천 36 · 2026-09-29 · PDF
효율·인프라
-
주기적 약점: 청크 단위 KV 캐시 압축이 만드는 위상 민감도
Periodic Weak Spots: Phase Sensitivity from Chunked KV-Cache Compression
KV 캐시를 구간 단위로 압축하면 정보의 위치에 따라 긴 문맥 검색 정확도가 최대 40%p까지 달라진다는 숨은 약점을 밝혔다.
arXiv 2609.36322 · 추천 100 · 2026-09-28 · PDF
-
서로 다른 계열 멀티 에이전트 LLM 간 프리필 없는 KV 캐시 전달
Prefill-Free Cross-Family KV Cache Transfer for Heterogeneous Multi-Agent LLMs
토크나이저와 구조가 다른 모델 사이에서도 보낸 쪽의 KV 캐시를 받는 쪽에 맞게 옮겨, 공유 문맥을 다시 처리하는 낭비를 줄인다.
-
FocusVTC: 해상도를 적응적으로 바꾸는 효율적 시각 텍스트 압축
FocusVTC: Efficient and High-Performance Visual Text Compression with Adaptive Resolution
텍스트를 이미지로 바꿔 압축할 때 전체는 저해상도로 보고 필요한 부분만 확대해, 토큰 절약과 가독성 사이의 상충을 줄인다.
안전·정렬
-
현실 속 출처 선호: LLM 에이전트는 출처에 따라 항목을 편애한다
Source Preference in the Wild: How LLM Agents Favor Items by Source, and How to Reduce It
12개 에이전트 모델이 조건이 같아도 특정 사이트의 항목을 선호하고, 요구 조건을 하나 덜 맞춘 항목도 약 3분의 2 확률로 고른다는 것을 보였다.
arXiv 2610.03195 · 추천 37 · 2026-10-02 · PDF
-
틀 밖에서 생각하기: 언어 모델은 외부 지침을 가려서 따를 수 있을까?
Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?
지침의 신뢰도만 바꿔 가며, 최신 모델이 잘못된 워크플로에 쉽게 끌려간다는 점을 보이고 이를 학습으로 개선할 수 있는지 시험한다.
arXiv 2609.39578 · 추천 68 · 2026-09-30 · PDF
-
페르소나 도징: 성격 특성의 세기를 단계별로 조절하는 활성화 조향
Persona Dosing: Calibrated Activation Steering for Graded Trait Control
원하는 성격 특성의 강도를 수치로 정하면 그만큼 드러나도록 활성화 조향을 보정하는 방법으로, 세 모델에서 기존 방식보다 효과가 컸다.
arXiv 2609.36388 · 추천 54 · 2026-09-28 · PDF
과학·바이오
-
단백질 접힘을 배우면 더 넓은 추론 능력으로 일반화될까?
Does Learning Protein Folding Generalize to Broader Reasoning?
단백질 구조에서 만든 질의응답 데이터와 3D 구조 신호로 범용 모델을 사후 학습시켜, 공간·구조 추론이 다른 영역으로 옮겨 가는지 살펴본다.
-
LANTERN: 언어 모델 속에 숨은 수학 지식 밝히기
LANTERN: Illuminating Hidden Mathematical Knowledge in Language Models
모델 내부 활성값으로 정수열 사이의 관계 후보를 순위 매기고 검증해, OEIS에 아직 서로 연결되지 않은 관계 62개를 찾았다.
arXiv 2609.32264 · 추천 49 · 2026-09-26 · PDF
-
PDE-JEPA: 매개변수형 편미분방정식을 위한 예측형 표현 학습
PDE-JEPA: Predictive Representation Learning of Latent Dynamics Modeling for Parametric PDEs
관측값을 그대로 복원하는 대신 상태가 어떻게 변할지 예측하도록 표현을 사전학습해, 물리 시스템의 동역학을 모델링한다.
데이터·평가
-
RealCompanion: 실제 장기 대화로 사람을 이해하는 능력 평가
RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations
사람과 AI 동반자 사이의 실제 관계 10건, 최대 120일 동안 오간 메시지 27,218개를 근거 라벨과 함께 공개한 벤치마크다.
arXiv 2610.01780 · 추천 269 · 2026-10-01 · PDF
-
EngiWorld: 최신 에이전트는 실제 엔지니어링 환경에서 무엇을 해낼 수 있나
EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?
CAD·CAE·EDA 등 6개 분야, 26개 전문 소프트웨어에 걸친 1,301개 과제로 설계 전 과정을 평가하는 첫 벤치마크다.
-
과학인가 '슬롭'인가: AI가 생성한 논문의 과학적 허술함 측정과 완화
Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers
부분만 보면 그럴듯하지만 논리 연결이 무너진 AI 생성 논문 390편을 사람이 쓴 논문과 짝지어 평가하는 벤치마크를 만들었다.
의료·헬스케어
-
암 유전형 파운데이션 모델로 치료 반응을 정밀 예측하다
A Foundation Model of Cancer Genotype Enables Precise Predictions of Therapeutic Response
종양 3만여 건의 유전 변이로 사전학습한 MutationProjector가 면역·항암 치료 반응 예측에서 기존 최고 수준 이상을 보였다.
Cancer discovery · Europe PMC · 2026-10-01 · PDF
-
류마티스 환자의 자기관리를 돕는 진료지침 기반 LLM 챗봇: 전국 다기관 평가
Development and Nationwide Multicentre Evaluation of Guideline-Grounded Large Language Model Chatbots to Support Patient Self-Management and Education in Rheumatology.
독일 진료지침에 기반한 질환별 챗봇 10종을 13개 센터에 배포해 실제 환자 질문 6,291건으로 평가했다.
Journal of medical systems · Europe PMC · 2026-10-05 · PDF
-
비정형 의료 보고서에서 종양 정보 추출: 스위스 동부 암 등록소의 AI 도구 적용
Tumor data extraction from unstructured medical reports: application of an artificial intelligence-enhanced tool in the Eastern Switzerland Cancer Registry.
독일어 BERT를 미세조정한 도구로 의료 보고서 82,384건을 처리해, 사람이 일일이 하던 암 등록 코딩 부담을 덜고자 했다.
ESMO real world data and digital oncology · Europe PMC · 2026-09-23 · PDF
음성·오디오
-
VoxMem: 대형 오디오 언어 모델의 멀티모달 기억력 벤치마크
VoxMem: Benchmarking Multimodal Memory in Large Audio Language Models
무슨 말을 했는지뿐 아니라 누가 어떤 말투로 말했는지, 무슨 소리가 났는지까지 여러 세션에 걸쳐 기억하는지 평가한다.
-
일대일 대화를 넘어: 여러 사람의 음성 대화를 위한 상호작용 인식 기억
Beyond Dyadic Memory: Interaction-Aware Multimodal Memory with Adaptive Agentic Retrieval for Multi-Party Spoken Conversations
화자를 점진적으로 식별하고 누가 누구에게 말했는지까지 담은 계층형 기억과 에이전트형 검색으로 여러 사람의 장기 음성 대화를 다룬다.
자율주행
-
DyRAD: 움직이는 주행 장면에서 레이더의 새 시점 합성
DyRAD: Radar Novel View Synthesis for Dynamic Driving Scenes
도플러 속도까지 반영해 움직이는 주행 장면의 레이더 관측을 새 시점에서 합성하며, 자율주행 폐루프 평가에 쓸 수 있다.
매일 논문 리뷰
2026년 10월 7일 5
Kandinsky 6.0 Video: 영상과 오디오를 동기화해 생성하는 파운데이션 모델
Kandinsky 6.0 Video: Foundation Models for Synchronized Video and Audio Generation
ALoDLM: 토큰마다 반복 깊이를 조절하는 루프형 확산 언어 모델
ALoDLM: Adaptively Looped Diffusion Language Models
In-Distribution Forcing: 테스트 시점에 긴 영상을 생성하기 위한 분포 내 KV 운용
In-Distribution Forcing for Long Video Generation at Test Time
MemAdapter: 메모리 때문에 생기는 아첨을 막는 반사실적 적응 프레임워크
Memadapter: Counterfactual Adaptation Against Memory-induced Sycophancy
LMBuild: 실제로 조립할 수 있고 작동하는 구조물을 만드는 LLM 에이전트 평가
LMBuild: Evaluating LLM Agents for Generating Buildable and Functional Structures