오늘의 한줄

오늘은 인터랙티브 월드모델과 비디오 기반 멀티모달 시스템이 한층 실용화되는 흐름이 두드러졌습니다. 동시에 에이전트 디버깅, 비동기 RL 안정화, MoE 학습 메모리 최적화처럼 실제 배포와 학습 효율을 끌어올리는 연구도 강하게 보입니다.

🗣️Language Models2

Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing잠재 변수인 전사 정책을 제어해 단어 단위 타이밍까지 잡는 ASR974

CrisperWhisper는 전사 스타일을 잠재 변수로 보고 coverage-aware task token으로 verbatim/intended 모드를 제어해 독일어 disfluency F1을 제로샷 10%에서 79%로 끌어올리고, 단어 타이밍도 forced alignment보다 개선했습니다.

GigaAM Multilingual: Foundation Model for Underrepresented Languages저자원 언어를 위한 다국어 음성 파운데이션 모델696

GigaAM Multilingual은 200만 시간 오디오 사전학습에 클러스터 단위 밸런싱과 도메인 인지 샘플링을 더해 카자흐어·키르기스어·우즈베크어 ASR에서 Whisper Large v3와 Omnilingual-1B를 능가했습니다.

💡 음성·언어 영역에서는 단순 스케일링보다 데이터 불균형과 라벨 스타일 차이를 제어하는 방식이 실제 성능을 크게 좌우한다는 점이 분명해졌습니다. 특히 전사 정책 제어와 저자원 언어 적응처럼 현업 배포에서 바로 문제되는 요소를 정면으로 다루는 연구가 늘고 있습니다.

📄Multimodal & Generative8

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU단일 데스크톱 GPU에서 무한 상호작용 롤아웃을 구현한 월드모델819

ABot-World-0는 액션 조건 비디오 월드모델에 LongForcing과 ODE distillation을 결합해 단일 데스크톱 GPU에서도 장기 폐루프 상호작용을 실시간으로 구동하도록 만든 점이 핵심입니다.

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report장기 상호작용 비디오 월드모델 알라야월드 기술 보고서592

AlayaWorld는 15B 비디오 디퓨전 트랜스포머와 persistent sink frame·spatial memory를 결합해 540p·720p, 24fps의 장기 인터랙티브 월드 생성에서 드리프트를 줄인 것이 핵심입니다.

ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams열린 비디오 스트림을 위한 엔터티 중심 멀티모달 메모리 시스템75

ReflectWorld-MM은 프레임이 아니라 재등장하는 사람·사물 엔터티 중심으로 에피소드·시맨틱 메모리를 계층화해 오픈엔디드 비디오 스트림에서 장기 추적과 질의응답을 가능하게 합니다.

💡 월드모델 연구는 이제 그럴듯한 생성에서 끝나지 않고 장기 일관성, 실시간성, 메모리 구조, 물리 추론 평가까지 시스템 전반으로 확장되고 있습니다. 동시에 이미지·비디오 생성 모델도 효율 개선과 증거 기반 이해를 함께 추구하며 실제 인터랙션 가능한 형태로 수렴하는 모습입니다.

📄Robotics & RL3

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning체화 학습을 위한 오픈 이고센트릭 조작 데이터셋과 툴체인79

Open-AoE는 500명 이상이 400여 대 스마트폰으로 수집한 약 2,000시간의 조작 영상을 손 포즈·카메라 궤적·원자 행동 주석과 함께 공개해 embodied learning용 데이터 파이프라인을 통째로 제공합니다.

Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning비동기 강화학습을 안정화하는 스테일니스 적응형 트러스트 리전16

SAT는 샘플 로그비 비율을 staleness proxy로 사용해 배치 내 고불일치 꼬리 구간만 선택적으로 더 강하게 클리핑함으로써 비동기 RL의 policy lag 문제를 안정적으로 제어합니다.

Masked Visual Actions for Unified World Modeling통합 월드모델링을 위한 마스킹된 시각 행동21

Masked Visual Actions는 픽셀 공간에서 부분적으로 드러난 궤적으로 행동을 표현해, 단 15시간 파인튜닝만으로 하나의 비디오 모델이 forward dynamics와 goal-conditioned inverse control을 함께 수행하게 만듭니다.

💡 로보틱스와 RL에서는 데이터 수집 인프라, 행동 표현, 비동기 학습 안정화가 함께 발전하며 실제 embodied 시스템의 병목을 하나씩 해소하고 있습니다. 특히 비디오 기반 세계지식을 조작 가능한 행동 인터페이스로 바꾸려는 시도가 점점 핵심 축이 되고 있습니다.

👁️Computer Vision2

OpenLongTail: Generative Scaling of Long-Tail Driving Data롱테일 주행 데이터를 생성적으로 확장하는 오픈 엔진26

OpenLongTail은 단안 대시캠 등 이질적 롱테일 주행 영상을 pose-informed view synthesis로 멀티뷰 자산으로 바꿔 자율주행 정책의 희귀 이벤트 학습 데이터를 대규모로 확장합니다.

Trajectory-aware Cross-view Geo-localization with Sequential Observations연속 관측 기반 궤적 인지 크로스뷰 지오로컬라이제이션3

TrajLoc은 비디오·경로 설명·위성 이미지를 묶은 SeqGeo-VL과 trajectory-conditioned TrajMod를 통해, 시각 정보뿐 아니라 추상적 경로 언어까지 활용하는 크로스뷰 위치추정을 구현했습니다.

💡 비전 분야에서는 희귀 상황과 순차적 맥락을 더 잘 다루기 위해 데이터 자체를 생성적으로 확장하거나, 비디오와 언어 같은 이질적 순차 신호를 함께 쓰는 방향이 두드러집니다. 결국 강한 모델보다 강한 입력 표현과 데이터 엔진이 성능을 좌우하는 국면으로 보입니다.

💻Code & Agents4

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting축구 예측으로 LLM과 딥리서치 에이전트를 세밀 평가하는 벤치마크18

WorldCupArena는 2026 월드컵 104경기 기준으로 결과·정확 스코어·선수·이벤트까지 평가해, 비슷한 승패 정확도의 모델도 세부 예측력에서 크게 갈린다는 점을 드러낸 동적 벤치마크입니다.

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM AgentsLLM 에이전트 실패 관측·원인 분석·복구를 위한 오픈소스 툴킷10

AgentDebugX는 Detect-Attribute-Recover-Rerun 루프로 에이전트 디버깅을 체계화했고, DeepDebug는 Who and When에서 exact attribution 28.8%로 강한 단일 패스 기준선 21.7%를 넘었습니다.

DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment검증 가능한 환경에서 딥서치 에이전트를 자기 증류하는 프레임워크3

DeepSearch-World와 DeepSearch-Evolve는 42만 개 멀티홉 QA 환경에서 자기 생성 궤적을 필터링·혼합·재학습하는 self-distillation으로, 9B 모델이 BrowseComp 31.2%와 GAIA 61.5%를 기록했습니다.

💡 에이전트 연구는 이제 단순 성능 경쟁을 넘어 평가 가능성, 실패 원인 추적, 자기개선 루프 구축으로 무게중심이 옮겨가고 있습니다. 즉, 더 똑똑한 에이전트만이 아니라 더 측정 가능하고 더 고쳐 쓰기 쉬운 에이전트가 중요해지고 있습니다.

📄Training & Optimization1

Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts TrainingMoE 학습 메모리를 줄이는 계층형 옵티마이저 상태 배치6

SkewAdam은 backbone·expert·router에 서로 다른 2차 모멘트 상태를 배정해 MoE 옵티마이저 상태를 AdamW의 2.6%인 1.29GB로 줄이면서도 validation perplexity 108.4로 AdamW 126.8보다 앞섰습니다.

💡 대규모 모델 학습에서는 아키텍처 혁신만큼이나 옵티마이저 상태를 어떻게 저장하고 계산하느냐가 실질적인 확장성을 결정합니다. SkewAdam은 MoE의 파라미터 집단별 통계 차이를 활용해 메모리와 성능을 동시에 잡는 최적화 설계가 가능함을 보여줍니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택