오늘의 한줄

오늘은 인터랙티브 월드모델의 실시간화와 장기 일관성 확보, 그리고 LLM·에이전트의 학습/디버깅 효율을 끌어올리는 연구가 두드러졌습니다. 동시에 로보틱스와 멀티모달 평가에서는 단순 성능 경쟁을 넘어 제어 가능성, 관찰 능력, 실제 배치 안정성을 정밀하게 다루는 흐름이 뚜렷합니다.

🗣️Language Models3

Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing잠재 변수로서의 전사 정책: 단어 단위 타이밍을 갖춘 제어 가능한 축어 ASR974

CrisperWhisper는 coverage-aware 디코더 토큰과 병렬 전사쌍 학습으로 전사 스타일을 제어해 독일어 비유창성 F1을 제로샷 10%에서 79%로 끌어올리고, 단어 단위 타임스탬프도 강제정렬 기준을 넘어섰습니다.

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models대규모 언어모델의 하이퍼네트워크 기반 지식 주입 스케일링 법칙13

이 연구는 하이퍼네트워크가 생성한 고정 LoRA 어댑터로 사실 지식을 주입하는 설정을 체계화하고, 손실·추론 정확도·OOD 일반화가 규모에 따라 어떻게 변하는지 처음으로 스케일링 법칙 관점에서 분석했습니다.

SLPO: Scaling Latent Reasoning via a Surrogate PolicySLPO: 대리 정책을 통한 잠재 추론 스케일링2

SLPO는 잠재 전이의 surrogate policy density와 정답 기반 종료 신호를 도입해, 언어 토큰을 직접 풀어쓰지 않는 잠재 추론기에도 outcome-reward RL 기반 테스트타임 스케일링을 가능하게 했습니다.

💡 언어모델 연구는 단순히 더 큰 모델을 만드는 대신, 전사 스타일 제어·지식 주입·잠재 추론 강화처럼 내부 표현을 어떻게 조작하고 학습 신호를 설계할지에 집중하고 있습니다. 특히 명시적 토큰 추론의 비용을 줄이면서도 제어 가능성과 일반화를 확보하려는 방향이 뚜렷합니다.

📄Multimodal & Generative6

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU단일 데스크톱 GPU에서 구현한 무한 상호작용 월드 롤아웃819

ABot-World-0는 액션 조건 비디오 월드모델에 LongForcing과 ODE distillation을 결합해 단일 데스크톱 GPU에서도 실시간 장기 폐루프 상호작용을 구현한 점이 실용적입니다.

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical ReportAlayaWorld: 상호작용 가능한 장기 시계열 월드모델 기술 보고서592

AlayaWorld는 15B 비디오 디퓨전 트랜스포머와 공간·시간 메모리 설계로 540p·720p, 24fps의 장기 인터랙티브 비디오 월드 생성을 구현해 텍스트·이미지·비디오 기반 세계 생성의 완성도를 높였습니다.

Self Gradient Forcing: Native Long Video ExtrapolationSelf Gradient Forcing: 네이티브 장기 비디오 외삽68

SGF는 자기 롤아웃 문맥에 대한 gradient gap을 2패스 학습으로 메워 긴 비디오 생성에서 초기 컨텍스트가 미래 프레임 품질에 더 잘 기여하도록 만들어 장기 외삽 안정성을 높였습니다.

💡 멀티모달·생성 분야는 월드모델의 핵심 병목이 이제 해상도나 품질 자체보다 장기 일관성, 실시간성, 상호작용성으로 이동했음을 보여줍니다. 동시에 이미지·비디오 생성도 효율적인 토크나이저와 학습 전략, 그리고 능동적 관찰 같은 새로운 평가 축이 중요해지고 있습니다.

📄Robotics & RL3

Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning낡았지만 안정적으로: 비동기 강화학습을 위한 지연 적응형 신뢰 구간16

SAT는 샘플 로그 비율을 staleness 지표로 활용해 PPO 신뢰구간을 지연도에 따라 비대칭 축소함으로써, 비동기 RL에서 오래된 롤아웃이 초래하는 불안정 업데이트를 더 정교하게 제어합니다.

Masked Visual Actions for Unified World Modeling통합 월드모델링을 위한 마스킹된 시각 행동21

Masked Visual Actions는 픽셀 공간에서 부분 공개된 궤적으로 행동을 표현해 하나의 비디오 모델이 전방 동역학 예측과 목표 객체 이동에 맞는 로봇 행동 복원을 모두 수행하도록 만들었습니다.

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment표현 앵커링과 언어-행동 정렬을 통한 일반화 가능한 VLA 파인튜닝13

Anchor-Align은 동결된 VLM 표현 증류와 동일 관측에서의 언어-행동 공동학습을 결합해, 행동복제 파인튜닝이 무너뜨리던 일반화 표현을 보존하면서 실제 로봇 조작 성공률을 높였습니다.

💡 로보틱스와 RL에서는 비동기 학습 안정화, 시각 기반 행동 표현, VLA 일반화 보존처럼 실제 배치에서 바로 부딪히는 문제를 정면으로 다룹니다. 공통적으로는 더 많은 데이터보다도 행동-언어-시각 사이의 정렬과 오래된 정책 신호의 통제가 성능을 좌우한다는 점이 인상적입니다.

📄Training & Optimization2

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPODAscend SuperPOD에서 수행한 DeepSeek-V4 계열의 전파라미터 후학습19

SLAI T-Rex는 Ascend NPU SuperPOD에서 DeepSeek-V4 계열 전파라미터 후학습을 위해 병렬화·통신·커널을 통합 최적화해 MFU 34.22%와 오픈소스 기준 대비 2.93배 향상을 달성했습니다.

Where Should Optimizer State Live? Tiered State Allocation for Memory-Efficient Mixture-of-Experts Training옵티마이저 상태는 어디에 둬야 하나: 메모리 효율적 MoE 학습을 위한 계층형 상태 배치6

SkewAdam은 MoE의 백본·전문가·라우터에 서로 다른 옵티마이저 상태를 배정해 AdamW 상태 메모리를 50.6GB에서 1.29GB로 줄이고, 피크 메모리도 81.4GB에서 31.3GB로 낮추면서 perplexity까지 개선했습니다.

💡 학습 시스템 연구는 대규모 모델의 성능 향상보다 먼저 메모리·통신·커널 병목을 해소해 '돌릴 수 있는가'를 해결하는 쪽으로 진화하고 있습니다. 특히 MoE와 초거대 후학습에서는 하드웨어 맞춤형 최적화와 상태 메모리 재설계가 곧 경쟁력으로 보입니다.

💻Code & Agents3

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking관련성 중심 검색을 넘어: 루브릭 기반 문서 집합 선택과 랭킹24

Rubric4Setwise는 약 2.8만 개 루브릭으로 문서 집합 품질을 평가하는 SetwiseEvalKit을 제안하고, 최고 리랭커도 커버리지가 45%를 넘지 못함을 보여 검색을 집합 단위 최적화 문제로 재정의했습니다.

AgentDebugX: An Open-Source Toolkit for Failure Observability, Attribution, and Recovery in LLM AgentsAgentDebugX: LLM 에이전트 실패 관측·원인 추적·복구를 위한 오픈소스 툴킷10

AgentDebugX는 Detect-Attribute-Recover-Rerun 루프로 에이전트 디버깅을 구조화하고, DeepDebug로 Who and When에서 정확 원인 추적 28.8%를 기록하며 실패 복구까지 연결했습니다.

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document OperationsDocOps: 복잡한 문서 작업을 위한 검증 가능한 자율 에이전트 벤치마크2

DocOps는 복잡한 문서 조작을 원자 작업과 워크플로 복잡도로 분해한 검증형 벤치마크를 제안하며, 최신 에이전트도 장기 상태 추적 붕괴와 구조 메타데이터 훼손 같은 치명적 약점을 보인다고 분석했습니다.

💡 에이전트 분야는 이제 단순 성공률보다 검색 결과 집합의 품질, 실패 원인 추적, 문서 조작의 검증 가능성처럼 운영 레벨의 신뢰성을 평가하기 시작했습니다. 즉, 에이전트를 더 똑똑하게 만드는 것만큼 디버깅 가능하고 실패를 복구할 수 있게 만드는 일이 중요해지고 있습니다.

👁️Computer Vision3

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object DetectionG-MAD: 다중 시점 RGB-T 항공 객체 탐지를 위한 게임 기반 데이터 생성 프레임워크3

G-MAD는 Arma3 기반으로 정렬된 다중시점 RGB-T 항공 데이터를 자동 주석과 함께 생성하고, 이를 바탕으로 AMOD 벤치마크를 공개해 합성-실사 전이와 멀티모달 융합 연구의 진입장벽을 낮췄습니다.

Trajectory-aware Cross-view Geo-localization with Sequential Observations순차 관측을 활용한 궤적 인지형 크로스뷰 위치 추정3

TrajLoc은 비디오와 경로 설명을 함께 처리하는 SeqGeo-VL와 TrajMod를 제안해, 위성 영상과의 크로스뷰 매칭에서 시각·언어·궤적 기하를 통합한 위치 추정 성능을 크게 끌어올렸습니다.

ATSplat: Compact Feed-forward 3D Gaussian Splatting with Adaptive Token ExpansionATSplat: 적응형 토큰 확장을 활용한 경량 피드포워드 3D 가우시안 스플래팅

ATSplat은 Adaptive 3D Tokens로 장면 복잡도에 따라 가우시안을 확장해, 입력 해상도에 종속되던 기존 feed-forward 3DGS보다 더 압축적이면서도 고품질 novel view synthesis를 구현했습니다.

💡 비전 연구에서는 데이터 생성, 위치 추정, 3D 장면 표현 모두에서 '장면 구조를 얼마나 잘 보존하고 활용하느냐'가 핵심 축으로 보입니다. 합성 데이터와 적응형 3D 표현, 순차·언어 정보 결합이 실제 환경 일반화의 중요한 수단으로 자리잡고 있습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택