오늘의 한줄
오늘은 장기 메모리·에이전트 신뢰성 평가, 장편 멀티모달 생성 효율화, 그리고 로보틱스용 비전언어모델 초기화처럼 실제 배포와 학습 효율에 직결되는 연구가 두드러졌습니다. 특히 벤치마크와 시뮬레이터가 단순 성능 비교를 넘어 실패 원인 추적과 폐루프 학습까지 지원하는 방향으로 진화하고 있습니다.
📄Multimodal & Generative4
LLaVA-OneVision-2: Towards Next-Generation Perceptual IntelligenceLLaVA-OneVision-2: 차세대 지각 지능을 향하여⭐ 961
LLaVA-OV-2는 codec-stream tokenization과 shared 3D RoPE로 긴 비디오의 중요한 이벤트 구간에 토큰 예산을 집중해, 네이티브 해상도를 유지하면서도 다양한 멀티모달 벤치마크 성능을 끌어올린 차세대 비전언어모델입니다.
OSP-Next: Efficient High-Quality Video Generation with Sparse Sequence Parallelism, HiF8 Quantization, and Reinforcement LearningOSP-Next: 희소 시퀀스 병렬화·HiF8 양자화·강화학습으로 고품질 영상 생성을 가속하다⭐ 44
OSP-Next는 Skiparse-2D Attention과 Sparse Sequence Parallelism을 결합해 기존 Ulysses SP 대비 통신량을 75% 줄이면서, 텍스트-비디오 생성의 품질과 효율을 함께 높인 확산 트랜스포머입니다.
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent CollaborationSoap2Soap: 멀티에이전트 협업으로 구현한 장편 시네마틱 비디오 리메이크⭐ 46
Soap2Soap은 scene-aware JSON screenplay, 시각 참조 앵커, batch keyframe consistency, 검증 에이전트를 결합해 수백 개 샷에 걸친 장편 영상 리메이크에서 정체성 드리프트와 의미 붕괴를 줄입니다.
💡 멀티모달 생성은 이제 단순히 더 길고 더 선명한 결과를 만드는 단계에서, 제한된 토큰·통신·참조 자원을 어디에 배분할지 정교하게 설계하는 방향으로 이동하고 있습니다. 동시에 장편 영상과 오디오비주얼 생성에서는 모델 자체 못지않게 일관성 유지와 장기 평가를 위한 벤치마크 설계가 핵심 경쟁력이 되고 있습니다.
👁️Computer Vision3
SpatialBench: Is Your Spatial Foundation Model an All-Round Player?SpatialBench: 당신의 공간 파운데이션 모델은 진짜 올라운더인가⭐ 46
SpatialBench는 19개 데이터셋·546개 장면·5개 도메인으로 구성된 결정론적 평가 벤치마크로, 공간 파운데이션 모델의 시점·도메인·입력 밀도 변화에 대한 진짜 일반화 성능을 교차 패러다임으로 검증하게 합니다.
Geometry-Aware Representation Denoising for Robust Multi-view 3D Reconstruction기하 인지 표현 복원으로 강건한 멀티뷰 3D 재구성⭐ 30
GARD는 피드포워드 3D 재구성기의 기하 인지 특징 공간에서 확산 기반 복원을 수행해, 열화된 입력에서도 3D 형상과 RGB를 동시에 복원하는 강건한 멀티뷰 재구성을 제안합니다.
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning더 많이 본다고 더 잘 아는가: 멀티소스 시각 추론을 위한 모노 앵커드 이점 정규화⭐ 6
MARS는 각 단일 모달리티 보상을 동적 앵커로 삼는 mono-anchored advantage normalization으로, 적외선·깊이처럼 이질적인 입력을 무작정 합치지 않고 실제 정보 이득이 있을 때만 멀티소스 추론을 강화합니다.
💡 비전 분야에서는 성능 향상보다도 강건성과 일반화 검증이 더 중요한 화두로 보입니다. 실제 열화 환경과 다양한 공간 조건을 견디는 표현 학습, 그리고 이를 공정하게 드러내는 대규모 벤치마크가 연구의 중심으로 이동하고 있습니다.
📄Robotics & RL4
ProRL: Effective Reinforcement Learning for Proactive Recommendation via Rectified Policy Gradient EstimationProRL: 보정된 정책 그래디언트로 선제 추천을 강화하는 강화학습⭐ 35
ProRL은 Stepwise Reward Centering과 Decomposed Reward Weighting으로 선제 추천 RL의 길이 편향과 고분산 문제를 바로잡아, 사용자 선호를 목표 아이템으로 유도하는 추천 경로 학습을 더 안정적이고 효과적으로 만듭니다.
GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic ManipulationGE-Sim 2.0: 로봇 조작을 위한 폐루프 비디오 월드 시뮬레이터 로드맵⭐ 14
GE-Sim 2.0은 수천 시간의 실제 로봇 데이터로 재학습한 액션 조건부 비디오 시뮬레이터에 state expert와 world judge를 더해, 단일 H100에서 25프레임 롤아웃을 2.3초에 생성하며 정책 학습용 폐루프 보상까지 제공합니다.
GEM: Generative Supervision Helps Embodied IntelligenceGEM: 생성형 감독학습이 임바디드 지능을 돕는다⭐ 7
GEM은 VLM 사전학습에 깊이맵 생성 과제를 함께 넣는 generative supervision과 GEM-4M 데이터셋으로, 로봇 실행에 중요한 공간·물리 이해를 강화해 embodied intelligence 성능을 크게 높였습니다.
💡 로보틱스와 RL은 보상 설계, 시뮬레이터, 사전학습 표현을 하나의 폐루프로 연결하는 흐름이 강해졌습니다. 특히 로봇용 비전언어행동 모델은 더 큰 모델보다도 어떤 표현을 유지하고 어떤 감독 신호를 추가할지가 성능을 좌우한다는 점이 분명해지고 있습니다.
🗣️Language Models5
DenoiseRL: Bootstrapping Reasoning Models to Recover from Noisy PrefixesDenoiseRL: 노이즈 프리픽스에서 회복하며 추론 모델을 부트스트랩하다⭐ 31
DenoiseRL은 강한 교사나 정제된 데이터 없이 약한 모델의 잘못된 추론 궤적 자체를 복구 학습 신호로 활용해, 추론 성능과 학습 효율을 함께 높이는 자기개선형 RL 프레임워크입니다.
MemTrace: Tracing and Attributing Errors in Large Language Model Memory SystemsMemTrace: 대형언어모델 메모리 시스템의 오류를 추적하고 원인을 밝히다⭐ 14
MemTrace는 메모리 파이프라인을 실행 가능한 memory evolution graph로 변환하고 MemTraceBench를 통해 Long-Context·RAG·Mem0 등의 실패를 연산 단위로 추적해, 정보 손실과 검색 오류 같은 근본 원인을 자동 귀속합니다.
Triplet-Block Diffusion RWKV트리플렛 블록 확산 RWKV⭐ 9
B3D-RWKV는 triplet-block layout으로 양방향 이산 확산과 O(L) 추론 효율의 RWKV를 결합해, 8개 태스크에서 유사한 정확도를 유지하면서 평균 1.6배 빠른 디코딩 처리량을 달성했습니다.
💡 언어모델 연구는 더 강한 교사 없이 스스로 개선하는 학습과, 복잡해진 추론·메모리 시스템을 진단하는 평가 프레임워크가 함께 발전하고 있습니다. 즉 성능 경쟁이 생성 능력 자체에서 탐색 전략, 메모리 추적 가능성, 추론 비용 제어 같은 시스템 수준 최적화로 확장되고 있습니다.
💻Code & Agents3
MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent ResearchMobileGym: 검증 가능하고 대규모 병렬 실행이 가능한 모바일 GUI 에이전트 시뮬레이터⭐ 32
MobileGym은 JSON 상태 기반 결정론적 채점과 인스턴스당 약 400MB 메모리, 3초 콜드스타트로 수백 개 병렬 롤아웃을 지원해 모바일 GUI 에이전트의 온라인 RL과 재현 가능한 평가를 동시에 가능하게 합니다.
Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems당신의 에이전트도 늙는다: 배포 시스템을 위한 에이전트 수명 공학⭐ 9
AgingBench는 압축·간섭·수정·유지보수 노화라는 네 가지 메커니즘으로 장기 배포 에이전트의 신뢰성 저하를 측정해, 에이전트를 초기 성능이 아니라 수명 관점에서 진단하고 수리하도록 만듭니다.
DarkForest: Less Talk, Higher Accuracy for Multi-Agent LLMsDarkForest: 덜 말하고 더 정확한 멀티에이전트 LLM⭐ 7
DarkForest는 에이전트 간 자유 대화를 줄이고 독립 답변을 구조화 후보로 클러스터링한 뒤 신뢰도 보정된 belief 분포로 조정해, 오류 전파와 토큰 비용을 낮추면서 멀티에이전트 추론 정확도를 높입니다.
💡 에이전트 연구는 이제 한 번 잘 푸는 모델보다 오래 안정적으로 운영되는 시스템을 만드는 문제에 집중하고 있습니다. 모바일 GUI 환경, 장수명 벤치마크, 저통신 협업 프레임워크는 배포 후 신뢰성과 비용이 차세대 에이전트 성능 지표가 될 것임을 보여줍니다.
📄Training & Optimization1
PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity PerspectivePEFT-Arena: 안정성-가소성 관점에서 파라미터 효율 파인튜닝을 다시 보다⭐ 17
PEFT-Arena는 다운스트림 적응과 사전학습 능력 보존을 함께 측정하는 벤치마크로, 동일한 파라미터 예산에서 orthogonal finetuning이 가장 좋은 안정성-가소성 Pareto frontier를 보인다고 분석했습니다.
💡 파인튜닝은 더 적은 파라미터로 얼마나 잘 맞추느냐보다, 기존 능력을 얼마나 덜 망가뜨리느냐가 핵심 기준이 되고 있습니다. 안정성-가소성 관점의 평가는 앞으로 PEFT 기법을 선택할 때 정확도만 보는 관행을 바꿀 가능성이 큽니다.