오늘의 한줄
오늘은 멀티모달 모델이 긴 비디오와 3D 장면, 오디오-비주얼 생성까지 다루는 방식이 한층 정교해졌고, 동시에 에이전트 연구는 검증 가능한 환경·메모리·협업 구조를 중심으로 빠르게 체계화되고 있습니다. 특히 성능 향상 자체보다도 긴 시계열 안정성, 병렬화, 평가 가능성을 함께 끌어올리려는 흐름이 두드러집니다.
📄Multimodal & Generative5
LLaVA-OneVision-2: Towards Next-Generation Perceptual IntelligenceLLaVA-OneVision-2: 차세대 지각 지능을 향하여⭐ 961
LLaVA-OV-2는 codec-stream tokenization과 shared 3D RoPE를 통해 긴 비디오에서 이벤트 중심 토큰만 압축해 쓰며, LLaVA-OneVision 계열 최고 수준의 멀티모달 벤치마크 성능을 달성했습니다.
WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model EvaluationWBench: 인터랙티브 비디오 월드 모델 평가를 위한 종합 멀티턴 벤치마크⭐ 46
WBench는 289개 테스트 케이스와 1,058개 상호작용 턴, 22개 자동 지표로 비디오 품질·상호작용 준수·물리 일관성까지 함께 평가해 인터랙티브 월드 모델의 표준화된 비교 기반을 제시했습니다.
Soap2Soap: Long Cinematic Video Remaking via Multi-Agent CollaborationSoap2Soap: 멀티에이전트 협업으로 구현한 장편 시네마틱 비디오 리메이크⭐ 46
Soap2Soap은 JSON screenplay와 장면·샷 단위 시각 앵커를 잇는 Dual-Bridge Consistency, 그리고 batch keyframe consistency로 수백 샷 길이의 영상 리메이크에서 정체성·내러티브 드리프트를 줄였습니다.
💡 멀티모달 연구는 이제 단순한 인식 결합을 넘어 긴 비디오, 장편 리메이크, 분 단위 오디오-비주얼 생성처럼 시간 축 전체를 안정적으로 다루는 방향으로 이동하고 있습니다. 동시에 native 아키텍처와 통합 벤치마크가 함께 등장하면서, 생성 품질뿐 아니라 구조적 일관성과 평가 표준을 같이 설계하려는 흐름이 뚜렷합니다.
👁️Computer Vision5
Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution노이즈에 색을 입히다: 충실한 이미지 초해상도를 위한 적대적 Sobolev 정렬⭐ 71
ASASR는 자연 이미지의 스펙트럼 감쇠를 반영한 colored noise와 Sobolev 기하 기반 적대 샘플링을 결합해, 초해상도에서 고주파 디테일 복원과 환각 억제를 동시에 개선했습니다.
TriSplat: Simulation-Ready Feed-Forward 3D Scene ReconstructionTriSplat: 시뮬레이션 가능한 피드포워드 3D 장면 재구성⭐ 91
TriSplat은 가우시안 대신 방향성 삼각형 프리미티브를 직접 예측해 단일 forward pass만으로 메시를 바로 출력하며, 희소 뷰·포즈 미지 환경에서도 시뮬레이션 가능한 3D 장면 재구성을 가능하게 했습니다.
SpatialBench: Is Your Spatial Foundation Model an All-Round Player?SpatialBench: 당신의 공간 파운데이션 모델은 진짜 올라운더인가?⭐ 46
SpatialBench는 19개 데이터셋과 546개 장면을 아우르는 결정론적 평가 체계로, 공간 파운데이션 모델의 과제·시점·도메인·입력 밀도·하드웨어 제약 전반의 일반화 성능을 종합 점검합니다.
💡 비전 분야에서는 3D 재구성, 초해상도, 지시 기반 분할까지 모두에서 '후처리 의존성 축소'와 '현실 조건 강건성'이 핵심 키워드로 보입니다. 즉 더 좋은 점수보다도 바로 쓸 수 있는 메시, 열화 복원, 자연어 제어처럼 실제 파이프라인 연결성을 높이는 연구가 늘고 있습니다.
📄Robotics & RL2
ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement LearningParaVT: 에이전트형 비디오 강화학습에서 병렬 도구 사용의 도구 사전지식 역설 다루기⭐ 33
ParaVT는 여러 시간 구간 crop 도구를 한 번에 호출하는 최초의 병렬 비디오 툴 RL 프레임워크로, Tool Prior Paradox를 분석하며 긴 비디오 이해의 오류 전파와 추론 비용을 함께 줄였습니다.
Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning더 많이 본다고 더 많이 아는가?: 멀티소스 시각 추론을 위한 단일소스 앵커 기반 이점 정규화⭐ 6
MARS는 각 시각 모달리티의 단일소스 보상을 동적 앵커로 삼아 추가 입력이 실제 정보 이득인지 간섭인지 구분하도록 학습해, 적외선·깊이처럼 성질이 다른 멀티소스 추론의 RLVR 성능을 높였습니다.
💡 강화학습은 긴 비디오 이해와 멀티소스 시각 추론에서, 추가 정보나 추가 행동이 항상 이득은 아니라는 점을 더 정교하게 모델링하는 방향으로 진화하고 있습니다. 병렬 도구 호출이나 모달별 보상 앵커처럼, 탐색 효율과 정보 선택 자체를 학습 대상으로 삼는 시도가 인상적입니다.
💻Code & Agents7
SEAL: Synergistic Co-Evolution of Agents and Learning EnvironmentsSEAL: 에이전트와 학습 환경의 시너지형 공진화⭐ 41
SEAL은 실패 궤적을 turn-level로 진단해 환경은 더 나은 도구 힌트와 복구 피드백을 제공하고, 정책은 diagnosis-guided advantage reweighting으로 업데이트하는 폐루프 공진화 프레임워크입니다.
MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent ResearchMobileGym: 검증 가능하고 대규모 병렬 실행이 가능한 모바일 GUI 에이전트 시뮬레이션 플랫폼⭐ 32
MobileGym은 JSON 상태 기반 결정적 판정과 인스턴스당 약 400MB 메모리, 3초 콜드스타트로 수백 개 병렬 롤아웃을 지원해 모바일 GUI 에이전트의 온라인 RL과 재현 가능한 평가를 현실화했습니다.
Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital WorldClaw-Anything: 더 넓은 디지털 세계 접근권을 가진 상시형 개인 비서를 위한 벤치마크⭐ 15
Claw-Anything은 수개월치 활동 이력, 상호 의존 백엔드, GUI·CLI·멀티디바이스 상호작용을 포함한 시뮬레이션으로 항상 켜져 있는 개인 비서 에이전트의 문맥 추론과 잡음 견고성을 평가합니다.
💡 에이전트 연구는 모델 자체보다도 검증 가능한 환경, 합성 과제 생성, 메모리 인프라, 통신 프로토콜 같은 시스템 계층이 성능을 좌우하는 단계로 들어섰습니다. 공통적으로 보이는 방향은 더 많은 자율성보다 먼저, 더 신뢰할 수 있는 피드백 루프와 더 싸고 병렬적인 실행 기반을 만드는 것입니다.
📄Training & Optimization1
Reinforcing Few-step Generators via Reward-Tilted Distribution Matching보상 기울기 분포 정합으로 few-step 생성기 강화하기⭐ 17
RTDMD는 reward-tilted teacher 분포에 대한 KL 최소화를 분포 정합과 보상 최대화로 분해하고, AC-DMD와 하이브리드 policy gradient를 결합해 few-step 이미지 생성기의 선호도 정렬을 강화했습니다.
💡 생성 모델 정렬은 더 이상 단순 후속 보상 최적화가 아니라, 원래의 데이터 분포를 얼마나 유지하면서 선호를 주입할지의 균형 문제로 재정의되고 있습니다. RTDMD는 특히 few-step 생성기에서도 분포 정합과 RL을 함께 설계해야 한다는 점을 잘 보여줍니다.