오늘의 한줄

오늘은 멀티모달 모델이 긴 비디오와 3D 장면, 오디오-비주얼 생성까지 다루는 방식이 한층 정교해졌고, 동시에 에이전트 연구는 검증 가능한 환경·메모리·협업 구조를 중심으로 빠르게 체계화되고 있습니다. 특히 성능 향상 자체보다도 긴 시계열 안정성, 병렬화, 평가 가능성을 함께 끌어올리려는 흐름이 두드러집니다.

📄Multimodal & Generative5

LLaVA-OneVision-2: Towards Next-Generation Perceptual IntelligenceLLaVA-OneVision-2: 차세대 지각 지능을 향하여961

LLaVA-OV-2는 codec-stream tokenization과 shared 3D RoPE를 통해 긴 비디오에서 이벤트 중심 토큰만 압축해 쓰며, LLaVA-OneVision 계열 최고 수준의 멀티모달 벤치마크 성능을 달성했습니다.

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model EvaluationWBench: 인터랙티브 비디오 월드 모델 평가를 위한 종합 멀티턴 벤치마크46

WBench는 289개 테스트 케이스와 1,058개 상호작용 턴, 22개 자동 지표로 비디오 품질·상호작용 준수·물리 일관성까지 함께 평가해 인터랙티브 월드 모델의 표준화된 비교 기반을 제시했습니다.

Soap2Soap: Long Cinematic Video Remaking via Multi-Agent CollaborationSoap2Soap: 멀티에이전트 협업으로 구현한 장편 시네마틱 비디오 리메이크46

Soap2Soap은 JSON screenplay와 장면·샷 단위 시각 앵커를 잇는 Dual-Bridge Consistency, 그리고 batch keyframe consistency로 수백 샷 길이의 영상 리메이크에서 정체성·내러티브 드리프트를 줄였습니다.

💡 멀티모달 연구는 이제 단순한 인식 결합을 넘어 긴 비디오, 장편 리메이크, 분 단위 오디오-비주얼 생성처럼 시간 축 전체를 안정적으로 다루는 방향으로 이동하고 있습니다. 동시에 native 아키텍처와 통합 벤치마크가 함께 등장하면서, 생성 품질뿐 아니라 구조적 일관성과 평가 표준을 같이 설계하려는 흐름이 뚜렷합니다.

👁️Computer Vision5

Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super Resolution노이즈에 색을 입히다: 충실한 이미지 초해상도를 위한 적대적 Sobolev 정렬71

ASASR는 자연 이미지의 스펙트럼 감쇠를 반영한 colored noise와 Sobolev 기하 기반 적대 샘플링을 결합해, 초해상도에서 고주파 디테일 복원과 환각 억제를 동시에 개선했습니다.

TriSplat: Simulation-Ready Feed-Forward 3D Scene ReconstructionTriSplat: 시뮬레이션 가능한 피드포워드 3D 장면 재구성91

TriSplat은 가우시안 대신 방향성 삼각형 프리미티브를 직접 예측해 단일 forward pass만으로 메시를 바로 출력하며, 희소 뷰·포즈 미지 환경에서도 시뮬레이션 가능한 3D 장면 재구성을 가능하게 했습니다.

SpatialBench: Is Your Spatial Foundation Model an All-Round Player?SpatialBench: 당신의 공간 파운데이션 모델은 진짜 올라운더인가?46

SpatialBench는 19개 데이터셋과 546개 장면을 아우르는 결정론적 평가 체계로, 공간 파운데이션 모델의 과제·시점·도메인·입력 밀도·하드웨어 제약 전반의 일반화 성능을 종합 점검합니다.

💡 비전 분야에서는 3D 재구성, 초해상도, 지시 기반 분할까지 모두에서 '후처리 의존성 축소'와 '현실 조건 강건성'이 핵심 키워드로 보입니다. 즉 더 좋은 점수보다도 바로 쓸 수 있는 메시, 열화 복원, 자연어 제어처럼 실제 파이프라인 연결성을 높이는 연구가 늘고 있습니다.

📄Robotics & RL2

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement LearningParaVT: 에이전트형 비디오 강화학습에서 병렬 도구 사용의 도구 사전지식 역설 다루기33

ParaVT는 여러 시간 구간 crop 도구를 한 번에 호출하는 최초의 병렬 비디오 툴 RL 프레임워크로, Tool Prior Paradox를 분석하며 긴 비디오 이해의 오류 전파와 추론 비용을 함께 줄였습니다.

Does Seeing More Mean Knowing More? Mono-Anchored Advantage Normalization for Multi-Source Visual Reasoning더 많이 본다고 더 많이 아는가?: 멀티소스 시각 추론을 위한 단일소스 앵커 기반 이점 정규화6

MARS는 각 시각 모달리티의 단일소스 보상을 동적 앵커로 삼아 추가 입력이 실제 정보 이득인지 간섭인지 구분하도록 학습해, 적외선·깊이처럼 성질이 다른 멀티소스 추론의 RLVR 성능을 높였습니다.

💡 강화학습은 긴 비디오 이해와 멀티소스 시각 추론에서, 추가 정보나 추가 행동이 항상 이득은 아니라는 점을 더 정교하게 모델링하는 방향으로 진화하고 있습니다. 병렬 도구 호출이나 모달별 보상 앵커처럼, 탐색 효율과 정보 선택 자체를 학습 대상으로 삼는 시도가 인상적입니다.

💻Code & Agents7

SEAL: Synergistic Co-Evolution of Agents and Learning EnvironmentsSEAL: 에이전트와 학습 환경의 시너지형 공진화41

SEAL은 실패 궤적을 turn-level로 진단해 환경은 더 나은 도구 힌트와 복구 피드백을 제공하고, 정책은 diagnosis-guided advantage reweighting으로 업데이트하는 폐루프 공진화 프레임워크입니다.

MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent ResearchMobileGym: 검증 가능하고 대규모 병렬 실행이 가능한 모바일 GUI 에이전트 시뮬레이션 플랫폼32

MobileGym은 JSON 상태 기반 결정적 판정과 인스턴스당 약 400MB 메모리, 3초 콜드스타트로 수백 개 병렬 롤아웃을 지원해 모바일 GUI 에이전트의 온라인 RL과 재현 가능한 평가를 현실화했습니다.

Claw-Anything: Benchmarking Always-On Personal Assistants with Broader Access to User's Digital WorldClaw-Anything: 더 넓은 디지털 세계 접근권을 가진 상시형 개인 비서를 위한 벤치마크15

Claw-Anything은 수개월치 활동 이력, 상호 의존 백엔드, GUI·CLI·멀티디바이스 상호작용을 포함한 시뮬레이션으로 항상 켜져 있는 개인 비서 에이전트의 문맥 추론과 잡음 견고성을 평가합니다.

💡 에이전트 연구는 모델 자체보다도 검증 가능한 환경, 합성 과제 생성, 메모리 인프라, 통신 프로토콜 같은 시스템 계층이 성능을 좌우하는 단계로 들어섰습니다. 공통적으로 보이는 방향은 더 많은 자율성보다 먼저, 더 신뢰할 수 있는 피드백 루프와 더 싸고 병렬적인 실행 기반을 만드는 것입니다.

📄Training & Optimization1

Reinforcing Few-step Generators via Reward-Tilted Distribution Matching보상 기울기 분포 정합으로 few-step 생성기 강화하기17

RTDMD는 reward-tilted teacher 분포에 대한 KL 최소화를 분포 정합과 보상 최대화로 분해하고, AC-DMD와 하이브리드 policy gradient를 결합해 few-step 이미지 생성기의 선호도 정렬을 강화했습니다.

💡 생성 모델 정렬은 더 이상 단순 후속 보상 최적화가 아니라, 원래의 데이터 분포를 얼마나 유지하면서 선호를 주입할지의 균형 문제로 재정의되고 있습니다. RTDMD는 특히 few-step 생성기에서도 분포 정합과 RL을 함께 설계해야 한다는 점을 잘 보여줍니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택