오늘의 한줄
오늘은 실시간 비디오 생성·편집, 장기 기억과 자기개선이 가능한 에이전트 평가, 그리고 확산 기반 언어모델 및 효율화 기법이 두드러졌습니다. 특히 벤치마크 설계가 단순 점수 경쟁을 넘어 실제 배치 환경의 장기적 일관성과 강건성을 정조준하고 있다는 점이 인상적입니다.
📄Multimodal & Generative4
JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion자기회귀 확산으로 구현한 실시간 오픈엔드 비디오 편집⭐ 138
JoyAI-Video-Edit은 chunk-wise autoregressive adaptation, SA-DMD, 장기 자기회귀 증류를 결합해 미래 프레임 없이도 16B 모델로 단일 B200 GPU에서 720p 30FPS 실시간 비디오 편집을 달성했습니다.
CAPEval: A Decoupled Caption Evaluation across Understanding and Generation이해와 생성을 분리해 평가하는 캡션 벤치마크 CAPEval⭐ 9
CAPEval은 캡션 품질을 Coverage와 Precision으로 분리 평가해, 시각 정보를 많이 담는 것과 사실적으로 맞게 말하는 것이 별개임을 보여주며 멀티모달 이해·생성용 캡션 데이터 선별 기준을 정교화했습니다.
OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models효율적 옴니모달 LLM을 위한 통합 토큰 압축⭐ 4
OmniPack은 LLM 전 구조적 압축과 LLM 내부 질의 유도 의미 정제를 결합한 학습 없는 프레임워크로, 긴 오디오·비주얼 토큰 시퀀스의 중복을 줄이면서 낮은 토큰 예산에서도 성능 저하를 완화합니다.
💡 멀티모달 생성은 이제 단순 품질 경쟁을 넘어 실시간성, 평가 기준의 분해, 이종 모델 간 지식 이전까지 다루기 시작했습니다. 특히 비디오·오디오·이미지 전반에서 계산 예산과 표현 정합성을 함께 최적화하려는 흐름이 뚜렷합니다.
👁️Computer Vision3
Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based SegmentationMLLM 분할을 위한 구조화 올마스크 예측⭐ 40
STAMP와 STAMPlus는 대화 생성과 마스크 예측을 분리한 All-Mask Prediction으로 한 번의 패스에서 분할 마스크를 예측해, MLLM의 대화 능력을 유지하면서도 더 빠르고 강한 referring·reasoning segmentation을 제공합니다.
Multi-Task Multi-Frame Visual Piano Transcription멀티태스크·멀티프레임 비주얼 피아노 전사⭐ 3
V2N은 onset·offset·key hold·velocity를 프레임 단위로 공동학습하는 첫 완전형 Visual Piano Transcription 시스템으로, 긴 시간 문맥을 활용해 PianoVAM과 R3에서 새로운 SOTA를 기록했습니다.
Decoding Children's Gait Behavior아동 보행 행동 해독하기⭐ 2
이 연구는 110명 아동의 1,100개 이상 60FPS RGB 보행 비디오와 동기화 포즈 데이터를 공개하고, 기존 gait foundation model과 MLLM이 이 미세한 임상 보행 분석 과제에서 충분히 작동하지 못함을 보여줬습니다.
💡 비전 연구에서는 분할, 음악 연주 이해, 임상 보행 분석처럼 더 구조적이고 실제적인 과제로 확장되는 모습입니다. 공통적으로 짧은 윈도우나 단일 점수로는 해결되지 않는 시간축·정밀 라벨링 문제가 핵심 병목으로 드러납니다.
📄Robotics & RL3
Quo Vadis, World Modeling?월드 모델링은 어디로 가는가⭐ 26
이 논문은 월드 모델을 단순 미래 상태 예측에서 실행 결과·기술 회수·검증 신호까지 포함하는 Agent-Centric Interactive World Proxies로 재정의해, 지속 개선형 에이전트를 위한 설계 공간을 6가지 기능 축으로 체계화했습니다.
MiniWorld: Democratizing the Training of Video World Models from Scratch처음부터 학습하는 비디오 월드 모델의 대중화⭐ 25
MiniWorld는 사전학습 비디오 생성모델 적응 대신 처음부터 학습 가능한 경량·재현 가능한 비디오 월드 모델 베이스라인을 제시해, 인과적 스트리밍 추론과 맞는 훈련 파이프라인을 더 쉽게 연구할 수 있게 했습니다.
ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts시각 분포 이동에 강한 조작을 위한 의미-시간 월드 액션 모델⭐ 8
ST-WAM은 DINOv3 의미 표현과 VAE 동역학을 분리 활용하는 Dual-Space 설계로 Training-Distribution Hallucination을 줄여, 시각적 분포 이동 상황에서도 더 강건한 로봇 조작 행동 예측을 가능하게 했습니다.
💡 월드 모델은 더 이상 픽셀 미래 예측 자체가 목적이 아니라, 에이전트가 사용할 수 있는 행동 가능한 피드백 인터페이스로 재해석되고 있습니다. 동시에 처음부터 학습 가능한 베이스라인과 분포 이동에 강한 표현 설계가 중요해지며, 구현 가능성과 강건성이 함께 연구 축으로 자리잡고 있습니다.
🗣️Language Models2
AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling연속 잠재 확산 언어모델을 위한 통합 오토인코딩 표현⭐ 21
AURORA-LM은 prefix-aligned 고용량 텍스트 잠재표현과 block-causal diffusion transformer를 결합해, 토큰 충실도를 희생하지 않고 연속 잠재공간에서 좌에서 우로 생성하는 확산 언어모델을 제안했습니다.
LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language ModelsMoE 확산 언어모델의 스케일링 법칙
LLaDA MoE v2는 MoE 기반 확산 언어모델의 배치 크기·학습률·데이터 대 모델 FLOP 배분·전문가 풀 크기에 대한 스케일링 법칙을 정리해, AR 모델과 다른 최적 확장 전략을 제시했습니다.
💡 언어모델 연구에서는 자기회귀 토큰 생성의 대안으로 연속 잠재 확산과 MoE 확장이 본격 탐색되고 있습니다. 중요한 점은 단순히 새 아키텍처를 제안하는 데서 끝나지 않고, 실제로 어떻게 스케일링하고 어떤 학습 법칙이 다른지까지 정량화하려는 단계로 넘어갔다는 것입니다.
💻Code & Agents5
MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations이커머스 운영에서 LLM 에이전트의 장기 일관성을 측정하는 MerchantBench⭐ 29
MerchantBench는 9만8천여 개 실제 상품 기록과 26개 도구를 바탕으로 365일 주문 단위 시뮬레이션을 구축해, 즉시 보상보다 장기 현금흐름·가격·재고 의사결정의 일관성을 평가하는 에이전트 벤치마크를 제안했습니다.
PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents개인 에이전트의 재귀적 자기개선 기반을 평가하는 PAST-Bench⭐ 6
PAST-Bench는 26개 시나리오, 204개 에피소드에서 기억 유지 여부를 통제해 개인 에이전트의 자기개선 효과를 분리 측정했으며, 성능 향상은 실제로 존재하지만 save-retrieve-update 경로의 충실도는 모델마다 크게 달랐습니다.
Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent차세대 멀티모달 딥리서치 에이전트를 향한 Video-DeepResearch
Video-DR은 비디오 기반 딥리서치 에이전트를 위해 시각 grounding 후 웹 탐색을 강제하는 단계별 도구 해제 구조와 SFT+GRPO 학습을 도입하고, 200개 복합 과제로 구성된 Video-DR-Bench를 함께 제안했습니다.
💡 에이전트 분야는 성능 향상 자체보다 장기 일관성, 기억의 실제 활용, 스킬의 재사용 가능성 같은 '시간이 지나도 잘하나'를 묻는 방향으로 빠르게 이동하고 있습니다. 벤치마크도 정적 QA를 벗어나 지속 환경·도구 사용·비디오 탐색을 포함하며 점점 현실 배치형에 가까워지고 있습니다.
📄Training & Optimization3
Knowledge-Geometry Decoupling: Refreshable Pretrained Transfer for Streaming Recommendation스트리밍 추천을 위한 지식-기하 분리형 갱신 가능 전이학습⭐ 3
KGD는 BMTP로 세션 간 잡음을 줄인 행동 지식을 학습하고, 이를 refreshable encoder와 read-only cross-attention task learner로 분리 전이해 분포 변화가 큰 스트리밍 추천에서 더 안정적인 사전학습 활용을 노렸습니다.
ARCHead: Activation-Metric Residual Correction for Large Language Model Output HeadsLLM 출력 헤드를 위한 활성화 지표 기반 잔차 보정⭐ 3
ARCHead는 양자화 저랭크 코어와 INT4 잔차, 활성화 기반 저랭크 보정을 결합해 Qwen3-8B-Base의 LM head 저장공간을 BF16 대비 25.6%로 줄이면서도 상대 perplexity 1.007을 달성했습니다.
ReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct Reasoning실패한 전문가 궤적에서 배우는 ReflectRL⭐ 1
ReflectRL은 정답을 못 맞힌 전문가의 Golden Negative Trajectory를 버리지 않고 반성적 추론의 재료로 활용해, 어려운 문제에서 직접 풀이보다 쉬운 reflection 경로를 통해 온폴리시 추론 학습을 강화합니다.
💡 효율화와 후학습 최적화는 모델 전체를 다시 훈련하기보다, 헤드 압축·지식 전이 분리·실패 궤적 활용처럼 병목 지점을 정밀하게 건드리는 방향으로 진화하고 있습니다. 특히 실패 데이터나 드리프트 환경까지 학습 자원으로 바꾸려는 발상이 실전적입니다.