오늘의 한줄
오늘은 모델 자체를 키우기보다 에이전트 실행 계층, 평가 하네스, 장기 메모리 같은 시스템 설계로 성능과 신뢰성을 끌어올리려는 연구가 두드러졌습니다. 동시에 3D 생성, 문서 이해, 이미지 편집처럼 멀티모달 워크플로를 더 현실적인 벤치마크와 라우팅 방식으로 다루려는 흐름도 강해지고 있습니다.
📄Multimodal & Generative3
MegaParts: Scaling Part-Aware 3D Object Generation to 300 Parts via Token-Efficient Autoregressive Modeling최대 300개 파트까지 확장하는 파트 인지형 3D 객체 생성⭐ 513
MegaParts는 벡터 양자화 기반 토크나이저와 구조화된 자기회귀 시퀀스 모델링을 결합해 최대 300개 파트의 복잡한 3D 객체를 토큰 효율적으로 생성하며, 제어 가능한 파트 단위 3D 생성의 확장성을 크게 높였습니다.
MOSS-VL Technical Report실시간 상호작용을 위한 MOSS-VL 기술 보고서⭐ 436
MOSS-VL은 게이트드 크로스어텐션과 경량 실시간 커리큘럼으로 '말하면서 보기'를 구현해, 스트리밍 벤치마크 4종 중 3종 최고 평균 성능과 OmniMMI Proactive Alerting에서 66.0점으로 강한 선제적 반응 능력을 보였습니다.
GenRouter: Unified Workflow Routing for Agentic Image Generation에이전트형 이미지 생성을 위한 통합 워크플로 라우팅 GenRouter⭐ 22
GenRouter는 다양한 에이전트형 이미지 생성 파이프라인을 GenCanvas로 표준화하고, 프롬프트 난이도에 따라 최적 워크플로를 라우팅해 '과한 파이프라인'으로 인한 계산 낭비를 줄입니다.
💡 멀티모달 생성은 이제 단순 생성 품질보다 실시간 상호작용, 3D 구조화, 작업별 워크플로 선택 같은 시스템 수준 최적화로 이동하고 있습니다. 즉, '무엇을 생성하느냐' 못지않게 '언제 어떤 파이프라인으로 생성하느냐'가 경쟁력이 되고 있습니다.
💻Code & Agents6
HarnessEval-W: Agentifying the Evaluation of Visual Worlds시각 세계 평가를 에이전트화한 HarnessEval-W⭐ 132
HarnessEval-W는 월드모델 롤아웃 평가를 서브에이전트 기반 추론 파이프라인으로 바꿔, 물리·인과·상태 전이 오류를 단순 점수 대신 검증 가능한 근거와 함께 평가할 수 있게 합니다.
StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling하네스 스케일링으로 Terminal-Bench 2.1에서 95.3%를 달성한 StateM⭐ 49
StateM은 durable state, runbook, checked transition 중심의 에이전트 런타임으로 모델 가중치 변경 없이 Terminal-Bench 2.1에서 최대 95.3% 정확도와 15달러 수준의 프런티어 실행 효율을 달성했습니다.
VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?멀티모달 에이전트는 3D 오픈 월드를 끝까지 만들 수 있을까⭐ 48
VibeWorlding은 6,828개 질의와 2,616개 3D 자산으로 구성한 VWE-BENCH 및 RL 기반 VibeWorlding-Gym을 제안해, 3D 월드 구성 에이전트의 의도 이해·도구 사용·반성 능력을 종단간 평가하고 학습합니다.
💡 에이전트 연구의 무게중심이 모델 자체보다 런타임, 메모리, 평가, 트랜잭션 보장으로 빠르게 옮겨가고 있습니다. 실전 배치에서는 더 똑똑한 모델 하나보다 상태 관리와 검증 가능한 실행 구조가 성능과 신뢰성을 더 크게 좌우한다는 점을 보여줍니다.
🗣️Language Models2
Modular Cognitive Architecture Emerges in Large Language Models대규모 언어모델에서 나타나는 모듈형 인지 아키텍처⭐ 69
46개 과제를 분석한 이 연구는 LLM 내부에서 언어·형식 추론·사회 추론·물리 추론이 인간 뇌와 유사한 기능적 모듈로 분화됨을 보여주며, 해석 가능성과 전문화된 모델 설계에 중요한 단서를 제공합니다.
Large Discovery Models: Empirically-grounded Model-Based Open-Ended Search경험 기반 모델로 여는 개방형 탐색, Large Discovery Models⭐ 15
LDM은 생성 모델과 베이지안 비모수 보상 대리모델을 결합해 후보의 성능과 불확실성을 함께 추정하며, 분자·단백질·프로그램 같은 개방형 탐색에서 더 믿을 수 있는 발견 루프를 제공합니다.
💡 언어모델 연구는 성능 향상뿐 아니라 내부 구조와 탐색 활용 방식에 대한 이해로 확장되고 있습니다. 한쪽에서는 LLM의 모듈성을 해부하고, 다른 한쪽에서는 불확실성 추정을 결합해 과학적 발견 같은 개방형 문제로 적용 범위를 넓히고 있습니다.
📄Training & Optimization3
Latent On-Policy Self-Distillation잠재 표현 기반 온폴리시 자기 증류⭐ 31
LOPD는 사람이 설계한 정답·피드백 대신 경험에서 검색한 연속 잠재 토큰을 자기 교사의 특권 정보로 학습해, 온폴리시 자기 증류를 더 엔드투엔드하고 확장 가능하게 만듭니다.
Advancing Open and Reproducible Relational Learning: RelArena-α, TabPFN-Rel and RPI개방적이고 재현 가능한 관계형 학습을 위한 RelArena-α, TabPFN-Rel, RPI⭐ 18
이 연구는 RelBench v1용 통합 비교 프레임워크 RelArena-α와 오픈소스 도구들을 공개해, 관계형 학습에서 데이터 로딩·튜닝·평가 프로토콜의 재현성과 비교 가능성을 높였습니다.
SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning긴 문맥 추론을 위한 토크나이저 불가지론 온폴리시 증류 SimpleOPD⭐ 8
SimpleOPD는 교사·학생 간 토크나이저 불일치를 공유 텍스트 공간 정렬로 해결하고, reference KL과 종료 토큰 advantage masking으로 긴 응답 폭주와 학습 불안정을 줄여 장문 추론 증류를 단순화했습니다.
💡 학습 최적화 쪽에서는 사람이 설계한 보조신호를 줄이고, 토크나이저 불일치나 재현성 같은 실제 학습 병목을 직접 다루는 흐름이 뚜렷합니다. 결국 잘 학습시키는 기술의 핵심은 더 복잡한 알고리즘보다 안정적이고 일반화되는 학습 인터페이스를 만드는 데 있습니다.
👁️Computer Vision4
Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination현실 위기 영상 딥페이크 공격을 막을 수 있을까⭐ 36
RA-Bench는 17,886개 위기 상황 영상으로 생성기·탐지기·사회적 전파 환경을 함께 평가해, 실제 재난·전쟁 맥락에서 AI 생성 영상 탐지의 일반화 한계와 인간 인식 격차를 체계적으로 드러냅니다.
NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents디지털 문서와 촬영 문서를 함께 파싱하는 NaviDC-OCR⭐ 20
NaviDC-OCR은 변형 인지 학습, 복잡 레이아웃용 적응 샘플링, 내용-구조 분리 학습을 통해 촬영 문서의 왜곡과 고해상도 VLM 환각 문제를 줄인 통합 문서 파싱 프레임워크입니다.
CPI-Bench: A Comprehensive,Practical and Intelligent Benchmark for Real-World Image Editing현실 이미지 편집을 위한 종합 벤치마크 CPI-Bench⭐ 6
CPI-Bench는 다중 이미지 편집, 실제 사용자 시나리오, 고난도 추론 지시를 포함한 3개 서브셋으로 기존 단일 이미지 중심 평가의 한계를 넘어, 실전형 이미지 편집 모델 비교를 가능하게 합니다.
💡 비전 분야는 탐지·문서 이해·편집 평가 모두에서 '현실성 있는 벤치마크'가 핵심 화두입니다. 실제 왜곡, 사회적 전파, 다중 이미지 편집처럼 배포 환경의 복잡성을 평가셋에 끌어들이는 방향이 점점 강해지고 있습니다.
📄Robotics & RL2
ClawGym II: Exploring Black-Box RL on Agent Harness에이전트 하네스 위의 블랙박스 강화학습, ClawGym II⭐ 35
ClawGym II는 샌드박스 실행 인프라와 호출 복원용 prefix tree를 통해 불투명한 하네스 바깥에서 PPO·GRPO를 안정적으로 적용하는 블랙박스 RL 프레임워크를 제시합니다.
HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark사람 지각에 맞춘 종합 모션 트래킹 벤치마크 HumanTracker⭐ 26
HumanTracker는 약 153시간의 전문가 모션 데이터와 12K 쌍 선호 데이터로 학습한 HumanScore를 제안해, 발 미끄러짐과 접촉 오류 같은 인간이 민감한 추적 품질을 더 잘 평가합니다.
💡 강화학습과 모션 쪽에서는 하네스 위의 블랙박스 최적화와 인간 선호 정렬 평가가 함께 부상하고 있습니다. 즉, 더 긴 상호작용을 안정적으로 학습하는 문제와 사람이 보기에 자연스러운 행동을 측정하는 문제가 동시에 중요해지고 있습니다.