오늘의 한줄
오늘은 월드모델이 생성기를 넘어 상호작용형 시뮬레이터로 진화하는 흐름과, 장기 업무를 수행하는 에이전트를 더 정확히 평가·운영하려는 연구가 두드러졌습니다. 동시에 이미지·비디오·3D를 아우르는 멀티모달 생성은 더 긴 시간축과 더 세밀한 제어를 향해 빠르게 확장되고 있습니다.
📄Multimodal & Generative7
EchoWM: Open and Enterable Omnimodal World ModelsEchoWM: 들어가서 상호작용할 수 있는 오픈 옴니모달 월드모델⭐ 1,904
EchoWM은 카메라 의도를 metric-scale 6DoF 궤적으로 통합해 720p 비디오와 환경음·음악·음성을 함께 생성하며, 1인칭·3인칭 장면 모두에서 긴 구간 상호작용과 궤적 추종 성능을 강화한 옴니모달 월드모델입니다.
TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live StreamingTLive-Omni: 이커머스 라이브 스트리밍용 옴니모달 이해 모델⭐ 59
TLive-Omni는 Per-vGrid로 영상·음성을 시간축에서 정렬하고 3단계 학습 뒤 Faithful-RFT를 적용해, 노이즈가 많은 라이브커머스 스트림에서 사실성 높은 실시간 응답을 만드는 옴니모달 이해 모델입니다.
Block3D: Efficient Text-to-3D Generation via Block-Wise DiffusionBlock3D: 블록 단위 디퓨전으로 효율화한 텍스트-투-3D 생성⭐ 24
Block3D는 shape token을 블록 단위로 생성·공동 복원하고 confidence-guided correction으로 오류 누적을 줄여, TRELLIS-500K 기준 생성 시간을 25.71초에서 크게 단축하면서 기하 품질을 유지합니다.
💡 멀티모달 생성은 이제 단순 샘플 품질 경쟁을 넘어, 사용자의 연속 제어·장기 기억·실시간 응답까지 포함하는 상호작용형 시스템으로 이동하고 있습니다. 동시에 비디오 편집, 3D 생성, 통합 시각 표현처럼 긴 시간축과 세밀한 디테일을 함께 다루려는 설계가 핵심 차별점이 되고 있습니다.
💻Code & Agents6
Prime Agent: A Self-Improving RLM HarnessPrime Agent: 스스로 개선하는 RLM 하네스⭐ 18,311
Prime Agent는 지속형 IPython REPL, 메모리·스킬 보존, 재귀 서브에이전트 통신을 묶은 오픈소스 하네스로, 장기 코딩·평가 워크플로에서 하네스 실패를 모델 실패와 분리해 실제 에이전트 역량 측정을 끌어올립니다.
ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style HoldoutsClawProBench: 런타임 추적 기반 AI 에이전트 평가 벤치마크⭐ 822
ClawProBench는 최종 답만 보지 않고 실행 추적·안전·효율까지 함께 채점하는 trace-aware 벤치마크로, 상태를 가진 업무형 에이전트의 런타임 실패 원인을 감사 가능하게 드러냅니다.
Apodex 1.1: Scaling Agentic Intelligence for Complex WorkApodex 1.1: 복잡한 업무를 위한 에이전트 지능 스케일링⭐ 453
Apodex 1.1은 Environment Scaling과 Agentic Coordination Scaling을 결합해 파일·검색·코드 환경과 병렬 위임·재계획 능력을 함께 키우며, 금융·과학·수학·코딩 등 복합 업무에서 선도 성능을 보고했습니다.
💡 에이전트 연구의 무게중심이 모델 자체보다 하네스, 런타임, 벤치마크, 다중 에이전트 조정으로 옮겨가고 있습니다. 특히 장기 업무에서는 '정답 한 번'보다 상태 보존, 복구 가능성, 검증 가능성이 더 중요한 평가 기준으로 자리잡는 흐름이 분명합니다.
📄Robotics & RL2
RISE: Adaptive Imagination for World Action ModelsRISE: 월드 액션 모델을 위한 적응형 상상⭐ 36
RISE는 Latent Evaluator와 Rollout Gate로 장면별 상상 예산을 동적으로 조절하는 선택적 롤아웃 프레임워크이며, CounterDrive 반사실 데이터셋을 함께 도입해 주행 계획의 위험 인지와 계산 효율을 높였습니다.
From Generation to Simulation: How Far Are World Models from Being True Simulators?생성에서 시뮬레이션으로: 월드모델은 진짜 시뮬레이터에 얼마나 가까운가⭐ 4
이 연구는 2018~2026년 대표작 200편을 8개 시뮬레이터 역량 축으로 매핑해, 월드모델이 상호작용·제어성에서는 기능적 대체 가능성을 보이지만 물리 보장·상태 피드백·평가 체계는 아직 부족하다고 진단합니다.
💡 월드 액션 모델과 시뮬레이터형 월드모델 연구는 더 많은 상상을 하는 것보다, 언제 얼마나 상상할지와 어떤 능력이 아직 비어 있는지를 정량화하는 쪽으로 성숙하고 있습니다. 이는 생성형 월드모델이 실제 의사결정 시스템으로 들어가기 위해 필요한 다음 단계가 효율성과 신뢰성임을 보여줍니다.
📄Training & Optimization2
Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models지원 집합은 나누고 잔차는 복원한다: 비디오 생성과 월드모델을 위한 학습 없는 희소 어텐션⭐ 14
SparsePR은 Response-Coupled Partitioning과 Probe-Fitted Residual Reconstruction으로 블록 희소 어텐션의 출력 오차를 보정해, 추가 학습 없이도 다양한 비디오 생성·월드모델에서 정확도와 효율을 함께 개선합니다.
Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task SelectionTask-CoEvolve: 적응형 검증 과제 선택을 통한 효율적 하네스 최적화⭐ 7
Task-CoEvolve는 하네스 후보 간 성능 분산이 큰 과제를 우선 샘플링하고 부분 평가로 전체 성능을 추정해, 고정 검증셋 전체를 매번 돌리는 비용 없이 LLM 하네스 최적화를 가속합니다.
💡 최적화 연구는 거대한 재학습보다, 추론·평가 단계의 병목을 정교하게 줄이는 방향으로 진화하고 있습니다. 희소 어텐션 보정이나 적응형 검증 선택처럼 시스템 수준의 비용 절감이 실제 적용성에서 점점 더 큰 가치를 갖습니다.
👁️Computer Vision2
Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision개념 스케일링과 조밀한 지도학습으로 여는 이미지 편집의 잠재력⭐ 26
이 연구는 1,000개 이상 세분화된 편집 개념과 1,200만 쌍의 ConceptEdit-12M 데이터셋, 다중 개념을 한 쌍에 담는 dense supervision 학습을 제안해 이미지 편집 성능과 학습 효율을 동시에 끌어올렸습니다.
Human-Centric Intelligence in the Era of Foundation Models: A Survey파운데이션 모델 시대의 인간 중심 지능: 서베이⭐ 12
이 서베이는 인간 중심 지능을 외형·기하·동작·상호작용·세계 시뮬레이션·체화 에이전시의 6개 층위로 재구성해, 파운데이션 모델과 인간 이해 연구를 잇는 통합 프레임워크를 제안합니다.
💡 비전 분야에서는 더 풍부한 개념 체계와 더 촘촘한 지도 신호가 성능 향상의 핵심 자원으로 떠오르고 있습니다. 동시에 인간 중심 지능처럼 비전 연구를 더 넓은 행동·상호작용 맥락으로 재구성하려는 움직임도 강해지고 있습니다.
🗣️Language Models1
RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA ModelingRIBOSPAN: 범용 RNA 모델링을 위한 장문맥 RNA 파운데이션 모델⭐ 11
RIBOSPAN은 1.61B 파라미터와 최대 10,240nt 네이티브 문맥 길이를 갖춘 양방향 RNA 파운데이션 모델로, 단일 뉴클레오타이드 해상도에서 긴 전사체 복원과 표현 품질을 동시에 유지합니다.
💡 장문맥 파운데이션 모델의 확장은 이제 자연어를 넘어 생물학 서열 같은 비전통적 토큰 공간으로 빠르게 퍼지고 있습니다. 특히 긴 문맥을 네이티브하게 학습하는 설계가, 단순 스케일업보다 실제 과학 도메인 활용성에 더 직접적인 차이를 만들고 있습니다.