오늘의 한줄

오늘은 월드모델이 생성기를 넘어 상호작용형 시뮬레이터로 진화하는 흐름과, 장기 업무를 수행하는 에이전트를 더 정확히 평가·운영하려는 연구가 두드러졌습니다. 동시에 이미지·비디오·3D를 아우르는 멀티모달 생성은 더 긴 시간축과 더 세밀한 제어를 향해 빠르게 확장되고 있습니다.

📄Multimodal & Generative7

EchoWM: Open and Enterable Omnimodal World ModelsEchoWM: 들어가서 상호작용할 수 있는 오픈 옴니모달 월드모델1,904

EchoWM은 카메라 의도를 metric-scale 6DoF 궤적으로 통합해 720p 비디오와 환경음·음악·음성을 함께 생성하며, 1인칭·3인칭 장면 모두에서 긴 구간 상호작용과 궤적 추종 성능을 강화한 옴니모달 월드모델입니다.

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live StreamingTLive-Omni: 이커머스 라이브 스트리밍용 옴니모달 이해 모델59

TLive-Omni는 Per-vGrid로 영상·음성을 시간축에서 정렬하고 3단계 학습 뒤 Faithful-RFT를 적용해, 노이즈가 많은 라이브커머스 스트림에서 사실성 높은 실시간 응답을 만드는 옴니모달 이해 모델입니다.

Block3D: Efficient Text-to-3D Generation via Block-Wise DiffusionBlock3D: 블록 단위 디퓨전으로 효율화한 텍스트-투-3D 생성24

Block3D는 shape token을 블록 단위로 생성·공동 복원하고 confidence-guided correction으로 오류 누적을 줄여, TRELLIS-500K 기준 생성 시간을 25.71초에서 크게 단축하면서 기하 품질을 유지합니다.

💡 멀티모달 생성은 이제 단순 샘플 품질 경쟁을 넘어, 사용자의 연속 제어·장기 기억·실시간 응답까지 포함하는 상호작용형 시스템으로 이동하고 있습니다. 동시에 비디오 편집, 3D 생성, 통합 시각 표현처럼 긴 시간축과 세밀한 디테일을 함께 다루려는 설계가 핵심 차별점이 되고 있습니다.

💻Code & Agents6

Prime Agent: A Self-Improving RLM HarnessPrime Agent: 스스로 개선하는 RLM 하네스18,311

Prime Agent는 지속형 IPython REPL, 메모리·스킬 보존, 재귀 서브에이전트 통신을 묶은 오픈소스 하네스로, 장기 코딩·평가 워크플로에서 하네스 실패를 모델 실패와 분리해 실제 에이전트 역량 측정을 끌어올립니다.

ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style HoldoutsClawProBench: 런타임 추적 기반 AI 에이전트 평가 벤치마크822

ClawProBench는 최종 답만 보지 않고 실행 추적·안전·효율까지 함께 채점하는 trace-aware 벤치마크로, 상태를 가진 업무형 에이전트의 런타임 실패 원인을 감사 가능하게 드러냅니다.

Apodex 1.1: Scaling Agentic Intelligence for Complex WorkApodex 1.1: 복잡한 업무를 위한 에이전트 지능 스케일링453

Apodex 1.1은 Environment Scaling과 Agentic Coordination Scaling을 결합해 파일·검색·코드 환경과 병렬 위임·재계획 능력을 함께 키우며, 금융·과학·수학·코딩 등 복합 업무에서 선도 성능을 보고했습니다.

💡 에이전트 연구의 무게중심이 모델 자체보다 하네스, 런타임, 벤치마크, 다중 에이전트 조정으로 옮겨가고 있습니다. 특히 장기 업무에서는 '정답 한 번'보다 상태 보존, 복구 가능성, 검증 가능성이 더 중요한 평가 기준으로 자리잡는 흐름이 분명합니다.

📄Robotics & RL2

RISE: Adaptive Imagination for World Action ModelsRISE: 월드 액션 모델을 위한 적응형 상상36

RISE는 Latent Evaluator와 Rollout Gate로 장면별 상상 예산을 동적으로 조절하는 선택적 롤아웃 프레임워크이며, CounterDrive 반사실 데이터셋을 함께 도입해 주행 계획의 위험 인지와 계산 효율을 높였습니다.

From Generation to Simulation: How Far Are World Models from Being True Simulators?생성에서 시뮬레이션으로: 월드모델은 진짜 시뮬레이터에 얼마나 가까운가4

이 연구는 2018~2026년 대표작 200편을 8개 시뮬레이터 역량 축으로 매핑해, 월드모델이 상호작용·제어성에서는 기능적 대체 가능성을 보이지만 물리 보장·상태 피드백·평가 체계는 아직 부족하다고 진단합니다.

💡 월드 액션 모델과 시뮬레이터형 월드모델 연구는 더 많은 상상을 하는 것보다, 언제 얼마나 상상할지와 어떤 능력이 아직 비어 있는지를 정량화하는 쪽으로 성숙하고 있습니다. 이는 생성형 월드모델이 실제 의사결정 시스템으로 들어가기 위해 필요한 다음 단계가 효율성과 신뢰성임을 보여줍니다.

📄Training & Optimization2

Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models지원 집합은 나누고 잔차는 복원한다: 비디오 생성과 월드모델을 위한 학습 없는 희소 어텐션14

SparsePR은 Response-Coupled Partitioning과 Probe-Fitted Residual Reconstruction으로 블록 희소 어텐션의 출력 오차를 보정해, 추가 학습 없이도 다양한 비디오 생성·월드모델에서 정확도와 효율을 함께 개선합니다.

Task-CoEvolve: Efficient Harness Optimization via Adaptive Validation Task SelectionTask-CoEvolve: 적응형 검증 과제 선택을 통한 효율적 하네스 최적화7

Task-CoEvolve는 하네스 후보 간 성능 분산이 큰 과제를 우선 샘플링하고 부분 평가로 전체 성능을 추정해, 고정 검증셋 전체를 매번 돌리는 비용 없이 LLM 하네스 최적화를 가속합니다.

💡 최적화 연구는 거대한 재학습보다, 추론·평가 단계의 병목을 정교하게 줄이는 방향으로 진화하고 있습니다. 희소 어텐션 보정이나 적응형 검증 선택처럼 시스템 수준의 비용 절감이 실제 적용성에서 점점 더 큰 가치를 갖습니다.

👁️Computer Vision2

Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision개념 스케일링과 조밀한 지도학습으로 여는 이미지 편집의 잠재력26

이 연구는 1,000개 이상 세분화된 편집 개념과 1,200만 쌍의 ConceptEdit-12M 데이터셋, 다중 개념을 한 쌍에 담는 dense supervision 학습을 제안해 이미지 편집 성능과 학습 효율을 동시에 끌어올렸습니다.

Human-Centric Intelligence in the Era of Foundation Models: A Survey파운데이션 모델 시대의 인간 중심 지능: 서베이12

이 서베이는 인간 중심 지능을 외형·기하·동작·상호작용·세계 시뮬레이션·체화 에이전시의 6개 층위로 재구성해, 파운데이션 모델과 인간 이해 연구를 잇는 통합 프레임워크를 제안합니다.

💡 비전 분야에서는 더 풍부한 개념 체계와 더 촘촘한 지도 신호가 성능 향상의 핵심 자원으로 떠오르고 있습니다. 동시에 인간 중심 지능처럼 비전 연구를 더 넓은 행동·상호작용 맥락으로 재구성하려는 움직임도 강해지고 있습니다.

🗣️Language Models1

RIBOSPAN: A Long-Context RNA Foundation Model for Versatile RNA ModelingRIBOSPAN: 범용 RNA 모델링을 위한 장문맥 RNA 파운데이션 모델11

RIBOSPAN은 1.61B 파라미터와 최대 10,240nt 네이티브 문맥 길이를 갖춘 양방향 RNA 파운데이션 모델로, 단일 뉴클레오타이드 해상도에서 긴 전사체 복원과 표현 품질을 동시에 유지합니다.

💡 장문맥 파운데이션 모델의 확장은 이제 자연어를 넘어 생물학 서열 같은 비전통적 토큰 공간으로 빠르게 퍼지고 있습니다. 특히 긴 문맥을 네이티브하게 학습하는 설계가, 단순 스케일업보다 실제 과학 도메인 활용성에 더 직접적인 차이를 만들고 있습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택