오늘의 한줄
오늘은 실시간 인터랙티브 비디오 생성, 로봇·에이전트 평가 인프라, 그리고 장문맥 효율화를 위한 선형 어텐션 계열 연구가 특히 두드러졌습니다. 동시에 벤치마크를 다시 설계해 모델의 진짜 능력을 드러내려는 흐름도 강하게 보입니다.
📄Multimodal & Generative4
Infinite Worlds with Versatile Interactions다양한 상호작용을 갖춘 무한 월드⭐ 487
LingBot-World 2.0은 인과 사전학습과 에이전트 하네스를 결합해 무한 길이 상호작용, 720p 60fps 실시간 구동, 그리고 공격·마법·사격 등 풍부한 텍스트 기반 월드 상호작용을 동시에 구현했습니다.
Vidu S1: A Real-Time Interactive Video Generation Model실시간 인터랙티브 비디오 생성 모델, Vidu S1⭐ 127
Vidu S1은 TurboDiffusion과 TurboServe를 통해 일반 소비자 GPU에서 최대 42 FPS의 540p 무한 길이 실시간 비디오를 생성하며, 음성으로 캐릭터를 즉시 제어할 수 있는 인터랙티브 생성 환경을 구현했습니다.
Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning깊은 구조 고유 추론으로 여는 투명한 구조-물성 이해⭐ 13
SciReasoner는 단백질·분자·결정을 하나의 구조 인식 어휘로 이산화해 좌표·결합·주기성을 직접 추론하며, 구조-물성 예측에서 근거를 투명하게 제시하는 멀티모달 과학 파운데이션 모델을 제안했습니다.
💡 생성 모델은 이제 단순히 예쁜 결과를 넘어서 실시간성, 무한 길이, 기하 일관성, 과학적 구조 추론처럼 사용 맥락에 맞는 제약을 적극 품는 방향으로 가고 있습니다. 특히 인터랙션과 제어 가능성이 핵심 경쟁력으로 부상하고 있습니다.
👁️Computer Vision5
TESSERA v2: Scaling Pixel-wise Earth Foundation Models픽셀 단위 지구 관측 파운데이션 모델의 스케일링, TESSERA v2⭐ 635
TESSERA v2는 395회 통제 실험으로 EO 사전학습 손실이 다운스트림 성능과 거의 무관함을 보였고, 인코더·데이터를 함께 키우는 스케일링 법칙으로 21M distilled 모델이 기존 최고 성능을 종합 7.1%p 앞섰습니다.
Video-Oasis: Rethinking Evaluation of Video Understanding비디오 이해 평가를 다시 묻는 Video-Oasis⭐ 21
Video-Oasis는 기존 비디오 벤치마크의 55%가 시각 입력이나 시간 정보 없이도 풀린다는 점을 밝혔고, 지름길을 제거한 뒤 최신 모델이 거의 랜덤 수준에 머문다는 진단 세트를 제시했습니다.
LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models비디오 디퓨전으로 푸는 장기 이벤트 기반 영상 복원·예측·보간⭐ 20
LongE2V는 사전학습 비디오 디퓨전 모델에 Autoregressive Unrolling, Adaptive Context Switching, Reencoding Alignment를 더해 이벤트 스트림 기반 복원·예측·프레임 보간 전 과제에서 SOTA를 달성했습니다.
💡 비전 연구에서는 성능 향상만큼이나 평가 기준의 정교화와 실제 배치 조건에서의 강건성이 중요해지고 있습니다. 지름길 제거, 장기 안정성, 다중 타깃 처리처럼 기존 벤치마크가 가리던 약점을 드러내는 작업이 많아졌습니다.
📄Robotics & RL3
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence체화 지능을 위한 MoE 비디오 사전학습 확장⭐ 495
LingBot-Video는 DiT 기반 비디오 생성에 MoE, 로봇 중심 데이터 프로파일링, 다차원 보상 설계를 결합해 시각적 품질보다 물리적 현실성과 제어 친화성을 중시하는 체화 지능용 비디오 사전학습 패러다임을 제시했습니다.
RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies범용 로봇 조작 정책을 위한 통합 시뮬·실세계 벤치마크, RoboDojo⭐ 133
RoboDojo는 42개 시뮬레이션 과제와 18개 실세계 과제로 일반화·기억·정밀도·장기 과제·오픈보캐브 지시 수행을 함께 측정해 범용 조작 정책의 실제 배치 성능을 더 체계적으로 검증할 수 있게 했습니다.
WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence렌더링·시뮬레이션·공간 지능을 위한 도시 규모 실세계 테스트베드, WildCity⭐ 4
WildCity는 평균 83.7km 길이의 18개 도시 주행 궤적을 담은 멀티모달 데이터셋과 폐루프 시뮬레이터를 제공해, 도시 규모 디지털 트윈과 공간 지능 연구의 데이터 공백을 메웁니다.
💡 로보틱스는 데이터·월드모델·벤치마크를 함께 키우며 범용성 검증 단계로 넘어가고 있습니다. 특히 시뮬레이션과 현실 간 간극을 줄이고, 비디오 사전학습을 실제 제어 친화적으로 바꾸려는 시도가 인상적입니다.
💻Code & Agents3
Automating the Design of Embodied Agent Architectures체화 에이전트 아키텍처 설계 자동화⭐ 33
AgentCanvas와 KDLoop는 지각형 체화 에이전트를 타입드 그래프 프로그램으로 표현하고 제안·비평·실험·증류를 반복하는 검색 절차로 아키텍처 설계를 자동화해, 수작업 중심 파이프라인의 병목을 줄였습니다.
UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks실세계 능동형 에이전트를 위한 범용 벤치마크, UniClawBench⭐ 20
UniClawBench는 400개의 이중언어 실세계 과제를 스킬 사용·탐색·장문맥 추론·멀티모달 이해·크로스플랫폼 협업의 5가지 능력 축으로 분해해, 샌드박스 중심 평가가 놓친 능동형 에이전트 실패 원인을 드러냅니다.
AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation프로덕션 관점의 코딩 에이전트 궤적 평가, AgentLens⭐ 4
AgentLens는 정답 통과 여부만 보지 않고 도구 사용, 자기 검증, 오류 복구, 사용자 커뮤니케이션까지 포함한 전체 실행 궤적을 리뷰해 코딩 에이전트의 실제 제품 품질을 더 잘 진단합니다.
💡 에이전트 연구는 더 이상 데모 수준 자동화가 아니라 아키텍처 탐색, 능력 분해 평가, 프로덕션 회귀 감지까지 포함한 엔지니어링 체계로 성숙하고 있습니다. 결국 중요한 것은 정답 여부보다 실패 원인을 얼마나 세밀하게 관찰하느냐입니다.
🗣️Language Models2
Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation과학 아이디어 계보 추론과 계보 기반 생성 벤치마크⭐ 18
IG-Bench는 1,961개 계보 추적과 42개 과제 유형을 통해 논문의 아이디어 상속·변이·재조합을 Idea Genome으로 구조화해, AI의 과학적 계보 추론과 근거 기반 아이디어 생성을 정밀 평가합니다.
DrugGen 2: A disease-aware language model for enhancing drug discovery질병 인지형 신약 발굴 언어모델, DrugGen 2⭐ 3
DrugGen-2는 질병 온톨로지와 표적 단백질 서열을 함께 조건으로 넣고 GPT-2를 SFT+GRPO로 미세조정해, 당뇨병성 신증 관련 5개 표적에서 기존 DrugGPT·DrugGen보다 더 높은 결합 친화도와 분자 품질을 보였습니다.
💡 언어모델의 적용 범위가 과학 아이디어 계보 추론과 질병 조건 신약 설계처럼 더 구조적이고 전문적인 문제로 넓어지고 있습니다. 단순 생성보다 도메인 구조를 어떻게 표현하고 근거와 함께 다루느냐가 경쟁 포인트가 되고 있습니다.
📄Training & Optimization3
Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing선형 어텐션 아키텍처의 메커니즘, 트레이드오프, 크로스레이어 라우팅⭐ 13
이 연구는 DeltaNet 계열 4종과 소프트맥스 어텐션을 공통 재귀 메모리 표기로 비교해 표현력·메모리 감쇠·쓰기 제어·학습 처리량의 차이를 정리하고, 350M~3B 규모에서 선형 어텐션 설계 선택의 기준을 제시했습니다.
Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models디퓨전 추론 시간 확장을 위한 초고속 초안 생성, Flash-BoN⭐ 5
Flash-BoN은 중간 검증보다 넓은 탐색이 더 효율적임을 월클록 기준으로 보이며, timestep truncation·layer skipping·activation proxy를 결합한 저비용 초안 생성으로 디퓨전 BoN 추론을 가속합니다.
Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity희소성으로 선형 RNN 상태를 확장하는 Sparse Delta Memory
SDM은 Gated DeltaNet의 조밀한 키-값 갱신을 희소 읽기·쓰기로 대체해 같은 파라미터와 isoFLOP 조건에서 훨씬 큰 메모리 상태를 확보하며, 장문맥 검색과 인컨텍스트 학습 성능을 끌어올렸습니다.
💡 효율화 연구는 단순 FLOPs 절감에서 벗어나 실제 벽시계 시간과 메모리 용량 대비 성능을 다시 따지는 방향으로 이동하고 있습니다. 특히 선형 어텐션 계열은 장문맥 성능을 유지하면서도 상태 확장과 라우팅 설계로 새로운 타협점을 찾는 중입니다.