오늘의 한줄

오늘은 실시간 상호작용 생성, 장문맥 효율화를 위한 선형 어텐션 계열, 그리고 실세계 환경에서 에이전트·로봇을 제대로 평가하려는 벤치마크 연구가 두드러졌습니다. 특히 생성 모델은 더 길고 빠르게, 에이전트 평가는 더 현실적이고 진단 가능하게 가는 흐름이 뚜렷합니다.

📄Multimodal & Generative5

Infinite Worlds with Versatile Interactions다양한 상호작용을 지원하는 무한 월드 생성487

LingBot-World 2.0은 인과 사전학습과 에이전트 하네스를 결합해 품질 저하 없이 무한 길이 상호작용을 지원하고, 720p 60fps 실시간 월드 생성과 공격·마법·사격 등 풍부한 행동을 구현했습니다.

Vidu S1: A Real-Time Interactive Video Generation Model실시간 상호작용 비디오 생성 모델, Vidu S1127

Vidu S1은 TurboDiffusion과 TurboServe로 일반 소비자 GPU에서 540p 42FPS 음성 제어 비디오를 생성하며, 블러·드리프트 없이 무한 길이 실시간 생성이 가능해 인터랙티브 캐릭터 응용의 실사용성을 끌어올렸습니다.

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models비디오 확산모델로 푸는 장기 이벤트 비디오 복원·예측·보간20

LongE2V는 사전학습 비디오 디퓨전을 이벤트 스트림에 맞게 미세조정하고 Autoregressive Unrolling, Adaptive Context Switching, Reencoding Alignment를 도입해 복원·예측·보간 전 과제에서 SOTA를 달성했습니다.

💡 생성 모델은 이제 품질 경쟁을 넘어 실시간성, 무한 길이 상호작용, 기하 일관성처럼 실제 인터랙션 시스템에 필요한 속성을 정면으로 다루고 있습니다. 동시에 SciReasoner처럼 과학 구조를 직접 다루는 방향도 보여, 멀티모달 생성이 엔터테인먼트에서 전문 도메인 추론으로 빠르게 확장되고 있습니다.

👁️Computer Vision5

TESSERA v2: Scaling Pixel-wise Earth Foundation Models픽셀 단위 지구 파운데이션 모델 스케일링의 법칙, TESSERA v2635

TESSERA v2는 395회 통제 실험으로 EO 사전학습 손실이 다운스트림 성능을 거의 예측하지 못함을 보이고, 인코더와 데이터를 함께 키우는 규칙으로 2,100만 파라미터 증류 모델이 기존 최고 성능을 종합 17.8% 앞섰습니다.

Video-Oasis: Rethinking Evaluation of Video Understanding비디오 이해 평가를 다시 묻는 Video-Oasis21

Video-Oasis는 기존 비디오 벤치마크의 55%가 시각 입력이나 시간 정보 없이도 풀린다는 점을 밝혔고, 지름길을 제거한 뒤 최신 모델이 거의 랜덤 수준에 머무는 진짜 비디오 이해 격차를 드러냈습니다.

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition왜 서랍을 못 열까: 제로샷 조합 행동 인식의 객체 지름길 완화8

RCORE는 CPR과 TORe를 통해 객체 공기반 지름길을 억제하고 시간적 동사 단서를 강화해, 보지 못한 동사-객체 조합에서도 더 견고한 제로샷 조합 행동 인식을 가능하게 했습니다.

💡 비전 연구는 더 큰 모델을 만드는 것만큼 데이터·평가·편향을 다시 설계하는 일이 중요해졌습니다. EO 스케일링 법칙, 비디오 벤치마크의 지름길 진단, 도시 규모 테스트베드 구축은 모두 ‘무엇을 학습하고 무엇을 측정하는가’가 성능만큼 핵심이라는 점을 보여줍니다.

📄Robotics & RL2

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence체화 지능을 위한 MoE 비디오 사전학습 확장495

LingBot-Video는 DiT 기반 비디오 사전학습에 MoE, 로봇 중심 데이터 프로파일링, 다차원 보상 설계를 결합해 시각적 사실성과 물리적 유용성의 간극을 줄인 체화 지능용 비디오 기초모델을 제안했습니다.

RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies범용 로봇 조작 정책을 위한 통합 시뮬·실세계 벤치마크, RoboDojo133

RoboDojo는 42개 시뮬레이션 과제와 18개 실세계 과제로 일반화·기억·정밀도·장기 실행·오픈보캐브 지시 수행을 함께 평가해, 범용 조작 정책의 실제 배치 격차를 체계적으로 드러내는 통합 벤치마크를 제시했습니다.

💡 로보틱스 쪽은 생성형 비디오 priors를 체화 지능에 맞게 재구성하고, 시뮬과 실세계를 잇는 평가 체계를 넓히는 흐름이 강합니다. 즉, 더 잘 움직이는 정책만이 아니라 물리적으로 타당한 세계모델과 믿을 수 있는 벤치마크가 함께 필요하다는 공감대가 커지고 있습니다.

💻Code & Agents3

Automating the Design of Embodied Agent Architectures체화 에이전트 아키텍처 설계 자동화33

AgentCanvas와 KDLoop는 지각·기억·계획·행동 모듈 연결을 코드 에이전트가 자동 탐색하도록 만들어, 시뮬레이터 롤아웃 기반으로 체화 에이전트 아키텍처를 손설계 대신 검색으로 최적화하는 길을 열었습니다.

UniClawBench: A Universal Benchmark for Proactive Agents on Real-World Tasks실세계 능동형 에이전트를 위한 범용 벤치마크, UniClawBench20

UniClawBench는 기술 사용·탐색·장문맥 추론·멀티모달 이해·크로스플랫폼 협업의 5개 능력 축으로 400개 이중언어 실세계 과제를 구성해, 샌드박스 중심 평가가 놓친 능동형 에이전트의 실패 원인을 분해해 보여줍니다.

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation프로덕션 관점의 코딩 에이전트 궤적 평가, AgentLens4

AgentLens는 코드 에이전트를 성공/실패 한 비트로 보지 않고 도구 사용·자기검증·오류 복구·사용자 소통까지 궤적 전체를 LLM 리뷰와 형식 검증으로 평가해 제품 회귀 탐지에 바로 쓸 수 있게 했습니다.

💡 에이전트 연구는 점점 더 ‘실제로 쓸 만한가’를 묻는 방향으로 이동하고 있습니다. 아키텍처 자동 탐색, 실세계 능력 분해 평가, 궤적 기반 코드 에이전트 리뷰는 모두 최종 정답보다 과정 품질과 배치 현실성을 중시하는 흐름을 반영합니다.

🗣️Language Models2

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation과학 아이디어의 계보 추론과 생성 벤치마크18

IG-Bench는 논문 아이디어를 Idea Genome과 GenomeDiff로 구조화해 10개 과학 분야에서 계보 추론과 계보 기반 아이디어 생성을 평가하며, AI가 연구의 ‘어디서 왔는가’를 이해하는지 측정하는 새 기준을 제시했습니다.

DrugGen 2: A disease-aware language model for enhancing drug discovery질병 맥락을 이해하는 신약 설계 언어모델, DrugGen 23

DrugGen-2는 질병 온톨로지와 표적 단백질 서열을 함께 조건으로 쓰고 GPT-2 미세조정 후 GRPO로 강화학습해, 당뇨병성 신증 관련 5개 표적에서 기존 DrugGPT·DrugGen보다 더 높은 결합 친화도와 분자 품질을 보였습니다.

💡 언어모델은 텍스트 생성기를 넘어 과학적 계보와 질병 맥락처럼 구조화된 지식을 다루는 추론 엔진으로 확장되고 있습니다. 특히 도메인 구조를 명시적으로 주입할수록 생성 품질뿐 아니라 실제 의사결정 가치가 높아진다는 점이 인상적입니다.

📄Training & Optimization3

Linear Attention Architectures: Mechanisms, Trade-offs, and Cross-Layer Routing선형 어텐션 아키텍처의 메커니즘, 트레이드오프, 계층 간 라우팅13

이 연구는 DeltaNet 계열 4종을 공통 재귀 메모리 표기로 정리하고 3.5억~30억 규모 실험으로 표현력·메모리 감쇠·학습 처리량의 트레이드오프를 비교해, 장문맥 효율 모델 선택의 실전 가이드를 제공합니다.

Flash-BoN: Instant Drafts for Inference-Time Scaling in Diffusion Models디퓨전 추론 스케일링을 위한 초고속 초안 생성, Flash-BoN5

Flash-BoN은 타임스텝 절단, 레이어 스킵, 활성 프록시를 결합해 값싼 대량 초안을 먼저 만들고 고품질 후보만 선별함으로써, 벽시계 시간 기준에서 복잡한 guided search보다 더 효율적인 추론 스케일링 전략을 제시했습니다.

Sparse Delta Memory: Scaling the State of Linear RNNs through Sparsity희소성으로 선형 RNN 상태를 확장하는 Sparse Delta Memory

SDM은 Gated DeltaNet의 조밀한 키-값 갱신을 희소 읽기·쓰기로 바꿔 동일 파라미터·동일 FLOPs 조건에서 훨씬 큰 상태 메모리를 확보하며, 장문맥 검색과 인컨텍스트 학습 성능을 유의미하게 개선했습니다.

💡 효율화 연구는 단순히 계산량을 줄이는 수준을 넘어, 같은 예산으로 어떤 메모리·탐색 전략을 써야 더 멀리 가는지를 묻고 있습니다. 선형 어텐션 메모리 확장과 디퓨전 추론 시간 스케일링 모두 ‘FLOPs가 아니라 실제 유효 탐색량’이 중요하다는 메시지를 줍니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택