오늘의 한줄
오늘은 에이전트와 월드모델이 더 빠르고, 더 오래 기억하고, 더 물리적으로 일관된 방식으로 현실과 상호작용하려는 흐름이 두드러집니다. 동시에 RL·검색·컴퓨터 사용 환경까지 학습 인터페이스 자체를 다시 설계해 실제 성능을 끌어올리는 연구가 많았습니다.
📄Robotics & RL4
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAMRTX 4090에서 32Hz·1GB 미만으로 동작하는 실시간 비전-언어-행동 모델 TurboVLA⭐ 64
TurboVLA는 기존 LLM 중심 V→L→A 경로를 직접 V+L→A로 바꿔 경량 상호작용과 compact decoder만으로 RTX 4090에서 32Hz, 1GB 미만 VRAM의 실시간 로봇 제어를 달성했습니다.
INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models탐색 없는 월드모델을 위한 등형적 의도-행동 학습 INTACT⭐ 56
INTACT는 JEPA 기반의 intent-to-action 인터페이스를 통해 보상 없는 궤적에서 물리적 의도를 직접 행동으로 매핑해, 기존 잠재 월드모델의 비싼 테스트타임 검색 없이 목표 변화에 대응하는 제어를 가능하게 했습니다.
HumanCLAW: Can Vision-Language Models Act Through a Body?비전-언어 모델은 몸을 통해 행동할 수 있는가: HumanCLAW⭐ 32
HumanCLAW는 VLM의 의사결정과 저수준 제어를 분리하는 평가 프레임워크와 1,200개 규모 HumanCLAW-Bench를 구축해, 신체를 가진 에이전트의 ‘무엇을 할지’ 지능을 보다 공정하게 측정할 수 있게 했습니다.
💡 로보틱스 쪽은 거대한 백본을 유지하면서도 실시간성·반응성·탐색 비용을 줄이는 방향이 뚜렷합니다. VLA와 월드모델이 이제는 단순히 똑똑한 표현 학습을 넘어서, 실제 제어 루프 안에서 얼마나 빠르고 직접적으로 행동하느냐가 핵심 경쟁력이 되고 있습니다.
📄Multimodal & Generative6
DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation자기회귀 비디오 증류에서 모드 커버링과 모드 시킹을 조율하는 DistillAlign⭐ 48
DistillAlign은 비디오 증류를 분포 관점에서 재설계해 precision-coverage 평가와 정렬된 초기화·DMD 목표를 도입함으로써, 시각 점수만으로는 보이지 않던 모드 붕괴를 줄이고 더 나은 학생 분포 정제를 이끌었습니다.
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System코드를 사고과정으로 쓰는 물리 일관 비디오 생성 시스템 VideoCoCo⭐ 51
VideoCoCo는 Blender 실행 코드를 process-level CoT로 사용하는 듀얼 엔진 구조를 제안해, 에이전트가 만든 시뮬레이션 초안을 생성 모델이 편집하도록 하여 물리적으로 더 일관된 텍스트-비디오 생성을 구현했습니다.
PhiZero: A World Model Built Around Physical Language물리 언어를 중심에 둔 월드모델 PhiZero⭐ 15
PhiZero는 픽셀 직접 예측 대신 self-supervised로 학습한 이산적 physical language로 미래 변화를 먼저 추론한 뒤 렌더링하는 reason-then-render 방식을 통해, 더 물리적으로 일관된 생성과 이해를 보여줍니다.
💡 비디오·월드모델 연구는 더 예쁜 결과보다 물리적 일관성, 상태 추론, 제어 가능성을 전면에 내세우고 있습니다. 코드, 물리 언어, 내부 상태, shadow pair처럼 중간 표현을 명시화해 생성 모델을 ‘설명 가능하고 조종 가능한 시뮬레이터’로 바꾸려는 흐름이 강합니다.
🗣️Language Models3
Metis: Memory Foundation Model네이티브 메모리를 품은 메모리 파운데이션 모델 Metis⭐ 35
Metis는 외부 메모리 모듈 대신 백본 내부의 지속적·동적 메모리 상태와 저장·활용 절차를 통합한 첫 memory foundation model 프로토타입으로, 메모리를 엔드투엔드 최적화 가능한 기본 능력으로 끌어올렸습니다.
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory대규모 사전학습된 파라메트릭 장기기억, Memory Decoder at Scale⭐ 6
Memory Decoder at Scale은 6.9B 메모리 모듈을 300B 토큰으로 사전학습하고 분산 Faiss 파이프라인을 결합해, Pythia-410M의 평균 점수를 29.86에서 37.34로 끌어올려 Pythia-12B를 39% 적은 총 파라미터로 앞섰습니다.
Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation고정 대화 이력을 넘어선 개인 정렬 사용자 시뮬레이션 평가, PALATE⭐ 3
PALATE는 고정 대화 이력과 획일적 루브릭 대신 개인 성향에 맞춘 LLM 사용자 시뮬레이션으로 역할극 에이전트를 평가해, 실제 다중 턴 상호작용에서 사용자 만족과 더 정렬된 벤치마킹을 제안했습니다.
💡 LLM 연구에서는 메모리를 외부 검색이 아닌 모델 고유 능력으로 내재화하려는 시도가 본격화되고 있습니다. 동시에 평가 역시 고정 정답 중심에서 벗어나, 장기기억과 개인화된 상호작용처럼 실제 사용 맥락을 반영하는 방향으로 이동하고 있습니다.
💻Code & Agents6
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering머신러닝 엔지니어링에서 재귀적 자기개선을 노리는 AI4AI 모델 Frontis-MA1⭐ 56
Frontis-MA1은 Draft·Improve·Debug·Crossover 4개 연산자를 실행 기반 SFT·RL과 장기 탐색에 통합해, 단일 RTX 4090·12시간 예산의 MLE-Bench Lite에서 Medal Average를 39.39%에서 60.61%로 높였습니다.
Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems멀티에이전트 지식 시스템의 주장 단위 출처 추적을 위한 Isnad-Rijal 프레임워크⭐ 26
이 연구는 이슬람 hadith 검증의 isnad-rijal 개념을 차용해, 멀티에이전트 지식 체인에서 주장별 전달 경로와 전송자 신뢰도를 도메인별로 등급화하는 운영 프레임워크를 제안했습니다.
Can Large Language Models Execute Parent Orders?대형 언어모델은 부모 주문을 집행할 수 있는가⭐ 9
PACE는 부모 주문 집행을 장기 계획과 단기 실행으로 나누는 계층형 프레임워크로, 별도 시장 가정이나 태스크별 학습 없이도 선전거래소 데이터에서 강한 기준선을 0.65bps 초과했습니다.
💡 에이전트 연구는 단순한 프롬프트 개선보다 환경, 인터페이스, 검증 루프를 함께 설계하는 쪽으로 진화하고 있습니다. 자기개선형 MLE, 검색 그래프, 출처 추적, 컴퓨터 사용 환경처럼 ‘에이전트가 무엇 위에서 어떻게 학습하느냐’가 성능을 좌우한다는 메시지가 분명합니다.
📄Training & Optimization1
CAST: Game Solvers as Turn-Level Teachers for LLM Agents게임 솔버를 턴 단위 교사로 쓰는 LLM 에이전트 학습, CAST⭐ 8
CAST는 게임 솔버의 상태가치 변화에서 solver advantage를 추출해 RLVR에 턴 단위 신호로 주입함으로써, Sokoban·Minesweeper·Rush Hour에서 학습 기반 기준선들을 일관되게 앞섰습니다.
💡 학습 신호 설계는 여전히 강력한 레버입니다. CAST는 최종 보상만으로 부족한 장기 과제에서, 값비싼 교사 로짓 없이도 턴 단위 가치 변화만으로 신뢰도 높은 크레딧 할당이 가능함을 보여줍니다.