오늘의 한줄
오늘은 에이전트와 월드모델이 더 빠르고, 더 물리적으로 일관되며, 더 스스로 개선하는 방향으로 진화하고 있음을 보여주는 논문들이 두드러졌습니다. 특히 메모리 내재화, 실행 가능한 중간표현, 그리고 검색·게임·컴퓨터 사용 환경을 재설계하는 흐름이 실무적으로 인상적입니다.
📄Robotics & RL5
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM1GB 미만 VRAM으로 32Hz를 달성한 실시간 비전-언어-행동 모델⭐ 64
TurboVLA는 기존 V→L→A 경로를 직접 V+L→A로 바꿔 경량 양방향 상호작용과 소형 디코더만으로 RTX 4090에서 32Hz, 1GB 미만 VRAM의 실시간 로봇 제어를 가능하게 했습니다.
INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models탐색 없는 월드모델을 위한 동형적 의도-행동 학습 INTACT⭐ 56
INTACT는 보상 없는 궤적에서 물리적 의도를 학습해 테스트타임 검색 없이 목표 변화에 대응하는 intent-to-action 인터페이스를 구축한 JEPA 기반 월드모델입니다.
HumanCLAW: Can Vision-Language Models Act Through a Body?비전-언어 모델은 몸을 통해 행동할 수 있는가: HumanCLAW⭐ 32
HumanCLAW는 VLM의 의사결정과 저수준 제어를 분리해 전신 행동의 실행 실패를 걷어내고, 1,200개 이상 과제로 신체를 통한 액션 지능 자체를 측정하는 평가 프레임워크를 제안했습니다.
💡 로보틱스 쪽은 더 큰 모델보다 더 빠른 제어 루프와 더 정확한 행동 인터페이스로 무게중심이 옮겨가고 있습니다. 실시간성(TurboVLA, πR^2), 검색 없는 의도-행동 매핑(INTACT), 그리고 의사결정 자체를 분리 평가하는 벤치마크(HumanCLAW, CAST)가 함께 성숙해지는 흐름입니다.
📄Multimodal & Generative6
DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation자기회귀 비디오 증류에서 모드 커버링과 모드 시킹을 정렬하는 DistillAlign⭐ 48
DistillAlign은 비디오 증류를 분포 관점에서 재설계해 precision·coverage 평가와 정렬된 초기화 전략으로 DMD 기반 파이프라인의 숨은 분포 불일치를 줄였습니다.
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System코드를 사고사슬로 쓰는 물리 일관 비디오 생성 시스템 VideoCoCo⭐ 51
VideoCoCo는 Blender 실행 코드를 CoT로 사용하는 듀얼 엔진 구조로, 코딩 에이전트가 만든 시뮬레이션 초안을 생성 모델이 편집하게 해 물리적으로 더 일관된 텍스트-비디오 생성을 구현했습니다.
PhiZero: A World Model Built Around Physical Language물리 언어를 중심으로 구축한 월드모델 PhiZero⭐ 15
PhiZero는 비디오 픽셀 대신 세계 상태 전이를 나타내는 이산적 물리 언어를 자기지도 학습해, 먼저 추론하고 나중에 렌더링하는 방식으로 물리적으로 더 일관된 미래 예측을 수행합니다.
💡 멀티모달 생성은 이제 단순히 보기 좋은 결과보다 물리·규칙·참조 일관성을 명시적으로 모델링하는 방향으로 진화하고 있습니다. 코드, 물리 언어, 상태 변수, shadow pair처럼 실행 가능하거나 구조화된 중간표현이 품질의 핵심이 되고 있습니다.
🗣️Language Models2
Metis: Memory Foundation Model네이티브 메모리를 갖춘 메모리 파운데이션 모델 Metis⭐ 35
Metis는 외부 메모리 모듈 대신 백본 내부의 지속·진화형 메모리 상태와 저장·활용 절차를 내재화한 첫 메모리 파운데이션 모델 프로토타입을 제시했습니다.
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory대규모 사전학습된 파라메트릭 장기 메모리, Memory Decoder at Scale⭐ 6
Memory Decoder at Scale은 300B 토큰과 최대 6.9B 규모로 메모리 모듈을 확장해, Pythia-410M+메모리 조합이 평균 37.34점으로 Pythia-12B를 39% 적은 총 파라미터로 넘어섰습니다.
💡 언어모델 연구에서는 메모리를 외부 RAG로 붙이는 대신 모델 내부의 독립적이고 확장 가능한 능력으로 재정의하려는 시도가 눈에 띕니다. Metis와 Memory Decoder는 장기 기억을 추론과 분리해 더 효율적으로 키우는 설계가 다음 경쟁축임을 시사합니다.
💻Code & Agents7
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering머신러닝 엔지니어링에서 재귀적 자기개선을 향한 AI4AI 모델 Frontis-MA1⭐ 56
Frontis-MA1은 Draft·Improve·Debug·Crossover 연산자를 학습·탐색 루프에 통합해 MLE-Bench Lite의 Medal Average를 39.39%에서 60.61%로 끌어올리며 RSI 가능성을 보여줬습니다.
Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems멀티에이전트 지식 시스템의 주장 단위 출처 신뢰도를 위한 Isnad-Rijal 프레임워크⭐ 26
이 논문은 하디스 전승학의 isnad·rijal 개념을 차용해 멀티에이전트 지식 시스템에서 주장별 전송 체인과 전달자 신뢰도를 등급화하는 운영 프레임워크를 제안했습니다.
Can Large Language Models Execute Parent Orders?대형언어모델은 부모 주문을 집행할 수 있는가⭐ 9
PACE는 부모 주문 집행을 장기 계획과 단기 실행으로 나누는 계층형 프레임워크로, 별도 학습 없이도 심천 거래소 데이터에서 강한 기준선보다 0.65bps 높은 성능을 보였습니다.
💡 에이전트 연구는 더 나은 프롬프트보다 더 나은 학습 루프와 환경 설계로 승부하는 국면입니다. 자기개선(Frontis-MA1), 과제 간 스킬 축적(SkillRise), 검색 인터페이스 재설계(Harness-G), 평가·출처·환경 공진화(PALATE, Isnad, Echoverse)까지 전반적으로 시스템 수준의 정교화가 진행되고 있습니다.