오늘의 한줄

오늘은 에이전트와 월드모델이 더 빠르고, 더 물리적으로 일관되며, 더 스스로 개선하는 방향으로 진화하고 있음을 보여주는 논문들이 두드러졌습니다. 특히 메모리 내재화, 실행 가능한 중간표현, 그리고 검색·게임·컴퓨터 사용 환경을 재설계하는 흐름이 실무적으로 인상적입니다.

📄Robotics & RL5

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM1GB 미만 VRAM으로 32Hz를 달성한 실시간 비전-언어-행동 모델64

TurboVLA는 기존 V→L→A 경로를 직접 V+L→A로 바꿔 경량 양방향 상호작용과 소형 디코더만으로 RTX 4090에서 32Hz, 1GB 미만 VRAM의 실시간 로봇 제어를 가능하게 했습니다.

INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models탐색 없는 월드모델을 위한 동형적 의도-행동 학습 INTACT56

INTACT는 보상 없는 궤적에서 물리적 의도를 학습해 테스트타임 검색 없이 목표 변화에 대응하는 intent-to-action 인터페이스를 구축한 JEPA 기반 월드모델입니다.

HumanCLAW: Can Vision-Language Models Act Through a Body?비전-언어 모델은 몸을 통해 행동할 수 있는가: HumanCLAW32

HumanCLAW는 VLM의 의사결정과 저수준 제어를 분리해 전신 행동의 실행 실패를 걷어내고, 1,200개 이상 과제로 신체를 통한 액션 지능 자체를 측정하는 평가 프레임워크를 제안했습니다.

💡 로보틱스 쪽은 더 큰 모델보다 더 빠른 제어 루프와 더 정확한 행동 인터페이스로 무게중심이 옮겨가고 있습니다. 실시간성(TurboVLA, πR^2), 검색 없는 의도-행동 매핑(INTACT), 그리고 의사결정 자체를 분리 평가하는 벤치마크(HumanCLAW, CAST)가 함께 성숙해지는 흐름입니다.

📄Multimodal & Generative6

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation자기회귀 비디오 증류에서 모드 커버링과 모드 시킹을 정렬하는 DistillAlign48

DistillAlign은 비디오 증류를 분포 관점에서 재설계해 precision·coverage 평가와 정렬된 초기화 전략으로 DMD 기반 파이프라인의 숨은 분포 불일치를 줄였습니다.

VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System코드를 사고사슬로 쓰는 물리 일관 비디오 생성 시스템 VideoCoCo51

VideoCoCo는 Blender 실행 코드를 CoT로 사용하는 듀얼 엔진 구조로, 코딩 에이전트가 만든 시뮬레이션 초안을 생성 모델이 편집하게 해 물리적으로 더 일관된 텍스트-비디오 생성을 구현했습니다.

PhiZero: A World Model Built Around Physical Language물리 언어를 중심으로 구축한 월드모델 PhiZero15

PhiZero는 비디오 픽셀 대신 세계 상태 전이를 나타내는 이산적 물리 언어를 자기지도 학습해, 먼저 추론하고 나중에 렌더링하는 방식으로 물리적으로 더 일관된 미래 예측을 수행합니다.

💡 멀티모달 생성은 이제 단순히 보기 좋은 결과보다 물리·규칙·참조 일관성을 명시적으로 모델링하는 방향으로 진화하고 있습니다. 코드, 물리 언어, 상태 변수, shadow pair처럼 실행 가능하거나 구조화된 중간표현이 품질의 핵심이 되고 있습니다.

🗣️Language Models2

Metis: Memory Foundation Model네이티브 메모리를 갖춘 메모리 파운데이션 모델 Metis35

Metis는 외부 메모리 모듈 대신 백본 내부의 지속·진화형 메모리 상태와 저장·활용 절차를 내재화한 첫 메모리 파운데이션 모델 프로토타입을 제시했습니다.

Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory대규모 사전학습된 파라메트릭 장기 메모리, Memory Decoder at Scale6

Memory Decoder at Scale은 300B 토큰과 최대 6.9B 규모로 메모리 모듈을 확장해, Pythia-410M+메모리 조합이 평균 37.34점으로 Pythia-12B를 39% 적은 총 파라미터로 넘어섰습니다.

💡 언어모델 연구에서는 메모리를 외부 RAG로 붙이는 대신 모델 내부의 독립적이고 확장 가능한 능력으로 재정의하려는 시도가 눈에 띕니다. Metis와 Memory Decoder는 장기 기억을 추론과 분리해 더 효율적으로 키우는 설계가 다음 경쟁축임을 시사합니다.

💻Code & Agents7

Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering머신러닝 엔지니어링에서 재귀적 자기개선을 향한 AI4AI 모델 Frontis-MA156

Frontis-MA1은 Draft·Improve·Debug·Crossover 연산자를 학습·탐색 루프에 통합해 MLE-Bench Lite의 Medal Average를 39.39%에서 60.61%로 끌어올리며 RSI 가능성을 보여줬습니다.

Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems멀티에이전트 지식 시스템의 주장 단위 출처 신뢰도를 위한 Isnad-Rijal 프레임워크26

이 논문은 하디스 전승학의 isnad·rijal 개념을 차용해 멀티에이전트 지식 시스템에서 주장별 전송 체인과 전달자 신뢰도를 등급화하는 운영 프레임워크를 제안했습니다.

Can Large Language Models Execute Parent Orders?대형언어모델은 부모 주문을 집행할 수 있는가9

PACE는 부모 주문 집행을 장기 계획과 단기 실행으로 나누는 계층형 프레임워크로, 별도 학습 없이도 심천 거래소 데이터에서 강한 기준선보다 0.65bps 높은 성능을 보였습니다.

💡 에이전트 연구는 더 나은 프롬프트보다 더 나은 학습 루프와 환경 설계로 승부하는 국면입니다. 자기개선(Frontis-MA1), 과제 간 스킬 축적(SkillRise), 검색 인터페이스 재설계(Harness-G), 평가·출처·환경 공진화(PALATE, Isnad, Echoverse)까지 전반적으로 시스템 수준의 정교화가 진행되고 있습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택