오늘의 한줄
오늘은 모델이 더 빠르게 행동하고, 더 오래 기억하며, 더 정교한 환경에서 스스로 학습하는 방향의 연구가 두드러졌습니다. 특히 로보틱스·월드모델·에이전트 학습에서 추론 비용을 줄이면서도 제어 가능성과 평가 가능성을 높이려는 시도가 인상적입니다.
📄Robotics & RL4
TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM1GB 미만 VRAM으로 RTX 4090에서 32Hz를 달성한 실시간 비전-언어-액션 모델 TurboVLA⭐ 64
TurboVLA는 기존 V→L→A 구조 대신 경량 양방향 비전-언어 상호작용을 갖춘 직접 V+L→A 매핑으로 바꿔, RTX 4090에서 1GB 미만 VRAM으로 32Hz 실시간 로봇 제어를 가능하게 했습니다.
INTACT: Isomorphic Intent-to-Action Learning for Search-Free World Models검색 없는 월드모델을 위한 동형적 의도-행동 학습 INTACT⭐ 56
INTACT는 보상 없는 궤적에서 물리적 의도를 JEPA로 학습해 목표 변화에서 행동을 역추론하는 검색 과정을 제거하고, 의도에서 즉시 행동으로 연결되는 월드모델 인터페이스를 제시했습니다.
HumanCLAW: Can Vision-Language Models Act Through a Body?비전-언어 모델은 몸을 통해 행동할 수 있을까? HumanCLAW⭐ 32
HumanCLAW는 VLM의 의사결정과 저수준 모터 제어를 분리하는 평가 프레임워크와 1,200개 규모 HumanCLAW-Bench를 제안해, 신체를 가진 에이전트의 순수 행동 지능을 측정할 수 있게 했습니다.
💡 로보틱스는 거대 모델을 그대로 쓰기보다 실시간성·반응성·평가 가능성을 확보하는 방향으로 빠르게 이동하고 있습니다. TurboVLA, INTACT, πR², HumanCLAW는 각각 추론 경로 단순화, 검색 제거, 폐루프 반응성, 의사결정 평가 분리를 통해 실제 배치 가능성을 높였습니다.
📄Multimodal & Generative5
DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation자기회귀 비디오 증류에서 모드 커버링과 모드 시킹을 조율하는 DistillAlign⭐ 48
DistillAlign은 비디오 증류를 분포 관점에서 재설계해 precision·coverage 평가와 정렬된 초기화 전략으로 DMD 기반 학생 모델의 모드 붕괴를 줄이고 더 나은 정제를 이끌었습니다.
VideoCoCo: Code-as-CoT for Physically-Consistent Video Generation via an Agentic Dual-Engine System에이전트형 듀얼 엔진으로 물리 일관적 영상을 만드는 코드 기반 사고사슬 VideoCoCo⭐ 51
VideoCoCo는 텍스트 프롬프트를 Blender 실행 코드로 바꾸는 coding agent와 생성 비디오 엔진을 결합해, 실행 가능한 Code-as-CoT로 물리적으로 더 일관된 영상 생성을 구현했습니다.
PhiZero: A World Model Built Around Physical Language물리 언어를 중심에 둔 월드모델 PhiZero⭐ 15
PhiZero는 픽셀 직접 예측 대신 자기지도 학습한 이산적 '물리 언어'로 미래 전이를 먼저 추론한 뒤 영상을 렌더링하는 reason-then-render 구조로 물리 일관성을 높였습니다.
💡 비디오·월드모델 연구는 이제 단순히 그럴듯한 픽셀을 만드는 것을 넘어, 물리 법칙·게임 규칙·행동 제어 가능성을 명시적으로 모델링하는 쪽으로 진화하고 있습니다. 코드, 물리 언어, 상태 변수, shadow pair처럼 중간 구조를 도입해 생성의 해석 가능성과 제어성을 함께 챙기려는 흐름이 뚜렷합니다.
🗣️Language Models3
Metis: Memory Foundation Model메모리를 본체에 내장한 파운데이션 모델 Metis⭐ 35
Metis는 외부 메모리 모듈 대신 백본 내부의 지속적·동적 메모리 상태와 저장·활용 절차를 정의한 첫 메모리 파운데이션 모델로, 메모리를 네이티브 능력으로 통합했습니다.
Memory Decoder at Scale: A Pretrained, Parametric Long-Term Memory사전학습된 파라메트릭 장기기억을 대규모로 확장한 Memory Decoder⭐ 6
Memory Decoder at Scale은 6.9B 메모리 모듈과 300B 토큰 사전학습, 분산 Faiss 파이프라인으로 17개 벤치 평균을 29.86에서 37.34로 높여 Pythia-12B를 39% 적은 총 파라미터로 넘어섰습니다.
Beyond Borrowed Histories: Person-Aligned User Simulation for Interactive Role-Playing Evaluation빌려온 대화 이력을 넘어선 사용자 정렬형 롤플레잉 평가 PALATE⭐ 3
PALATE는 고정 대화 이력·고정 루브릭 대신 개인화된 시뮬레이션 사용자와 맞춤 평가를 도입해, 롤플레잉 에이전트의 실제 다중 턴 사용자 만족도를 더 타당하게 측정합니다.
💡 LLM 연구에서는 메모리를 외부 도구가 아니라 모델의 본체 능력으로 흡수하려는 시도가 본격화되고 있습니다. 동시에 PALATE처럼 사용자 정렬 평가를 강화하는 연구가 늘면서, 앞으로는 '무엇을 기억하느냐'와 '누구를 위해 잘하느냐'가 함께 핵심 축이 될 것으로 보입니다.
💻Code & Agents6
Frontis-MA1: Training an AI4AI Model towards Recursive Self-Improvement in Machine Learning Engineering머신러닝 엔지니어링에서 재귀적 자기개선을 노리는 AI4AI 모델 Frontis-MA1⭐ 56
Frontis-MA1은 Draft·Improve·Debug·Crossover 4개 연산자를 실행 기반 SFT·RL로 학습해 MLE-Bench Lite에서 Medal Average를 39.39%에서 60.61%로 끌어올렸습니다.
Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems멀티에이전트 지식 시스템의 주장 단위 출처성을 위한 Isnad-Rijal 프레임워크⭐ 26
이 연구는 하디스 전승 평가에서 착안한 Isnad-Rijal 프레임워크로 멀티에이전트 지식 체인의 주장별 provenance와 전송자 신뢰도를 등급화해 검토·격리 라우팅까지 연결합니다.
Can Large Language Models Execute Parent Orders?대형언어모델은 부모 주문을 집행할 수 있을까?⭐ 9
PACE는 부모 주문 집행을 장기 계획과 단기 실행으로 나누는 계층형 LLM 프레임워크로, 별도 태스크 학습 없이도 선전거래소 데이터에서 강한 기준선보다 0.65bps 높은 성능을 보였습니다.
💡 에이전트 연구는 더 깊은 환경, 더 긴 시간축, 더 구조화된 학습 인터페이스를 통해 실제 문제 해결력을 높이는 방향으로 가고 있습니다. Frontis-MA1, SkillRise, Harness-G, Echoverse는 실행 피드백·스킬 축적·행동 공간 재설계·환경 공동진화가 에이전트 성능 향상의 핵심 레버임을 보여줍니다.
📄Training & Optimization1
CAST: Game Solvers as Turn-Level Teachers for LLM AgentsLLM 에이전트를 위한 턴 단위 교사로서의 게임 솔버 CAST⭐ 8
CAST는 솔버의 상태가치 변화에서 turn-level advantage를 뽑아 RLVR에 주입함으로써, 값 하나만으로도 솔버 증류와 동등한 학습 신호를 제공해 Sokoban·Minesweeper·Rush Hour에서 성능을 높였습니다.
💡 학습 신호 측면에서는 희소한 최종 보상만으로는 긴 의사결정 과정을 제대로 가르치기 어렵다는 문제의식이 분명합니다. CAST는 외부 솔버의 가치 변화를 값 기반 교사 신호로 바꿔, 저렴하면서도 정교한 중간 크레딧 설계가 앞으로 더 중요해질 것임을 시사합니다.
👁️Computer Vision1
RefCaptioner: Multi-Reference Image-Grounded Video Captioning다중 참조 이미지 기반 비디오 캡셔닝 RefCaptioner⭐ 3
RefCaptioner는 2만 개 비디오·17만1354장 참조 이미지 데이터와 Hierarchical Coverage-Discounted GRPO를 활용해, 구문 단위 grounding이 필요한 새 과제에서 오픈소스 최고 성능을 달성했습니다.
💡 비전 쪽에서는 단순 캡셔닝을 넘어, 여러 참조 이미지와 문구 단위 정합성을 함께 요구하는 더 어려운 grounded generation 과제가 부상하고 있습니다. 실제 응용에서는 '잘 설명하는가'보다 '정확히 무엇을 가리키는가'가 점점 더 중요해지고 있습니다.