오늘의 한줄

오늘은 실시간 멀티모달 추론과 에이전트 실행 효율을 끌어올리는 연구가 두드러졌습니다. 동시에 비디오 생성·편집과 에이전트 평가 프레임워크가 정교해지며, 성능 수치만이 아니라 실제 사용 비용과 신뢰성까지 따지는 흐름이 뚜렷해졌습니다.

📄Multimodal & Generative8

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation ModelMage-VL: 코덱 친화형 실시간 스트리밍 멀티모달 파운데이션 모델850

Mage-VL은 Mage-ViT로 움직임·잔차가 큰 영역만 16×16 패치 단위로 선택 인코딩해 비주얼 토큰을 75% 이상 줄이면서도, 5.6억 이미지·1억 비디오 프레임 학습으로 대규모 VLM 인코더급 성능을 달성했습니다.

Parallel Decoding Distillation for Fast Image and Video Generation병렬 디코딩 증류로 가속하는 이미지·비디오 생성881

PDD는 한 번의 네트워크 평가에서 여러 디노이징 단계를 예측하는 궤적 기반 증류로, VSD·적대 손실 없이도 사전학습 확산·플로우 모델을 빠른 이미지·비디오 생성기로 단순하고 안정적으로 압축합니다.

DistillAlign: Coordinating Mode Covering and Mode Seeking in Autoregressive Video Distillation자기회귀 비디오 증류에서 모드 커버리지와 모드 시킹을 맞추는 DistillAlign48

DistillAlign은 비주얼 점수 대신 잠재공간 precision·coverage로 학생-교사 분포를 평가해, 초기화와 DMD 정제를 모드 커버리지 관점에서 정렬해야 더 나은 비디오 증류가 가능함을 보여줍니다.

💡 멀티모달 연구는 이제 단순히 '잘 생성하는가'를 넘어 실시간성, 편집 가능성, 규칙 일관성, 평가 오염까지 함께 다루고 있습니다. 특히 비디오와 디자인처럼 구조가 중요한 영역에서 명시적 표현과 분포 정렬, 상태 추적이 핵심 경쟁력이 되고 있습니다.

💻Code & Agents7

A New Role for Relevance: Guiding Corpus Interaction in Agentic Search에이전트 검색에서 관련성의 새 역할: 코퍼스 상호작용 가이드34

RARG는 문서 관련성을 단순 top-k 선택이 아니라 ripgrep 순회와 발췌 노출 우선순위를 정하는 실행 prior로 활용해, 복잡한 질문에서 코퍼스 탐색 수렴 속도와 증거 노출 효율을 높입니다.

CodeNib: A Multi-View Data System for Serving Repository Context to Coding AgentsCodeNib: 코딩 에이전트를 위한 멀티뷰 저장소 컨텍스트 시스템20

CodeNib은 커밋별 lexical·dense·structural 뷰를 통합 제공해 저장소 탐색과 심볼 내비게이션을 재사용 가능하게 만들고, 그래프·벡터 업데이트를 중앙값 기준 8.7배·25.4배 가속했습니다.

Grading the Narrators: An Isnad-Rijal Framework for Claim-Level Provenance in Multi-Agent Knowledge Systems멀티에이전트 지식 시스템을 위한 주장 단위 출처 신뢰도 프레임워크26

이 연구는 이슬람 하디스의 isnad·rijal 개념을 차용해 멀티에이전트 지식 체인의 주장별 전송 경로와 전달자 신뢰도를 등급화하고, serve·review·quarantine 라우팅까지 연결하는 운영 프레임워크를 제시합니다.

💡 에이전트 분야는 검색·메모리·저장소 컨텍스트·신뢰도·경제성처럼 실제 운영 병목을 정면으로 다루는 방향으로 이동하고 있습니다. 성능 향상 자체보다도, 어떤 정보를 언제 꺼내고 얼마의 비용으로 믿을 수 있게 쓸 것인가가 점점 더 중요해지고 있습니다.

📄Robotics & RL4

HumanCLAW: Can Vision-Language Models Act Through a Body?HumanCLAW: 비전-언어 모델은 몸을 통해 행동할 수 있는가32

HumanCLAW는 VLM의 고수준 의사결정과 저수준 모터 실행을 분리해 평가하는 프레임워크와 1,200개 규모 HumanCLAW-Bench를 제안해, '몸을 가진' VLM의 행동 지능을 더 공정하게 측정합니다.

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAMTurboVLA: RTX 4090에서 1GB 미만 VRAM으로 32Hz를 달성한 실시간 VLA64

TurboVLA는 기존 V→L→A 대신 직접적인 V+L→A 경로와 경량 양방향 시각-언어 상호작용을 사용해, RTX 4090에서 32Hz·1GB 미만 VRAM으로 실시간 로봇 정책 추론을 구현했습니다.

CAST: Game Solvers as Turn-Level Teachers for LLM AgentsCAST: LLM 에이전트를 위한 턴 단위 게임 솔버 교사8

CAST는 게임 솔버의 상태가치 변화량을 turn-level advantage로 바꿔 RLVR에 주입함으로써, 희소한 최종 보상 대신 값싼 중간 크레딧 할당으로 Sokoban·Minesweeper·Rush Hour 성능을 끌어올렸습니다.

💡 로보틱스와 RL은 대형 모델을 그대로 키우기보다, 반응성·평가 분리·턴 단위 크레딧처럼 실행 가능한 학습 신호와 시스템 설계에 집중하고 있습니다. 결국 실제 몸과 환경 속에서는 더 큰 모델보다 더 빠른 루프와 더 정확한 피드백이 성능을 좌우한다는 흐름이 보입니다.

📄Training & Optimization1

Pass the Baton: Trajectory-Relayed On-Policy DistillationPass the Baton: 궤적 릴레이 기반 온폴리시 증류21

Relay-OPD는 학생이 잘못된 추론 접두사에 빠질 때 교사가 짧게 이어받는 릴레이 궤적으로 prefix failure를 완화해, 별도 라벨 없이 작은 Qwen 모델의 온폴리시 증류 효율을 높입니다.

💡 증류 연구는 학생의 실제 실패 궤적을 어떻게 교정할지에 초점을 옮기고 있습니다. 단순 모방보다, 실패 지점에만 교사가 개입하는 선택적 감독이 소형 모델 학습 효율을 높이는 실용적 해법으로 보입니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택