오늘의 한줄

오늘은 초대형 MoE 언어모델, 실시간 멀티모달 처리, 그리고 에이전트 학습·컨텍스트 관리처럼 시스템 수준의 AI 연구가 두드러졌습니다. 동시에 로보틱스·과학 설계·크리에이티브 워크플로까지 확장되며, 모델 성능 경쟁이 실제 사용 시나리오와 운영 효율 최적화로 빠르게 이동하고 있음을 보여줍니다.

🗣️Language Models3

Kimi K3: Open Frontier IntelligenceKimi K3: 오픈 프런티어 지능 모델3,260

Kimi K3는 2.8T 규모 MoE에 100만 토큰 컨텍스트와 네이티브 비전을 결합하고 Kimi Delta Attention·Stable LatentMoE로 K2 대비 전체 스케일링 효율을 약 2.5배 높인 초대형 오픈 모델입니다.

DataPrep-Bench: Benchmarking LLMs as Training Data PreparatorsDataPrep-Bench: 학습 데이터 준비자로서의 LLM 벤치마크221

DataPrep-Bench는 데이터 구성과 품질 평가를 하나의 다운스트림 중심 프로토콜로 묶어, LLM·에이전트가 실제로 얼마나 좋은 학습 데이터를 만드는지 6개 도메인에서 처음 통합 평가합니다.

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving SkillsSkill Self-Play: 공진화 스킬로 LLM 능력을 확장하기18

Skill-SP는 proposer·solver·dynamic skill controller를 RL 루프로 함께 진화시켜, 과제 다양성과 검증 신뢰성의 딜레마를 스킬 단위 자기대전으로 완화하는 LLM 자기진화 프레임워크입니다.

💡 언어모델 연구는 이제 단순 파라미터 확장보다 긴 컨텍스트, 자기진화 학습, 데이터 준비 능력처럼 실제 활용 성능을 좌우하는 축으로 이동하고 있습니다. 특히 모델 자체의 지능뿐 아니라 어떤 데이터와 훈련 루프로 능력을 끌어올릴지에 대한 관심이 빠르게 커지고 있습니다.

📄Multimodal & Generative6

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation ModelMage-VL: 코덱 네이티브 스트리밍 멀티모달 파운데이션 모델850

Mage-VL은 Mage-ViT로 움직임·잔차가 큰 영역만 선택적으로 토큰화해 비주얼 토큰 사용량을 75% 이상 줄이면서도 실시간 스트리밍 이해 성능을 유지한 효율형 멀티모달 모델입니다.

Parallel Decoding Distillation for Fast Image and Video Generation병렬 디코딩 증류로 가속하는 이미지·비디오 생성881

PDD는 한 번의 네트워크 평가에서 여러 디노이징 단계를 예측하는 궤적 기반 증류로, VSD·적대 손실 없이도 사전학습된 확산·플로우 모델을 소수 스텝 고속 생성기로 단순하고 안정적으로 압축합니다.

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint GenerationOmniVAE: 공동 생성을 위한 교차모달 정렬 오디오-비디오 VAE52

OmniVAE는 오디오·비디오 잠재공간을 공동 학습하고 세그먼트 단위 대조 학습으로 정렬해, downstream 생성기가 동기화를 처음부터 배우지 않아도 되도록 만든 공동 생성용 AV VAE입니다.

💡 멀티모달·생성 분야는 더 적은 토큰과 더 적은 샘플링 스텝으로도 강한 성능을 내는 효율화와, 모달 간 정렬을 구조적으로 내장하는 방향이 뚜렷합니다. 동시에 any-to-any, 오디오-비디오 공동 생성, 과학 설계처럼 생성 모델의 적용 범위가 빠르게 넓어지고 있습니다.

👁️Computer Vision2

GNM Head: A Generative aNthropometric Model of the human headGNM Head: 인간 두부를 위한 생성형 인체계측 모델1,237

GNM Head는 눈알·치아·혀까지 포함한 고해상도 3D 두부 파라메트릭 모델을 제안해, 기존 공개 모델보다 해부학적 범위와 기하 품질을 크게 확장한 생성·재구성용 기반 표현을 제공합니다.

ReDesign: Recovering Editable Design Structures from Images via Agentic DecompositionReDesign: 에이전트 분해로 이미지에서 편집 가능한 디자인 구조 복원하기15

ReDesign은 typography·벡터·색상·레이어를 전문 도구 조합으로 복원하고 graceful verification으로 오류 누적을 막아, 909개 Figma 파일 기반 Edit Replay Benchmark에서 높은 편집 가능성을 달성했습니다.

💡 비전 연구는 단순 인식 정확도보다 편집 가능 구조 복원이나 고충실도 3D 인체 표현처럼 다운스트림 제작·제어 가능성을 높이는 표현 학습으로 확장되고 있습니다. 즉, 픽셀을 잘 맞추는 것을 넘어 사람이 다시 쓰고 조작할 수 있는 형태로 복원하는 것이 중요해지고 있습니다.

📄Robotics & RL3

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement LearningMolt: 에이전트 강화학습을 위한 확장형 PyTorch 네이티브 프레임워크647

Molt는 연구자가 엔드투엔드로 추적·수정할 수 있는 경량 PyTorch 기반 에이전트 RL 프레임워크로, 완전 비동기 학습에서도 Megatron 기반 SOTA 스택과 통계적으로 유사한 성능을 보였습니다.

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey로봇 학습을 위한 진행 보상 모델링 종합 서베이44

이 서베이는 로봇 학습의 progress reward 연구를 입력·목표·출력·감독·평가 축으로 재정리해, 중간 피드백 설계가 과제 성공 신호만으로는 부족한 로봇 학습의 핵심 병목임을 체계적으로 보여줍니다.

Data Pyramid for Embodied Manipulation구현형 조작을 위한 데이터 피라미드62

Data Pyramid는 실로봇·UMI·시점 비디오·시뮬레이션·일반 VLM 데이터를 확장성 대 정합성 관점의 5층 구조로 정리해, embodied foundation model의 성능이 데이터 혼합 전략에 크게 좌우됨을 설명합니다.

💡 로보틱스·RL에서는 알고리즘 자체만큼 데이터 구성, 보상 설계, 실험 프레임워크가 성능 병목으로 부상하고 있습니다. 이는 embodied AI가 이제 모델 아키텍처 경쟁을 넘어 학습 신호와 데이터 파이프라인의 공학으로 이동하고 있음을 시사합니다.

💻Code & Agents5

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative AgentsJarvisHub: 캔버스 네이티브 멀티모달 크리에이티브 에이전트 오픈 하니스76

JarvisHub는 초안·수정·버전 관계·도구 실행을 캔버스 상태로 유지하며 장기 창작 과정을 연구할 수 있게 한 오픈 하니스로, 폐쇄형 크리에이티브 에이전트 시스템을 대체할 실험 기반을 제공합니다.

A New Role for Relevance: Guiding Corpus Interaction in Agentic Search에이전트 검색에서 관련도를 코퍼스 상호작용에 활용하는 새로운 방식34

RARG는 관련도를 단순 top-k 필터가 아니라 ripgrep 탐색 순서와 발췌 우선순위를 정하는 실행 prior로 써서, 복잡한 질의에서 DCI 기반 검색 에이전트의 수렴 속도와 증거 노출 효율을 높입니다.

Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems에이전트 컨텍스트 관리: 메모리와 비용을 생애주기·아키텍처 문제로 풀기50

이 연구는 에이전트 메모리 문제를 단순 검색이 아닌 기억·구조화·망각·예측·압축의 생애주기 관리로 재정의해, 운영 환경에서 토큰 비용과 회상 실패를 함께 줄이는 아키텍처 관점을 제시합니다.

💡 에이전트 연구는 검색, 메모리, 저장소 컨텍스트, 창작 상태 관리처럼 '무엇을 언제 컨텍스트에 올릴 것인가'를 핵심 문제로 다루기 시작했습니다. 좋은 추론 능력만으로는 부족하고, 장기 작업을 안정적으로 수행하게 만드는 정보 운영체제가 점점 더 중요해지고 있습니다.

📄Training & Optimization1

Pass the Baton: Trajectory-Relayed On-Policy DistillationPass the Baton: 궤적 릴레이 기반 온폴리시 증류21

Relay-OPD는 학생 모델이 잘못된 추론 접두사에 들어가면 교사가 잠시 이어받는 릴레이 궤적으로 prefix failure를 완화해, 라벨 없이도 온폴리시 증류의 감독 품질과 계산 효율을 높입니다.

💡 훈련 최적화는 학생 모델의 실제 실패 궤적을 더 잘 활용하는 방향으로 정교해지고 있습니다. 특히 Relay-OPD처럼 잘못된 추론 접두사에 선택적으로 개입하는 방식은, 적은 비용으로 증류 품질을 높이는 실전형 접근으로 보입니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택