오늘의 한줄

오늘은 초장문 컨텍스트 LLM, 에이전트 학습·평가·메모리 관리, 그리고 멀티모달 생성 품질을 끌어올리는 벤치마크와 표현 학습이 두드러졌습니다. 특히 모델 자체의 규모 경쟁을 넘어 데이터 준비, 컨텍스트 운영, 평가 자동화처럼 실제 운영 병목을 푸는 연구가 빠르게 전면으로 올라오고 있습니다.

🗣️Language Models3

Kimi K3: Open Frontier IntelligenceKimi K3: 오픈 프런티어 지능 모델3,260

Kimi K3는 2.8T MoE에 100만 토큰 컨텍스트와 네이티브 비전을 결합하고 KDA·Stable LatentMoE로 K2 대비 전체 스케일링 효율을 약 2.5배 높여, 장기 에이전트 실행과 코딩·추론 성능을 함께 확장했습니다.

Skill Self-Play: Pushing the Frontier of LLM Capability with Co-Evolving SkillsSkill Self-Play: 공진화 스킬로 LLM 능력 확장하기18

Skill-SP는 proposer·solver·dynamic skill controller를 묶은 자기대전 RL 루프로, 검증 가능한 스킬 실행과 열린 과제 다양성을 동시에 확보해 기존 self-evolution의 보상 오염 문제를 줄입니다.

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation멀티턴 장기 계획의 물리학: 사전학습부터 다중 교사 온폴리시 에이전트 증류까지5

이 연구는 통제된 멀티턴 환경에서 장기 계획 능력의 형성 과정을 추적하며, CoT 상태 전이 기반 월드모델과 소량의 장기 데이터, 그리고 단일·다중 교사 온폴리시 증류가 조합적 일반화와 계획 안정성에 핵심임을 보였습니다.

💡 언어모델 연구는 이제 단순 파라미터 확장보다 장기 계획, 자기진화, 초장문 컨텍스트처럼 실제 에이전트 활용 조건을 어떻게 학습시키느냐로 무게중심이 옮겨가고 있습니다. 특히 사전학습 데이터 구성과 RL·증류 후처리의 역할을 분해해 보는 흐름이 강해졌습니다.

👁️Computer Vision2

GNM Head: A Generative aNthropometric Model of the human headGNM Head: 사람 머리를 위한 생성형 인체계측 모델1,237

GNM은 고해상도 3D 스캔과 아티스트 제작 해부 샘플을 바탕으로 얼굴뿐 아니라 목·안구·치아·혀까지 포함한 고품질 파라메트릭 머리 모델을 제안해, 생성형 비전 모델의 정밀한 공간 제어와 재구성 품질을 끌어올립니다.

dRAE: Representation Autoencoder with Hyper-Spherical CodesdRAE: 초구면 코드 기반 표현 오토인코더3

dRAE는 의미와 크기를 분리하는 Hyper-Spherical Quantization으로 코드북 붕괴를 줄여, 고차원 시각 표현을 의미 보존형 이산 코드로 확장 가능하게 압축하며 언어모델과의 연결에 유리한 표현 기반을 마련했습니다.

💡 비전 분야에서는 더 정교한 3D/구조 표현과 의미 보존형 이산화가 핵심 축으로 보입니다. 생성 제어와 언어모델 결합을 위해, 시각 표현 자체를 더 해부학적이고 더 압축 친화적으로 재설계하는 방향이 뚜렷합니다.

📄Robotics & RL3

Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement LearningMolt: 에이전트 강화학습을 위한 확장형 PyTorch 네이티브 학습 프레임워크647

Molt는 연구자가 RL 파이프라인 전체를 쉽게 수정할 수 있도록 설계된 경량 PyTorch 네이티브 프레임워크로, 완전 비동기 프로토콜에서 SOTA급 Megatron 스택과 통계적으로 유사한 성능을 유지합니다.

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey로보틱 학습을 위한 진행 보상 모델링: 종합 서베이44

이 서베이는 로봇 진행 보상 모델을 입력 정보, 목표 정의, 출력 신호, 감독 방식, 평가 프로토콜의 공통 틀로 정리해, 중간 피드백 기반 로봇 학습 연구를 비교 가능하게 만드는 기준점을 제공합니다.

Data Pyramid for Embodied Manipulation구현형 조작을 위한 데이터 피라미드62

Data Pyramid는 실로봇·UMI·시점 영상·시뮬레이션·일반 비전언어 데이터를 확장성과 로봇 정렬성의 긴장 관계로 체계화해, 구현형 파운데이션 모델의 데이터 레시피를 설계하는 실전 프레임워크를 제시합니다.

💡 로보틱스와 RL은 이제 알고리즘 자체만큼 데이터 레시피, 보상 설계, 연구 프레임워크의 생산성이 중요해졌습니다. 결국 구현형 지능의 성능은 더 좋은 정책뿐 아니라 어떤 데이터와 중간 피드백, 어떤 실험 인프라 위에서 학습하느냐에 달려 있다는 점을 보여줍니다.

📄Training & Optimization2

DataPrep-Bench: Benchmarking LLMs as Training Data PreparatorsDataPrep-Bench: 학습 데이터 준비자로서의 LLM 벤치마크221

DataPrep-Bench는 데이터 구성과 데이터 품질 평가를 하나의 다운스트림 중심 프로토콜로 묶은 첫 통합 벤치마크로, LLM·에이전트 기반 데이터 준비가 실제 파인튜닝 성능에 얼마나 기여하는지 6개 도메인에서 직접 측정합니다.

Codifying the Judge: Scalable Evaluation via Program Distillation판정자를 코드로: 프로그램 증류 기반 확장형 평가11

PAJAMA는 LLM 판정기의 의사결정을 프로그램 위원회로 증류하고 저신뢰 사례만 LLM으로 에스컬레이션해, 5개 데이터셋에서 13B급 LLM judge 수준 성능을 더 낮은 비용·지연과 높은 투명성으로 달성했습니다.

💡 학습 최적화 영역에서는 모델을 더 크게 만드는 대신 데이터 준비와 평가 비용을 체계적으로 줄이는 연구가 눈에 띕니다. 실제로는 좋은 데이터 생성과 저비용·고투명 평가가 모델 개선 속도를 좌우한다는 인식이 강해지고 있습니다.

💻Code & Agents4

JarvisHub: An Open Harness for Canvas-Native Multimodal Creative AgentsJarvisHub: 캔버스 네이티브 멀티모달 크리에이티브 에이전트 오픈 하네스76

JarvisHub는 대화 로그가 아닌 캔버스 기반 프로젝트 상태를 중심으로 참조·초안·수정·실패 복구를 추적하는 오픈 하네스를 제안해, 장기 멀티모달 창작 에이전트의 도구 사용과 일관성 유지 연구를 가능하게 합니다.

Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems에이전트 컨텍스트 관리: 메모리와 비용을 생애주기·아키텍처 문제로 풀기50

이 연구는 에이전트 메모리 문제를 단순 검색이 아니라 기억·구조화·망각·예측·압축을 포함한 생애주기와 조직 단위 아키텍처 문제로 재정의해, 장기 대화에서의 토큰 비용과 회상 실패를 함께 줄이는 설계 관점을 제시합니다.

SceneActBench: Can Agents Act on the 3D Scenes They See?SceneActBench: 에이전트는 자신이 본 3D 장면에서 행동할 수 있는가6

SceneActBench는 5개 3D 작업, 520개 사례, 통일된 agent-environment loop로 VLM 에이전트의 장면 기반 행동을 평가하며, 11개 상용 설정이 전체 점수 38.6~50.2에 머물러 실제 3D 행동 능력의 큰 격차를 드러냈습니다.

💡 에이전트 연구는 이제 프롬프트 기교보다 상태 관리, 장면 행동, 아이디어 탐색처럼 실행 루프 전체를 설계하는 문제로 확장되고 있습니다. 메모리 구조와 평가 하네스가 좋아질수록 에이전트의 장기 일관성과 실전 유용성이 함께 올라간다는 메시지가 선명합니다.

📄Multimodal & Generative6

OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint GenerationOmniVAE: 공동 생성을 위한 교차 모달 정렬 오디오-비디오 VAE52

OmniVAE는 세그먼트 단위 대조 학습과 모달별 의미 인코더 증류를 통해 오디오·비디오 잠재공간을 공동 정렬하는 VAE로, 다운스트림 생성기가 동기화 학습을 처음부터 다시 하지 않아도 정밀한 시청각 대응을 얻도록 돕습니다.

Three-Body Scattering for Generative Modeling생성 모델링을 위한 삼체 산란 기법39

TBSM은 에너지 거리를 한 실샘플과 한 생성샘플의 상수 크기 상호작용으로 바꿔 O(B) 손실로 one-step 생성기를 학습시키며, 이미지 특징 공간에서 2-Wasserstein 그래디언트 흐름을 근사하는 새로운 생성 학습 경로를 제안합니다.

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token CompressionVisCo: 시각 토큰 압축을 위한 LLM 기반 내재 인코더 활용11

VisCo는 사전학습된 VLM 자체를 파라미터 공유 오토인코더 형태의 압축기로 재사용해 소수의 메모리 토큰으로 시각 정보를 압축하며, 외부 모듈 추가 없이 높은 압축률에서도 성능 저하와 재학습 비용을 줄였습니다.

💡 멀티모달 생성은 단순 생성 품질 경쟁에서 벗어나 모달 정렬, 토큰 효율, 전문 도메인 평가로 빠르게 성숙하고 있습니다. 오디오-비디오 동기화, 영화 문법, 의료 사실성처럼 각 도메인의 실제 성공 기준을 모델과 벤치마크에 직접 심는 흐름이 강합니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택