오늘의 한줄
오늘은 대규모 사전학습을 실제 행동·추론·생성으로 연결하는 연구가 두드러졌습니다. 특히 로보틱스, 에이전트, RL 후학습, 멀티모달 생성 전반에서 데이터·구조·최적화 설계를 다시 짜 성능과 효율을 함께 끌어올리려는 흐름이 뚜렷합니다.
📄Robotics & RL3
Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories샤오미 로보틱스-1: 10만 시간 이상 실세계 궤적으로 확장한 비전-언어-행동 모델⭐ 143
Xiaomi-Robotics-1은 10만 시간 이상 실세계 조작 궤적과 자동 언어 라벨링 파이프라인을 활용한 2단계 학습으로, 보지 못한 환경에서도 지시 수행과 소량 파인튜닝 적응을 동시에 강화한 VLA 기반 로봇 모델입니다.
When Does Muon Help Agentic Reinforcement Learning?Muon은 언제 에이전트형 강화학습에 도움이 되는가
ALFWorld에서 Muon은 GiGPO 기준 검증 성공률을 0.290에서 0.546으로 88% 높였고, 1e-5 GraphGPO에서는 0.901에 도달해 에이전트 RL에서 옵티마이저·advantage·학습률의 결합 설계 중요성을 보여줍니다.
Behavioral Privacy Leakage in Agentic Negotiation: Formalizing and Mitigating Inference Attacks via Randomized Policies에이전트형 협상에서의 행동 프라이버시 유출: 무작위 정책으로 추론 공격 완화하기
이 연구는 협상 궤적·타이밍·수렴 패턴에서 사적 제약이 새는 behavioral privacy leakage를 정식화하고, 무작위화 정책으로 추론 정확도를 43~50% 낮추면서도 성공률과 효용을 90% 이상 유지했습니다.
💡 로보틱스와 에이전트 RL은 더 많은 데이터만이 아니라 학습 안정화와 실제 배치 제약까지 함께 다루는 방향으로 가고 있습니다. 대규모 실세계 궤적, 옵티마이저 선택, 프라이버시 보장처럼 ‘현장성 있는 RL’이 핵심 화두로 보입니다.
🗣️Language Models3
RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLMRAGU: 소형 도메인 적응 LLM을 활용한 다단계 그래프 RAG 엔진⭐ 77
RAGU는 추출·통합을 분리한 다단계 GraphRAG와 7B 모델 Meno-Lite-0.1을 결합해, 지식그래프 구축에서 Qwen2.5-32B 대비 상대 12.5% 향상을 보이며 의료 GraphRAG 검색 완성도를 끌어올렸습니다.
Cura 1T: Specialized Model for Agentic HealthcareCura 1T: 에이전트형 헬스케어를 위한 특화 모델⭐ 15
Cura 1T는 인간 검증 기반 self-evolution 루프로 상담·임상 추론·의료 이미지·EHR 도구 사용을 함께 다듬어, 헬스케어 벤치마크 전반에서 최상위권 성능과 범용 추론 경쟁력을 동시에 확보했습니다.
Loop the Loopies!루피를 반복하라!
Loopie는 20B/6B급 MoE 루프드 트랜스포머와 새로운 후학습 파이프라인으로 동일 연산 예산의 일반 트랜스포머를 능가했으며, 도구 없이도 2025 IMO·IPhO 금메달 수준 성능을 달성했습니다.
💡 LLM 연구는 무조건 큰 모델을 쓰기보다 도메인 특화, 구조적 추론, 계산 재사용으로 효율을 다시 설계하는 흐름이 강합니다. 소형 모델의 언어 기술 강화, 의료 특화 self-evolution, 루프드 구조의 부활은 성능 스케일링의 축이 다양해졌음을 보여줍니다.
💻Code & Agents5
RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal ResourcesRESOURCE2SKILL: 사람이 만든 멀티모달 자료에서 실행 가능한 에이전트 스킬 추출하기⭐ 64
RESOURCE2SKILL은 튜토리얼 영상·코드 저장소·문서·산출물을 계층형 멀티모달 Skill Wiki로 증류해, 소프트웨어 에이전트가 스킬을 검색·조합·보완하며 더 안정적으로 작업을 수행하게 합니다.
RecGPT-V3 Technical ReportRecGPT-V3 기술 보고서
RecGPT-V3는 자연어 추론과 semantic ID를 결합한 stateful 하이브리드 추천기로, 사용자 이력 재처리와 태그-아이템 병목, 긴 추론 지연 문제를 동시에 줄이도록 설계됐습니다.
From Human-Centric to Agentic Code Review: The Impact of Different Generations of Generative AI Technology on Review Quality인간 중심에서 에이전트형 코드 리뷰로: 생성형 AI 세대 변화가 리뷰 품질에 미친 영향
이 논문은 GitHub 207개 프로젝트, 102만 건 PR을 분석해 인간 중심·LLM 보조·에이전트형 코드 리뷰 전환이 협업 패턴과 리뷰 품질에 어떤 차이를 만드는지 실증적으로 정리했습니다.
💡 에이전트 연구는 단순 실행을 넘어 스킬 자산화, 환경 예측, 하니스 개선, 실제 협업 영향 측정으로 빠르게 넓어지고 있습니다. 특히 에이전트의 성능을 모델 자체보다 워크플로와 기억 구조, 실행 흔적 품질로 끌어올리려는 시도가 인상적입니다.
📄Multimodal & Generative3
VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation AutoencodersVideoRAE: 표현 오토인코더로 비디오 파운데이션 모델을 생성 모델에 맞게 다듬기⭐ 35
VideoRAE는 고정된 비디오 파운데이션 인코더의 다중 스케일 표현을 경량 1D self-attention projector로 압축해, 디퓨전과 자기회귀 비디오 생성 모두에 적합한 의미론적 잠재공간을 제공합니다.
S1-Omni: A Unified Multimodal Reasoning Model for Scientific Understanding, Prediction, and GenerationS1-Omni: 과학 이해·예측·생성을 아우르는 통합 멀티모달 추론 모델⭐ 9
S1-Omni는 CIF·SMILES·단백질 서열·스펙트럼·과학 이미지를 공통 표현공간에 정렬하고 과학 법칙과 전문가 지식을 학습에 통합해, 과학 도메인 전반의 이해·예측·생성을 하나의 모델로 묶었습니다.
Qwen-Music Technical ReportQwen-Music 기술 보고서
Qwen-Music은 25Hz 단일 코드북 Music Semantic Token과 Melody-CoT를 결합해, 가사·속성 기반 신곡 생성과 스타일·보컬을 바꾸는 커버 생성 모두에서 더 높은 음악성·구조감·음질을 노렸습니다.
💡 멀티모달 생성은 표현 공간을 어떻게 설계하느냐가 성패를 가르는 단계로 들어섰습니다. 비디오·과학·음악 모두에서 도메인 구조를 잠재표현과 추론 과정에 직접 반영해 생성 품질과 활용 범위를 동시에 넓히고 있습니다.
📄Training & Optimization5
xHC: Expanded Hyper-ConnectionsxHC: 확장형 하이퍼-커넥션⭐ 38
xHC는 write-back 정보 부족과 N에 대한 세제곱 비용 문제를 시간적 특징 보강과 희소 residual-stream 업데이트로 해결해, 기존 HC 계열이 멈췄던 N=4를 넘어 N=16 확장을 실용화했습니다.
Understanding Reasoning from Pretraining to Post-Training사전학습에서 후학습까지, 추론은 어떻게 형성되는가⭐ 8
이 연구는 체스를 통제된 실험장으로 삼아 5M~1B 모델의 사전학습·SFT·RL 전 과정을 추적하며, RL 추론 성능이 사전학습 데이터와 규모 선택에 얼마나 의존하는지 분해해 보여줍니다.
On-Policy Delta Distillation온폴리시 델타 증류⭐ 5
OPD^2는 교사 분포를 그대로 모사하는 대신 instruction tuning 이전 기반 모델과의 차이인 delta signal을 보상으로 사용해, 수학·과학·코딩 전반에서 추론 능력 전달 효율을 크게 높였습니다.
💡 후학습과 최적화는 이제 보상 함수 하나를 바꾸는 수준이 아니라, 사전학습과의 연결·증류 신호·정답성 지표·아키텍처 확장 축까지 함께 재설계하는 국면입니다. 성능 향상 포인트가 모델 크기보다 학습 신호의 질과 계산 배분 전략으로 이동하고 있다는 점이 분명합니다.
👁️Computer Vision1
REBASE: Reference-Background Subspace Elimination for Training-Free In-Context SegmentationREBASE: 학습 없는 인컨텍스트 분할을 위한 참조-배경 부분공간 제거⭐ 2
REBASE는 참조 이미지의 저랭크 배경 특징 부분공간을 닫힌형태로 제거해 교차 이미지 유사도에서 배경 잡음을 억제하고, 단일 예시 기반 training-free 분할의 프롬프트 위치 품질을 개선했습니다.
💡 비전에서는 학습 없는 설정에서도 배경 편향 같은 고질적 오류를 수학적으로 제거해 실용 성능을 높이려는 접근이 돋보입니다. 거대한 추가 학습 없이도 표현 공간을 정교하게 다듬는 방식이 점점 중요해지고 있습니다.