오늘의 한줄

오늘 논문들은 작은 모델로도 더 정교한 구조화 추론을 끌어내는 방법, 대규모 현실 데이터로 로봇·에이전트 성능을 확장하는 전략, 그리고 비디오 기반 멀티모달 이해·생성의 평가와 메모리 구조를 정교화하는 흐름을 보여줍니다. 특히 데이터 구성과 학습 신호 설계가 모델 크기 못지않게 성능을 좌우한다는 점이 두드러집니다.

🗣️Language Models1

GigaAM Multilingual: Foundation Model for Underrepresented Languages소외 언어를 위한 GigaAM 다국어 파운데이션 모델696

GigaAM Multilingual은 200만 시간 오디오로 HuBERT식 사전학습을 수행하고 클러스터 단위 밸런싱과 도메인 인지 샘플링을 도입해 카자흐어·키르기스어·우즈베크어 ASR에서 Whisper Large v3와 Omnilingual-1B를 능가했습니다.

💡 저자원 언어 연구는 단순한 모델 대형화보다 데이터 불균형을 다루는 샘플링과 사전학습 설계가 더 큰 차이를 만든다는 점을 다시 보여줍니다. 특히 공개 대형 모델을 그대로 쓰기보다 지역 언어 특성에 맞춘 파운데이션 모델 전략이 실전 성능에서 유효합니다.

💻Code & Agents6

RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM소형 도메인 적응 LLM 기반 멀티스텝 GraphRAG 엔진 RAGU77

RAGU는 추출과 통합을 분리한 멀티스텝 GraphRAG 파이프라인과 7B 모델 Meno-Lite-0.1을 결합해 지식그래프 구축에서 Qwen2.5-32B 대비 상대 12.5% 향상을 기록하며 더 완전한 검색 문맥을 제공합니다.

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources인간이 만든 멀티모달 자료에서 실행 가능한 에이전트 스킬 추출하기64

RESOURCE2SKILL은 튜토리얼 영상·코드 저장소·문서·산출물을 계층형 멀티모달 Skill Wiki로 증류해, 소프트웨어 에이전트가 검색·조합 가능한 실행 스킬로 재사용하도록 만든 프레임워크입니다.

WorldCupArena: Fine-Grained Evaluation of Language Models and Deep-Research Agents on Football Forecasting축구 예측에서 언어모델과 딥리서치 에이전트를 정밀 평가하는 WorldCupArena18

WorldCupArena는 2026 월드컵 104경기를 대상으로 경기 결과뿐 아니라 스코어·선수·이벤트·통계까지 평가하는 동적 벤치마크를 제안해, 비슷한 승패 정확도 뒤에 숨은 모델과 리서치 에이전트의 예측 품질 차이를 드러냅니다.

💡 에이전트 연구는 이제 더 긴 추론을 하게 만드는 것에서 나아가, 어떤 지식을 구조화해 재사용하고 어떤 환경에서 자기개선시킬지를 함께 설계하는 방향으로 이동하고 있습니다. 작은 모델도 적절한 증류, 스킬 위키, 컨텍스트 관리, 검증 가능한 환경을 갖추면 훨씬 큰 시스템과 경쟁할 수 있다는 메시지가 강합니다.

📄Robotics & RL2

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning체화 학습을 위한 오픈 이고센트릭 조작 데이터셋과 툴체인79

Open-AoE는 500명 이상이 스마트폰 400여 대로 수집한 약 2,000시간의 조작 비디오와 손 자세·카메라 궤적·원자 행동 주석, 그리고 학습용 전처리 툴체인을 함께 공개해 체화 학습 데이터 수집 비용을 크게 낮췄습니다.

Xiaomi-Robotics-1: Scaling Vision-Language-Action Models with over 100K Hours of Real-World Trajectories10만 시간 이상 현실 궤적으로 확장한 비전-언어-행동 모델143

Xiaomi-Robotics-1은 10만 시간 이상의 실제 조작 궤적과 장면 상태 전이를 설명하는 자동 언어 주석 파이프라인으로 사전학습해, 새로운 환경에서 지시를 바로 수행하고 적은 데이터로 빠르게 적응하는 VLA 기반 로봇 성능을 보여줍니다.

💡 로보틱스에서는 모델 구조 자체보다도 대규모 현실 궤적과 저비용 행동 데이터셋을 어떻게 모으고 주석화하느냐가 핵심 경쟁력이 되고 있습니다. 사람의 이고센트릭 조작 데이터와 실제 로봇 궤적을 연결하는 흐름은 범용 행동 모델의 데이터 플라이휠을 가속할 가능성이 큽니다.

📄Multimodal & Generative5

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement멀티모달 지능 강화 기반 인간-객체 중심 비디오 개인화68

HOMIE는 MLLM을 재정렬 없이 통합해 사람-객체 관계와 OCR·멀티뷰 같은 참조 간 잠재 대응을 함께 이해함으로써 인간-객체 중심 비디오 개인화에서 주체 충실도와 상호작용 정확도를 동시에 높였습니다.

ReflectWorld-MM: An Entity-Oriented Multimodal Memory System for Open-Ended Video Streams개방형 비디오 스트림을 위한 엔터티 중심 멀티모달 메모리 시스템75

ReflectWorld-MM은 프레임이 아닌 지속 엔터티 중심으로 비디오 스트림을 기억하는 계층형 장기 메모리를 설계해, 열린 환경에서 재등장 객체 추적과 장기적 멀티모달 추론을 더 안정적으로 수행합니다.

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders표현 오토인코더로 비디오 파운데이션 모델을 생성 모델에 맞추기35

VideoRAE는 고정된 비디오 파운데이션 인코더의 다중 스케일 표현을 경량 1D 자기어텐션 프로젝터로 압축해, 디퓨전과 자기회귀 생성 모두에 쓸 수 있는 의미 보존형 비디오 잠재공간을 제공합니다.

💡 멀티모달 연구는 생성 품질 경쟁을 넘어 장기 기억, 물리 법칙 기반 추론, 과학 데이터 통합처럼 더 구조적이고 검증 가능한 지능으로 확장되고 있습니다. 비디오와 과학 영역 모두에서 '보여주기 좋은 출력'보다 내부 표현과 추론 과정의 정합성을 중요하게 보는 흐름이 뚜렷합니다.

📄Training & Optimization3

xHC: Expanded Hyper-Connections확장형 하이퍼 커넥션 xHC38

xHC는 쓰기 정보 부족과 N에 대한 세제곱 비용 문제를 시간 특징 보강과 희소 residual-stream 업데이트로 해결해, 기존 HC 계열이 멈췄던 N=4를 넘어 N=16 확장을 실용화한 새로운 트랜스포머 스케일링 축을 제시합니다.

Understanding Reasoning from Pretraining to Post-Training사전학습에서 후속학습까지 추론이 형성되는 과정 이해하기8

이 연구는 체스를 통제된 실험장으로 사용해 5M~1B 모델의 사전학습, reasoning trace SFT, RL을 함께 분석함으로써 사전학습 선택이 RL 수익률을 어떻게 바꾸고 RL이 실제로 무엇을 학습시키는지 분해해 보여줍니다.

On-Policy Delta Distillation온폴리시 델타 증류5

OPD²는 교사 모델 자체를 모방하는 대신 instruction tuning 이전 베이스 모델과의 차이인 delta signal을 보상으로 사용해, 수학·과학·코딩 전반에서 reasoning 능력 전달이 더 잘 되는 온폴리시 증류 방식을 제안합니다.

💡 학습 최적화 분야는 단순히 더 많은 계산을 쓰는 대신, 어떤 신호를 전달하고 어떤 축으로 확장할지를 정교하게 재설계하는 쪽으로 진화하고 있습니다. 사전학습과 후속학습의 연결 고리를 해부하거나, teacher의 변화량만 증류하거나, residual stream 자체를 새 스케일링 축으로 삼는 시도가 인상적입니다.

👁️Computer Vision3

OpenLongTail: Generative Scaling of Long-Tail Driving Data롱테일 주행 데이터를 생성적으로 확장하는 OpenLongTail26

OpenLongTail은 단안 대시캠 등 이질적 롱테일 주행 영상을 포즈 기반 외삽 뷰 합성으로 멀티뷰 학습 자산으로 변환해, 희귀 엣지 케이스 부족으로 막히던 자율주행 정책 학습 데이터를 생성적으로 확장합니다.

TimeLens2: Generalist Video Temporal Grounding with Multimodal LLMs멀티모달 LLM을 위한 범용 비디오 시간 구간 정렬 TimeLens225

TimeLens2는 9.3만 규모의 다중 구간 감독 데이터와 interval set 기반 temporal Wasserstein 보상을 도입해, 다양한 길이·도메인·질의 형태에서 비디오 증거 구간을 더 정확히 찾는 범용 temporal grounding을 구현했습니다.

Can Multimodal Large Language Models Understand OCT?멀티모달 대형언어모델은 OCT를 이해할 수 있을까?3

OCT-Bench는 4,137개 OCT 이미지와 10,076개 객관식 문항으로 Perception·Cognition·Reasoning 20개 세부 과제를 정의해, 의료 MLLM의 OCT 이해를 질병 분류를 넘어 임상 추론 전 과정으로 평가합니다.

💡 비전 연구에서는 희귀 상황과 시간 축 이해라는 두 난제가 핵심으로 보입니다. 부족한 멀티뷰 데이터를 생성적으로 보완하거나, 비디오 증거를 구간 집합으로 직접 학습하는 접근은 실제 배치 환경에서 더 신뢰할 수 있는 인식 시스템으로 이어질 가능성이 큽니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택