오늘의 한줄
오늘은 비디오 생성·멀티모달 평가·에이전트 학습이 특히 두드러졌습니다. 생성 모델은 긴 시퀀스와 데이터 품질 문제를 정면으로 다루고, 에이전트와 VLA 연구는 더 검증 가능하고 일반화되는 학습·평가 체계로 이동하고 있습니다.
📄Multimodal & Generative5
Self Gradient Forcing: Native Long Video ExtrapolationSelf Gradient Forcing으로 구현한 네이티브 장기 비디오 외삽⭐ 68
SGF는 자기 롤아웃 문맥에 대한 과거 컨텍스트-그래디언트 단절을 2패스 학습으로 복원해, 전체 직렬 롤아웃 역전파 없이도 장기 비디오 외삽 품질을 높이는 방법입니다.
Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text텍스트 대신 픽셀로 평가하는 공간 인지 벤치마크⭐ 16
ProVisE는 이미지 생성 모델이 좌표나 텍스트 대신 그림·표식으로 답하게 한 뒤 이를 구조화해 채점함으로써, 공간 추론을 픽셀 출력 기준으로 공정하게 평가하는 프레임워크입니다.
An Exam for Active Observers능동적 관찰자를 위한 시험 ActiveVision⭐ 10
ActiveVision은 반복적 시각 탐색이 필요한 17개 과제로 MLLM의 능동 관찰을 측정하며, 최고 성능 모델도 10.6%에 그쳐 현재 모델이 단발성 인식에 크게 의존함을 보여줍니다.
💡 비디오·3D·공간 추론 연구가 모두 '출력 품질'만이 아니라 긴 문맥, 평가 인터페이스, 데이터 분포 같은 구조적 병목을 직접 다루고 있습니다. 생성 모델이 점점 더 크고 화려해지는 대신, 실제로 무엇을 보고 어떻게 일반화하는지 검증 가능한 방향으로 이동하는 흐름이 보입니다.
👁️Computer Vision3
Color Pass-Through via Camera-Display Coupling카메라-디스플레이 결합으로 구현한 컬러 패스스루⭐ 38
Color Pass-Through는 카메라와 디스플레이를 분리 보정하지 않고 하나의 종단간 시스템으로 학습해, 스마트폰 촬영-표시 간 색·밝기·대비 왜곡을 더 정확히 줄입니다.
G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection멀티뷰 RGB-T 항공 객체 탐지를 위한 게임 기반 데이터 생성 프레임워크⭐ 3
G-MAD는 Arma3 기반으로 정렬된 멀티뷰 RGB-T 항공 데이터를 자동 주석과 함께 생성하고, 대규모 AMOD 벤치마크를 공개해 시점 변화·멀티모달 융합·합성-실사 전이를 정밀하게 연구하게 합니다.
Self-Supervised Learning of Structured Dynamics from Videos비디오에서 구조적 동역학을 학습하는 자기지도 학습⭐ 5
SDM은 사전학습된 이미지 ViT 특징 위에서 미래 특징 예측으로 카메라 움직임과 객체 움직임을 분리해, 얽힌 비디오 변화 대신 더 견고한 구조적 모션 표현을 학습합니다.
💡 비전 쪽은 센서-디스플레이 파이프라인, 합성 데이터, 구조적 모션 분해처럼 데이터 획득과 표현 자체를 다시 설계하는 연구가 두드러집니다. 단순한 벤치마크 점수 경쟁보다, 통제 가능성과 물리적 해석 가능성을 높여 실제 배치 환경으로 연결하려는 움직임이 강합니다.
🗣️Language Models4
K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs교육용 LLM을 위한 교과과정 정렬 지식 그래프 K12-KGraph⭐ 49
K12-KGraph는 9개 노드·14개 관계로 교과 구조를 담고, 2만3640문항 K12-Bench와 7335개 K12-Train을 함께 제시해 교육용 LLM의 '교과 인지'를 체계적으로 평가·학습하게 합니다.
Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking관련성 중심을 넘는 루브릭 기반 문서 집합 선택과 랭킹⭐ 24
SetwiseEvalKit은 약 2.8만 개 루브릭으로 문서 집합 품질을 9차원에서 평가하고, Rubric4Setwise는 중복·충돌·상보성을 반영해 기존 개별 문서 중심 재랭킹의 한계를 드러냅니다.
Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models하이퍼네트워크 기반 LLM 지식 주입의 스케일링 법칙⭐ 13
이 연구는 하이퍼네트워크가 고정 LoRA 어댑터를 생성해 사실 지식을 주입하는 설정을 분리 설계하고, 손실·추론 정확도·OOD 일반화가 규모에 따라 어떻게 변하는지 처음으로 체계화했습니다.
💡 LLM 연구는 더 많은 정답 생성보다 지식 구조화, 문서 집합 평가, 설명의 검증 가능성처럼 '무엇을 알고 어떻게 증명하는가'에 초점이 옮겨가고 있습니다. 특히 교육·검색·해석 가능성 영역에서 스케일만으로는 해결되지 않는 평가 프레임 재정의가 중요해지고 있습니다.
📄Robotics & RL2
ReferTrack: Referring Then Tracking for Embodied Visual Tracking지칭 후 추적으로 푼 체화 시각 추적 ReferTrack⭐ 18
ReferTrack은 먼저 박스 단위로 대상을 지칭한 뒤 경로를 예측하는 2단계 EVT 구조와 TVBI 토큰을 도입해, 자연어 기반 이동 추적을 이미지 공간에 더 강하게 정렬합니다.
Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment표현 앵커링과 언어-행동 정렬로 일반화하는 VLA 파인튜닝⭐ 13
Anchor-Align은 동결 VLM 표현을 층별 증류로 보존하고 같은 관측에서 언어·행동을 함께 학습해, xArm7 실험에서 VLA의 실제 로봇 성공률과 일반화를 함께 끌어올렸습니다.
💡 로보틱스/VLA는 추상 CoT보다 이미지 공간 grounding과 언어-행동 정렬을 강화하는 방향으로 진화하고 있습니다. 결국 실제 로봇 일반화는 더 큰 모델보다, 관측·행동·언어가 같은 상태에서 얼마나 일관되게 연결되느냐가 좌우한다는 메시지가 분명합니다.
📄Training & Optimization4
SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPODAscend SuperPOD에서 수행한 DeepSeek-V4 전파라미터 후학습⭐ 19
SLAI T-Rex는 Ascend NPU 환경에서 모델 병렬화·통신 오버랩·커널 최적화를 통합해 DeepSeek-V4 계열의 전파라미터 후학습 MFU를 34.22%까지 끌어올리고 베이스라인 대비 2.93배 개선했습니다.
Visual Contrastive Self-Distillation시각 대비 자기증류 VCSD⭐ 4
VCSD는 원본 이미지와 내용 제거 이미지 사이의 EMA 교사 분포 차이를 자기증류 신호로 사용해, 특권 정답이나 외부 교사 없이도 시각적으로 근거 있는 토큰 학습을 가능하게 합니다.
Multi-Turn On-Policy Distillation with Prefix Replay프리픽스 리플레이를 활용한 멀티턴 온폴리시 증류⭐ 4
ReOPD는 교사 궤적 프리픽스를 재사용해 환경 재실행 없이 멀티턴 OPD를 수행하고, 학생 분포와 교사 신뢰성 사이의 'prefix trap'을 완화하는 효율적 증류 방식을 제시합니다.
💡 학습·시스템 연구는 단순 가속이 아니라, 증류 신호의 신뢰성·자기지도 비대칭성·분산 실행 불균형 같은 숨은 실패 원인을 정교하게 다루고 있습니다. 대형 모델 시대에는 알고리즘과 시스템 최적화가 따로가 아니라 함께 설계되어야 성능과 효율이 동시에 나온다는 점이 인상적입니다.
💻Code & Agents2
AREX: Towards a Recursively Self-Improving Agent for Deep Research재귀적 자기개선형 딥리서치 에이전트 AREX⭐ 11
AREX는 탐색 루프와 제약별 감사 루프를 번갈아 수행하며 미검증 주장만 후속 조사하는 RSI 구조로, 긴 리서치 과제를 더 체계적으로 개선하는 에이전트 설계를 제안합니다.
DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations복잡한 문서 작업용 자율 에이전트 검증 벤치마크 DocOps⭐ 2
DocOps는 실제 문서 작업을 원자적 조작과 복합 워크플로로 분해해 결정론적으로 검증하며, 최신 에이전트가 장기 상태 추적·의미 검증·구조 메타데이터 보존에서 크게 취약함을 보여줍니다.
💡 에이전트 연구는 더 오래 검색하게 만드는 것보다, 중간 결과를 검증하고 상태를 압축하며 실패를 측정 가능한 작업으로 바꾸는 쪽으로 발전하고 있습니다. 실전형 에이전트 경쟁력은 이제 '행동 가능성'보다 '검증 가능성'과 '장기 일관성'에서 갈릴 가능성이 큽니다.