오늘의 한줄

오늘은 비디오 생성의 장기 문맥 학습·분산 추론 최적화, 에이전트의 자기개선과 문서 작업 평가, 그리고 멀티모달 모델의 공간·능동 지각 한계를 정밀하게 드러내는 벤치마크가 두드러졌습니다. 동시에 로보틱스와 교육·검색 등 응용 영역에서는 표현 정렬과 평가 기준 자체를 다시 설계하려는 흐름이 강해지고 있습니다.

📄Multimodal & Generative6

Self Gradient Forcing: Native Long Video ExtrapolationSelf Gradient Forcing으로 구현한 네이티브 장기 비디오 외삽68

SGF는 자기 롤아웃 문맥에 대한 과거 컨텍스트-그래디언트 단절을 2패스 학습으로 복원해, 전체 시리얼 롤아웃 역전파 없이도 장기 비디오 외삽 품질을 높이는 자기회귀 비디오 디퓨전 학습법입니다.

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text텍스트가 아닌 생성 픽셀로 평가하는 공간 인지16

ProVisE는 이미지 생성 모델이 좌표나 텍스트 대신 픽셀로 공간 판단을 표현하도록 유도·파싱해, 기존 벤치마크 의미를 유지한 채 생성형 모델의 공간 인지를 공정하게 측정하는 평가 프레임워크입니다.

An Exam for Active Observers능동적 관찰자를 위한 시험10

ActiveVision은 반복적 시각 관찰이 필수인 17개 과제로 MLLM의 능동 지각을 측정하며, GPT-5.5도 10.6%에 그치고 인간은 96.1%를 기록해 현재 모델의 폐루프 시각 추론 한계를 극명하게 보여줍니다.

💡 생성 모델 연구는 이제 단순 품질 경쟁을 넘어 장기 문맥 학습(SGF), 분산 추론 효율(FVAttn), 데이터 설계(Moving Alphabet), 표현 형식 기반 평가(ProVisE·ActiveVision)까지 전 주기를 함께 다루고 있습니다. 특히 비디오와 3D에서는 모델 구조보다 문맥 전달, 토큰 배치, 데이터 분포 같은 시스템적 요소가 성능을 크게 좌우한다는 메시지가 강합니다.

👁️Computer Vision3

Color Pass-Through via Camera-Display Coupling카메라-디스플레이 결합으로 구현한 컬러 패스스루38

Color Pass-Through는 카메라와 디스플레이를 분리 보정하지 않고 결합 시스템으로 종단간 학습해, 스마트폰 촬영-표시 과정의 색·밝기·대비 불일치를 더 정확히 줄이는 실용적 파이프라인을 제안합니다.

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection멀티뷰 RGB-T 항공 객체 탐지를 위한 게임 기반 데이터 생성 프레임워크3

G-MAD는 Arma3 기반으로 정렬된 멀티뷰 RGB-T 항공 영상을 자동 주석과 함께 생성하고, 이를 바탕으로 대규모 AMOD 벤치마크를 공개해 시점 변화·멀티모달 융합·합성-실사 전이를 정밀 연구할 수 있게 합니다.

Self-Supervised Learning of Structured Dynamics from Videos비디오에서 구조화된 동역학을 학습하는 자기지도 학습5

SDM은 사전학습된 이미지 ViT 특징 위에서 미래 특징 예측을 통해 카메라 움직임과 객체 움직임을 분리하는 구조화된 동역학 표현을 자기지도·약지도 결합으로 학습해 더 견고한 비디오 표현을 만듭니다.

💡 비전 분야에서는 센서-디스플레이 결합 보정, 게임 기반 합성 데이터, 카메라/객체 운동 분리처럼 현실 세계의 생성 과정과 관측 구조를 더 직접 모델링하려는 흐름이 보입니다. 즉, 더 많은 데이터보다 '어떻게 관측되고 왜 달라지는가'를 구조적으로 반영하는 쪽으로 무게가 이동하고 있습니다.

🗣️Language Models4

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs교육용 LLM 평가·학습을 위한 교과과정 정렬 지식 그래프49

K12-KGraph는 초중고 교과서를 바탕으로 9개 노드·14개 관계의 교육 지식 그래프와 2만3640문항 K12-Bench, 7335개 K12-Train을 구축해 교육용 LLM의 '교과 인지' 능력을 본격 평가·학습할 수 있게 합니다.

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking관련성 중심 검색을 넘어, 루브릭 기반 문서 집합 선택과 랭킹24

SetwiseEvalKit과 Rubric4Setwise는 문서 개별 점수 대신 중복·충돌·상보성을 포함한 집합 품질을 평가·최적화하며, 최고 리랭커도 45% 이하 커버리지에 그친다는 점을 보여 검색의 병목이 세트 조합에 있음을 드러냅니다.

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models대규모 언어모델을 위한 하이퍼네트워크 기반 지식 주입의 스케일링 법칙13

이 연구는 하이퍼네트워크가 고정 LoRA 어댑터를 생성해 학습 시점에 사실 지식을 주입하는 설정을 체계화하고, 손실·추론 정확도·OOD 일반화가 규모에 따라 어떻게 변하는지 처음으로 스케일링 법칙 관점에서 분석합니다.

💡 LLM 연구는 교육 지식 구조, 검색 결과의 집합 품질, 내부 활성화 설명 가능성처럼 기존의 단일 정답·단일 문서 중심 평가를 넘어서는 방향으로 확장되고 있습니다. 동시에 하이퍼네트워크 기반 지식 주입처럼 파라미터 효율성과 확장 법칙을 함께 따지는 접근이 실전 배포 관점에서 중요해지고 있습니다.

📄Robotics & RL2

ReferTrack: Referring Then Tracking for Embodied Visual Tracking지칭 후 추적으로 푼 체화 시각 추적18

ReferTrack은 자연어로 지시된 목표를 먼저 박스 선택으로 명시적으로 grounding한 뒤 경로점을 예측하고, TVBI 토큰으로 시간적 목표 단서를 유지해 체화 시각 추적의 정렬성과 추적 성능을 함께 높입니다.

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment표현 앵커링과 언어-행동 정렬로 일반화되는 VLA 파인튜닝13

Anchor-Align은 동결 VLM으로부터의 layer-wise 앵커링과 동일 관측에서의 언어-행동 공동학습을 결합해, 행동복제로 인한 표현 붕괴와 정렬 문제를 줄이며 실제 xArm7 조작 일반화를 개선합니다.

💡 로보틱스에서는 표현 보존과 명시적 grounding이 핵심 화두입니다. ReferTrack과 Anchor-Align 모두 언어·시각·행동을 한 번에 뭉뚱그리기보다, 타깃 식별과 행동 예측 또는 사전학습 표현과 로봇 행동을 더 정교하게 연결할 때 실제 일반화가 좋아진다는 점을 보여줍니다.

📄Training & Optimization3

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPODAscend SuperPOD에서 수행한 DeepSeek-V4 계열 전파라미터 후학습19

SLAI T-Rex는 Ascend NPU SuperPOD에서 모델 병렬화·통신 중첩·커널 최적화를 통합해 DeepSeek-V4의 전파라미터 후학습 MFU를 34.22%까지 끌어올리고 오픈소스 기준 대비 2.93배 개선했습니다.

Multi-Turn On-Policy Distillation with Prefix Replay프리픽스 리플레이를 활용한 멀티턴 온폴리시 증류4

ReOPD는 수집된 교사 궤적의 prefix를 재사용해 환경 재실행 없이 멀티턴 에이전트 OPD를 수행하고, 학생 온폴리시성 증가와 교사 신뢰도 저하 사이의 'prefix trap'을 명시적으로 다룹니다.

FVAttn: Adaptive Sparse Attention with Runtime Load Balancing for Video Generation비디오 생성을 위한 런타임 부하 분산형 적응 희소 어텐션

FVAttn은 Top-p 희소 라우팅이 만든 GPU 간 head 불균형을 런타임 마이그레이션과 slack 활용 증강으로 완화해, 학습 없이도 장시퀀스 비디오 디퓨전의 분산 self-attention 실행 효율을 높입니다.

💡 학습·최적화 연구는 거대 모델 후학습과 에이전트 증류, 비디오 어텐션 실행처럼 서로 다른 문제를 다루지만 공통적으로 '이론적으로 좋은 방법'을 실제 시스템 제약 안에서 굴러가게 만드는 데 집중합니다. 앞으로는 알고리즘 개선만큼 통신, 재사용, 신뢰도 관리 같은 실행 전략이 성능 격차를 결정할 가능성이 큽니다.

💻Code & Agents2

AREX: Towards a Recursively Self-Improving Agent for Deep Research심층 리서치를 위한 재귀적 자기개선 에이전트11

AREX는 답을 찾는 내부 연구 루프와 제약별 검증·보완을 수행하는 외부 자기개선 루프를 번갈아 돌리며, 장기 상호작용을 압축하는 context-update 도구로 심층 리서치 에이전트의 지속적 개선을 가능하게 합니다.

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations복잡한 문서 작업을 위한 검증 가능한 자율 에이전트 벤치마크2

DocOps는 실제 문서 워크플로를 원자 작업과 복합 난도로 분해한 검증 가능한 벤치마크로, 최첨단 에이전트도 장기 상태 추적 붕괴·얕은 검증·구조 메타데이터 파괴에 취약함을 체계적으로 드러냅니다.

💡 에이전트 연구는 더 오래 생각하게 만드는 것보다, 스스로 검증하고 상태를 압축하며 복잡한 작업을 실패 없이 이어가는 능력을 묻기 시작했습니다. AREX와 DocOps를 함께 보면, 차세대 업무형 에이전트의 경쟁력은 정답 생성보다 검증 가능한 중간 상태 관리에 달려 있음을 시사합니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택