오늘의 한줄

오늘은 에이전트의 자기개선, 비디오·3D 생성의 효율화, 그리고 기존 벤치마크가 놓친 실제 능력을 드러내는 평가 프레임워크가 두드러졌습니다. 특히 모델 자체를 키우는 것만큼, 올바른 데이터·훈련 신호·검증 방식이 성능 상한을 좌우한다는 흐름이 선명합니다.

📄Multimodal & Generative5

Self Gradient Forcing: Native Long Video Extrapolation자기 그래디언트 강제로 구현한 네이티브 장기 비디오 외삽68

SGF는 자가 롤아웃 문맥에 미래 손실의 감독 신호를 되돌리는 2패스 학습으로 기존 Self Forcing의 context-gradient gap을 메워, 긴 비디오 외삽 품질과 시간적 일관성을 높입니다.

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text말하지 말고 보여줘: LLM 텍스트가 아닌 생성 픽셀로 공간 인지를 평가하기16

ProVisE는 이미지 생성 모델이 좌표나 텍스트 대신 픽셀로 공간 판단을 표현하도록 유도하고 이를 구조화된 예측으로 파싱해, 공간 추론을 답변 인터페이스 왜곡 없이 공정하게 측정합니다.

An Exam for Active Observers능동적 관찰자를 위한 시험10

ActiveVision은 반복적 시각 탐색이 필요한 17개 과제로 MLLM의 능동 관찰 능력을 측정하며, 최고 모델인 GPT-5.5도 10.6%에 그쳐 현재 모델이 정적 이미지 이해에 크게 편중됐음을 보여줍니다.

💡 비디오·이미지·3D 생성 연구가 단순히 더 큰 모델보다 더 나은 학습 신호와 평가 인터페이스, 그리고 효율적인 실행 구조로 이동하고 있습니다. 특히 장기 일관성, 공간 추론, 장면 적응성처럼 실제 사용성에 직결되는 능력을 정교하게 드러내고 보완하려는 흐름이 강합니다.

👁️Computer Vision3

Color Pass-Through via Camera-Display Coupling카메라-디스플레이 결합으로 구현한 컬러 패스스루38

Color Pass-Through는 카메라와 디스플레이를 분리 보정하지 않고 하나의 종단간 시스템으로 학습해 스마트폰 촬영-표시 간 색·밝기·대비 왜곡을 줄이고 1스텝 개인화 보정까지 지원합니다.

G-MAD: A Game-Based Data Generation Framework for Multi-View RGB-T Aerial Object Detection다중 시점 RGB-T 항공 객체 탐지를 위한 게임 기반 데이터 생성 프레임워크3

G-MAD는 Arma3 기반으로 정렬된 다중 시점 RGB-T 항공 데이터를 자동 주석과 함께 생성하고, 이를 바탕으로 AMOD 벤치마크를 공개해 시점 제어·융합·합성-실사 전이를 체계적으로 연구할 수 있게 합니다.

Self-Supervised Learning of Structured Dynamics from Videos비디오로부터 구조화된 동역학을 자기지도학습하기5

SDM은 사전학습된 이미지 ViT 특징 위에서 미래 특징 예측으로 카메라 움직임과 객체 움직임을 분리해, 얽힌 단일 비디오 표현보다 더 구조적인 모션 표현을 자기지도 방식으로 학습합니다.

💡 비전 분야에서는 현실 세계의 복잡한 생성 과정과 동역학을 구조적으로 모델링하려는 시도가 두드러집니다. 카메라-디스플레이 결합, 합성 데이터 엔진, 카메라/객체 운동 분리처럼 파이프라인을 더 물리적·인과적으로 다루려는 방향이 인상적입니다.

🗣️Language Models3

K12-KGraph: A Curriculum-Aligned Knowledge Graph for Benchmarking and Training Educational LLMs교육과정 정렬 지식그래프로 교육용 LLM을 벤치마킹하고 학습하기49

K12-KGraph는 교과서 기반 9개 노드·14개 관계 지식그래프와 2만3640문항 K12-Bench, 7335개 K12-Train을 공개해 교육용 LLM의 커리큘럼 인지와 시각적 근거 이해를 본격 평가·학습할 수 있게 합니다.

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models대규모 언어모델에서 하이퍼네트워크 기반 지식 주입의 스케일링 법칙13

이 연구는 하이퍼네트워크가 고정 LoRA 어댑터를 생성해 사실 지식을 주입하는 설정을 분리 설계하고, 손실·추론 정확도·OOD 일반화 관점에서 지식 주입 용량의 스케일링 법칙을 체계적으로 분석합니다.

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations독자가 아니라 모델을 훈련하라: 검증 가능한 활성화 설명을 위한 해독 가능성 감독

이 논문은 재구성 점수만으로는 활성화 설명의 거짓 세부 주장을 잡지 못함을 보이고, 보조 예측기를 함께 학습하는 RECAP과 두 가지 감사 프로토콜로 더 검증 가능한 설명을 제안합니다.

💡 LLM 연구는 지식 주입과 설명 가능성, 그리고 교육 맥락 이해처럼 '무엇을 아는가'와 '그 지식을 어떻게 검증할 것인가'로 관심이 넓어지고 있습니다. 성능 수치만이 아니라 구조화된 지식과 세부 사실 충실도를 함께 다루는 평가 설계가 점점 중요해집니다.

📄Robotics & RL2

ReferTrack: Referring Then Tracking for Embodied Visual Tracking지시하고 추적하는 체화 시각 추적18

ReferTrack은 먼저 박스 집합에서 언어로 지시된 대상을 선택한 뒤 경로점을 예측하는 referring-then-tracking 구조와 TVBI 토큰으로, 이미지 공간 정렬이 약한 기존 VLA 기반 EVT를 개선합니다.

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment표현 앵커링과 언어-행동 정렬을 통한 일반화 가능한 VLA 파인튜닝13

Anchor-Align은 고정 VLM의 중간표현을 증류하는 Vision-Language Anchoring과 동일 관측에서 언어·행동을 함께 맞추는 Language-Action Alignment로 VLA의 실제 로봇 성공률을 높입니다.

💡 로보틱스에서는 언어-시각-행동을 한 번에 뭉뚱그리기보다, 대상 지시와 추적·표현 보존과 행동 정렬을 분리해 더 감독 가능한 형태로 재구성하는 경향이 보입니다. 이는 실제 로봇 일반화에서 '좋은 표현을 잃지 않는 파인튜닝'이 핵심임을 시사합니다.

💻Code & Agents3

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking관련성 중심 검색을 넘어: 루브릭 기반 문서 집합 선택과 랭킹24

SetwiseEvalKit은 약 2만8000개 루브릭으로 문서 집합 품질을 평가하고, Rubric4Setwise는 중복·충돌·상보성을 반영한 학습 없는 재랭킹으로 기존 nDCG 중심 검색 평가의 한계를 겨냥합니다.

AREX: Towards a Recursively Self-Improving Agent for Deep Research재귀적으로 자기개선하는 딥리서치 에이전트를 향하여11

AREX는 답을 찾는 내부 루프와 제약별 검증·후속 탐색을 수행하는 외부 루프를 번갈아 돌리며, 장기 컨텍스트를 압축하는 개선 상태로 심층 리서치 에이전트의 재귀적 자기개선을 구현합니다.

DocOps: A Verifiable Benchmark for Autonomous Agents in Complex Document Operations복잡한 문서 작업용 자율 에이전트를 위한 검증 가능한 벤치마크2

DocOps는 실제 문서 작업을 계층적 작업군으로 분해한 결정론적 검증 벤치마크로, 최신 에이전트가 장기 상태 추적 붕괴·얕은 검증·구조 메타데이터 파괴 같은 핵심 실패 모드를 보인다고 밝힙니다.

💡 에이전트 연구는 이제 단순 정답률보다 장기 작업에서의 검증 가능성, 문서 집합 품질, 자기개선 루프 같은 운영 수준의 능력을 묻고 있습니다. 특히 '찾기보다 검증이 싸다'는 관점을 활용해 에이전트를 반복적으로 다듬는 설계가 앞으로 더 중요해질 것으로 보입니다.

📄Training & Optimization4

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPODAscend SuperPOD에서 수행한 DeepSeek-V4 계열의 전파라미터 후학습19

SLAI T-Rex는 Ascend NPU용 계층적 분산 최적화로 DeepSeek-V4급 초대형 MoE의 전파라미터 후학습에서 34.22% MFU와 오픈소스 기준 대비 2.93배 성능 향상을 달성했습니다.

Visual Contrastive Self-Distillation시각 대비 자기증류4

VCSD는 원본 이미지와 내용 제거 이미지 간 EMA 교사의 다음 토큰 확률 차이를 자기증류 신호로 써, 특권 정답이나 외부 교사 없이도 시각 근거에 민감한 학습을 가능하게 합니다.

Multi-Turn On-Policy Distillation with Prefix Replay프리픽스 리플레이를 활용한 멀티턴 온폴리시 증류4

ReOPD는 멀티턴 에이전트 증류에서 학생 온폴리시성와 교사 신뢰성 사이의 prefix trap을 짚고, 사전 수집 프리픽스를 재사용하는 오프환경 방식으로 비용을 줄이면서 안정적 감독을 제공합니다.

💡 훈련·최적화 연구는 더 적은 비용으로 더 신뢰할 수 있는 학습 신호를 만드는 데 집중합니다. 증류, 희소 어텐션, 초대형 분산 학습 모두에서 공통적으로 보이는 메시지는, 알고리즘과 시스템을 함께 설계해야 실제 성능 향상이 나온다는 점입니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택