오늘의 한줄

오늘은 장기 과제 평가와 에이전트 운영체제, 그리고 텍스트 중심 학습을 넘어선 시각·멀티모달 사전학습이 특히 눈에 띄었습니다. 동시에 LLM 후학습은 더 싸고 안정적으로 옮기는 방향으로, 로보틱스는 메모리·추론·제어를 분리하는 시스템화 방향으로 진화하고 있습니다.

💻Code & Agents2

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading장기 터미널 과제의 한계를 시험하는 Long-Horizon-Terminal-Bench25

Long-Horizon-Terminal-Bench는 46개 장기 터미널 과제를 세분화된 서브태스크와 dense reward로 채점해, 에이전트의 최종 성공 여부뿐 아니라 중간 진척도와 부분 해결 능력까지 정밀 평가합니다.

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory평생 멀티모달 메모리를 갖춘 범용 로봇 에이전트 운영체제

ABot-AgentOS는 계획·도구 사용·검증·엣지-클라우드 협업·지속 메모리를 담당하는 상위 에이전트 계층과 EmbodiedWorldBench를 함께 제시해 장기 embodied 작업의 실행 기반을 시스템 수준에서 다룹니다.

💡 에이전트 연구는 이제 단순 성공률보다 장기 과제에서 얼마나 멀리 갔는지, 그리고 그 과정을 어떤 운영체제로 지탱하는지가 핵심이 되고 있습니다. 벤치마크와 런타임 계층이 함께 발전하면서, 실전형 에이전트는 모델 자체보다 평가·메모리·검증 스택의 완성도가 더 중요해지고 있습니다.

👁️Computer Vision2

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models텍스트-이미지 모델로 픽셀 공간 밀집 예측 읽어내기13

ReChannel은 RGB 생성 대신 DiT의 patch-to-token-to-patch 격자에서 task-native 채널을 직접 읽어내 depth·mask·normal 같은 dense prediction을 더 정확한 픽셀 정렬 방식으로 수행합니다.

CtrlVTON: Controllable Virtual Try-On via Visual-Instance-Prompt Segmentation시각 인스턴스 프롬프트 분할로 제어 가능한 가상 피팅

CtrlVTON은 VIP-SAM으로 동일 의류 인스턴스를 분할하고 그 마스크를 픽셀 제어 신호로 써, 옷의 핏·넣어 입기·열고 닫기·위치까지 조절 가능한 SOTA 가상 피팅을 구현합니다.

💡 비전 분야에서는 생성모델을 그대로 쓰기보다 dense prediction과 가상 피팅처럼 픽셀 단위 제어가 필요한 작업에 맞게 출력 인터페이스를 재설계하는 흐름이 강합니다. 결국 좋은 생성 prior를 어떻게 정확한 공간 제어로 바꾸느냐가 실용 성능을 가르는 포인트로 보입니다.

📄Multimodal & Generative5

PanoWorld: Real-World Panoramic Generation실세계 파노라마 생성 모델 PanoWorld12

PanoWorld는 DPRC와 GMA로 파노라마의 회전 등가성을 활용해 장거리 메모리를 강화하고, 실제·시뮬레이션 World360 데이터셋에서 대규모 공간 변화와 조명 변화에도 물리적으로 일관된 생성 성능을 보였습니다.

Latent-Identity Tuning in Text-to-Image Personalization Models텍스트-이미지 개인화 모델의 잠재 정체성 튜닝

이 방법은 추가 학습 없이 개인화 T2I의 frozen encoder 잠재공간에서 identity semantic direction을 찾아, 동일 인물성을 유지한 채 얼굴 속성을 정밀 편집할 수 있게 합니다.

Motion4Motion: Motion Transfer Across Subjects at Inference추론 시점에 다양한 대상 간 모션을 옮기는 Motion4Motion

Motion4Motion은 사람 골격에 묶인 기존 방식에서 벗어나 skeleton-free·training-free로 비디오 간 motion flow를 직접 이전해, 동물과 이종 캐릭터까지 모션 스타일을 보존하며 전이합니다.

💡 멀티모달 생성은 파노라마 세계모델, 정체성 편집, 모션 전이, 3D 메시처럼 더 긴 시간축과 더 강한 구조 제약을 다루는 방향으로 확장되고 있습니다. 단순히 보기 좋은 생성에서 벗어나, 기하·정체성·메모리 일관성을 유지하는 것이 다음 경쟁력임을 보여줍니다.

📄Training & Optimization4

Proxy Exploration and Reusable Guidance: A Modular LLM Post-Training Paradigm via Proxy-Guided Update Signals프록시 탐색과 재사용 가능한 가이던스로 여는 모듈형 LLM 후학습

PUST는 가벼운 proxy 모델에서 고보상 행동을 먼저 탐색한 뒤 그 상대적 개선 신호만 본 모델로 이전해, 비싼 정책 탐색을 분리하면서도 재사용·비동기·교차모델 전이를 가능하게 합니다.

Weak-to-Strong Generalization via Direct On-Policy Distillation약한 모델에서 강한 모델로, 직접 온폴리시 증류

Direct-OPD는 작은 모델의 RL 전후 체크포인트 차이에서 얻은 log-ratio를 dense implicit reward로 사용해, 비싼 강한 모델 롤아웃 없이도 RL 유도 정책 이동만 효율적으로 이전합니다.

Trust Region Policy Distillation신뢰영역 정책 증류 TOP-D

TOP-D는 proximal teacher를 동적으로 구성해 고분산 OPD를 trust-region 방식으로 안정화하고, 수학 추론에서 추가 계산비용 없이 더 높은 안정성·샘플 효율·최종 성능을 달성합니다.

💡 후학습과 압축은 점점 더 '비싼 본모델을 직접 굴리지 않는' 방향으로 진화하고 있습니다. 프록시 탐색, 정책 이동 증류, trust-region 안정화, 2차 정보 기반 양자화 모두 계산비를 줄이면서도 신호 품질을 높이려는 공통된 문제의식을 드러냅니다.

🗣️Language Models4

NeuroCogMap Reveals Cognitive Organization of Large Language ModelsNeuroCogMap이 밝힌 대형언어모델의 인지 조직

NeuroCogMap은 LLM 내부 표현을 기능적 parcel로 조직화해 환각·편향·아첨·거절 실패를 각기 다른 인지적 교란으로 연결하며, 모델 해석과 실패 예측의 새로운 지도를 제시합니다.

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification고급 수학 증명 생성·검증 벤치마크 AdvancedMathBench

AdvancedMathBench는 학부~박사 예선 수준 296문항의 ProverBench와 전문가 주석 기반 자동 검증기를 결합해, 정답 여부를 넘어 증명 과정의 오류 유형까지 세밀하게 평가합니다.

MET: Theory-Grounded and Culture-Aware Multilingual Moral Reasoning이론 기반·문화 인지형 다국어 도덕 추론 MET

MET는 문화·상황별 도덕 근거를 먼저 선택한 뒤 추론하는 2단계 프롬프팅과 다국어 벤치마크 MCLASH를 제안해, 영어 중심·직역 중심 평가의 한계를 넘는 도덕 판단 체계를 제시합니다.

💡 LLM 연구는 성능 향상뿐 아니라 내부 인지 구조, 고급 수학 증명, 문화 맥락의 도덕 판단, 시각 기반 언어 지능까지 평가와 학습의 토대를 넓히고 있습니다. 이제 '무엇을 맞히는가'보다 '어떤 표현과 근거로 추론하는가'를 묻는 단계로 넘어가고 있습니다.

📄Robotics & RL3

EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos1인칭 영상으로 조종 가능한 정교 조작을 향한 풀스택 시스템 EgoSteer

EgoSteer는 9.6K시간 규모의 정제된 egocentric 데이터와 world-model 강화 VLA, DAgger 후학습을 결합해 40개 이상 작업에서 자유형 언어 지시를 따르는 steerable dexterous manipulation을 보였습니다.

Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model월드 파운데이션 모델 기반 통합 embodied 생성 Xiaomi-Robotics-U0

Xiaomi-Robotics-U0는 380억 파라미터 멀티모달 자기회귀 모델로 텍스트-이미지·편집·scene generation·transfer·video를 하나로 묶어, 다중 embodiment에서 고품질 멀티뷰 장면 생성을 지원합니다.

ABot-N1: Toward a General Visual Language Navigation Foundation Model범용 시각언어 내비게이션 파운데이션 모델을 향한 ABot-N1

ABot-N1은 CoT 기반 slow reasoner가 pixel goal을 만들고 fast controller가 이를 실행하는 slow-fast 구조로, 좌표 드리프트를 줄이면서 다양한 VLN 과제에 더 해석 가능한 제어 인터페이스를 제공합니다.

💡 로보틱스는 데이터 파이프라인, world model, 추론-제어 분리, 통합 생성 모델을 묶는 풀스택화가 두드러집니다. 범용성은 더 큰 정책 하나에서 나오기보다, 추론·메모리·제어 인터페이스를 명확히 나누고 연결하는 시스템 설계에서 나오고 있습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택