오늘의 한줄

오늘은 에이전트의 학습 환경·메모리·스킬을 함께 설계해 성능을 끌어올리는 연구와, 비전·멀티모달 생성 모델을 더 실용적이고 제어 가능하게 만드는 연구가 두드러졌습니다. 특히 시뮬레이션 가능한 3D 재구성, 병렬 툴 사용 RL, 합성 데이터 기반 리서치 에이전트 학습처럼 실제 배치와 평가를 염두에 둔 작업이 많았습니다.

👁️Computer Vision3

TriSplat: Simulation-Ready Feed-Forward 3D Scene ReconstructionTriSplat: 시뮬레이션 가능한 피드포워드 3D 장면 재구성91

TriSplat은 가우시안 대신 방향성 삼각형 프리미티브를 직접 예측해 단일 포워드 패스로 메시를 출력하며, 희소 뷰·포즈 프리 설정에서도 물리 시뮬레이션과 embodied interaction에 바로 쓸 수 있는 3D 장면을 만듭니다.

Coloring the Noise: Adversarial Sobolev Alignment for Faithful Image Super ResolutionColoring the Noise: 충실한 초해상도를 위한 적대적 Sobolev 정렬71

ASASR은 자연 이미지의 주파수 감쇠에 맞춰 노이즈 커널을 색칠하고 Sobolev 기하에 기반한 적대 샘플을 학습에 넣어, 고주파 디테일은 살리면서 환각을 줄이는 초해상도 정렬 프레임워크를 제안합니다.

InstructSAM: Segment Any Instance with Any InstructionsInstructSAM: 어떤 지시로도 어떤 인스턴스든 분할하기17

InstructSAM은 VLM 안에 학습 가능한 인스턴스 쿼리를 주입하고 이를 SAM3의 detector query로 연결해, 복합 지시와 다중 객체를 단일 포워드 패스로 정확히 분할하는 instruction-driven segmentation을 구현합니다.

💡 비전 쪽에서는 단순히 보기 좋은 결과보다 바로 활용 가능한 구조적 출력이 중요해지고 있습니다. 메시 직접 생성, 주파수 정렬 기반 복원, 지시 기반 다중 인스턴스 분할처럼 후처리와 수작업 프롬프팅을 줄이는 방향이 뚜렷합니다.

📄Multimodal & Generative6

Lens: Rethinking Training Efficiency for Foundational Text-to-Image ModelsLens: 기초 텍스트-투-이미지 모델의 학습 효율 재설계113

Lens는 3.8B 규모로도 6B+급 T2I 모델과 경쟁하거나 능가하며, GPT-4.1 기반 평균 109단어의 밀집 캡션 데이터와 다중 해상도 배치 구성으로 Z-Image 대비 약 19.3%의 학습 연산만으로 성능을 냈습니다.

See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object UnderstandingSee What I Mean: 비디오 세밀 객체 이해를 위한 비전-언어 표현 정렬83

SWIM은 학습 시 마스크 감독으로 명사-시각 주의 불일치를 교정하고 NL-Refer 데이터셋을 함께 도입해, 추론 시 별도 포인트·마스크 없이도 텍스트만으로 비디오 속 세밀 객체를 더 정확히 찾도록 만듭니다.

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model EvaluationWBench: 상호작용형 비디오 월드 모델 평가를 위한 종합 멀티턴 벤치마크46

WBench는 289개 테스트 케이스와 1,058개 상호작용 턴, 22개 자동 지표로 비디오 품질·설정 준수·상호작용 일관성·물리 적합성을 함께 평가해 인터랙티브 월드 모델의 공통 기준을 제시합니다.

💡 멀티모달·생성 연구는 더 큰 모델보다 더 효율적인 학습 데이터 설계와 구조적 정렬에 무게가 실리고 있습니다. 동시에 비디오 월드 모델과 네이티브 멀티모달링처럼 생성 품질뿐 아니라 상호작용성, 평가 가능성, 아키텍처 일관성을 함께 보려는 흐름이 강해졌습니다.

💻Code & Agents7

SkillOpt: Executive Strategy for Self-Evolving Agent SkillsSkillOpt: 자기진화 에이전트 스킬을 위한 실행형 최적화 전략72

SkillOpt는 고정된 에이전트 외부의 단일 스킬 문서를 텍스트 공간에서 add/delete/replace로 최적화하고, 검증 점수가 엄격히 개선될 때만 반영해 6개 벤치마크와 7개 모델에서 안정적인 스킬 진화를 보여줍니다.

SEAL: Synergistic Co-Evolution of Agents and Learning EnvironmentsSEAL: 에이전트와 학습 환경의 시너지 공동 진화41

SEAL은 실패 궤적을 턴 단위로 진단해 같은 신호로 환경의 피드백 인터페이스와 정책 업데이트를 함께 개선함으로써, 정적 환경에 갇힌 기존 자기진화 에이전트의 agent-environment misalignment를 줄입니다.

SciAtlas: A Large-Scale Knowledge Graph for Automated Scientific ResearchSciAtlas: 자동화 과학 연구를 위한 대규모 지식 그래프44

SciAtlas는 26개 학문 분야의 4,300만 편 논문, 1억5,700만 엔티티, 30억 트리플을 연결한 대규모 학술 지식 그래프로, 키워드 검색과 벡터 검색이 놓치는 논리적 연결을 에이전트 연구 파이프라인에 제공합니다.

💡 에이전트 연구는 이제 모델 자체보다 스킬 문서, 메모리, 학습 환경, 지식 기반, 벤치마크를 함께 설계하는 시스템 공학으로 이동하고 있습니다. 특히 검증 가능한 보상과 합성 데이터, 장기 상태 관리가 실전형 에이전트 성능을 좌우한다는 공감대가 커졌습니다.

📄Robotics & RL2

ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement LearningParaVT: 에이전트형 비디오 강화학습의 병렬 툴 사용을 위한 Tool Prior Paradox 해결33

ParaVT는 긴 비디오 이해에서 여러 시간 구간 crop을 한 턴에 병렬 호출하는 최초의 end-to-end RL 프레임워크로, Tool Prior Paradox를 짚고 순차 호출의 오류 전파와 비용 증가 문제를 줄였습니다.

PhotoFlow: Agentic 3D Virtual Photography MissionsPhotoFlow: 에이전트형 3D 가상 사진 촬영 미션24

PhotoFlow는 Director-Reviewer-Reflector의 폐루프 카메라 탐색으로 3D 장면에서 언어 의도에 맞는 구도와 카메라 파라미터를 찾고, 47개 Blender 장면·141개 미션의 VPhotoBench로 공간 이해와 미학 판단을 함께 평가합니다.

💡 강화학습 기반 에이전트는 더 복잡한 시각 환경에서 병렬 행동과 폐루프 반성을 도입하며 안정성과 효율을 높이고 있습니다. 비디오 툴 사용과 가상 사진 촬영 모두, 한 번의 선택보다 반복적 탐색과 다중 후보 비교가 성능 핵심임을 보여줍니다.

📄Training & Optimization1

Reinforcing Few-step Generators via Reward-Tilted Distribution Matching보상 편향 분포 정합으로 적은 스텝 생성기 강화하기17

RTDMD는 few-step 플로우 생성기를 위해 분포 정합과 보상 최대화를 하나의 KL 목표로 묶고, AC-DMD와 하이브리드 정책 그래디언트를 결합해 효율 생성과 선호 정렬을 동시에 달성합니다.

💡 생성 모델 정렬은 이제 보상 최적화만이 아니라 분포 정합을 함께 다루는 방향으로 정교해지고 있습니다. 특히 적은 스텝 생성기에서도 teacher 분포와 reward를 하나의 수학적 목표로 묶으려는 시도가 실용성과 이론을 동시에 챙깁니다.

🗣️Language Models1

Equilibrium Reasoners: Learning Attractors Enables Scalable ReasoningEquilibrium Reasoners: 끌개 학습으로 확장 가능한 추론25

EqR은 정답에 해당하는 안정적 고정점을 task-conditioned attractor로 학습해, 외부 검증기 없이도 반복 깊이와 다중 초기화 폭을 늘리는 테스트타임 계산 확장으로 더 어려운 추론 문제에 적응합니다.

💡 언어 모델 추론 연구는 더 많은 토큰을 쓰는 것에서 나아가, 내부 동역학이 어떻게 해를 향해 수렴하는지 자체를 학습하려는 단계로 넘어가고 있습니다. 테스트타임 계산 확장의 성패가 결국 안정적인 attractor를 만들 수 있느냐에 달렸다는 관점이 인상적입니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택