오늘의 한줄
오늘은 장기 실행 환경에서의 에이전트 신뢰성, 자기개선형 코딩 시스템, 그리고 비디오·4D 생성의 구조화가 핵심 흐름으로 보입니다. 특히 단발성 성능보다 지속성, 검증 가능성, 환경 적응력을 어떻게 시스템 설계에 녹이느냐가 연구의 중심으로 이동하고 있습니다.
💻Code & Agents10
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill조합형 스킬로 구현한 연구 아이디어부터 논문까지 자동 생성⭐ 531
Spark-to-Paper는 문헌 검색·실험 설계·결과 반영·도표 생성까지 13개 스킬로 분해해 기존 코딩 어시스턴트 안에서 논문 작성 전 과정을 수행하며, Self-Refutation Loop를 억제하는 무결성 검사와 자기비평을 결합했습니다.
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence지능 메커니즘 발견을 위한 과학 도구로서의 AI⭐ 28
Mechanist는 해석가능성 논문 1.3만 편 지식그래프와 32개 메커니즘 분석 도구를 결합한 에이전트 시스템으로, Claude Code나 기존 AI scientist보다 더 가치 있는 메커니즘 가설을 자율 생성하도록 설계됐습니다.
Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design인간 설계를 넘어서는 에이전트 시스템의 공진화⭐ 30
이 서베이는 에이전트-에이전트, 에이전트-환경, 메타 공진화의 3단계 분류를 제시하며, 배포 후 스스로 진화하는 에이전트 시스템의 평가·확장·설계 과제를 정리했습니다.
💡 에이전트 연구의 무게중심이 단발성 태스크 해결에서 장기 지속성, 자기개선, 환경 기반 평가와 공격으로 빠르게 이동하고 있습니다. 특히 코딩·과학발견·생활비서까지 공통적으로 '상태를 축적하는 세계에서 얼마나 일관되고 검증 가능하게 행동하느냐'가 핵심 경쟁력으로 보입니다.
📄Multimodal & Generative5
Beyond Pixels: From Video Priors to 4D Worlds비디오 사전지식에서 4D 세계로 넘어가기⭐ 73
Latent-to-4D는 비디오 모델의 최종 latent를 재사용 가능한 4D 인터페이스로 삼아 RGB 재구성 없이 직접 4D를 예측하며, 약 1천 개 클립만으로 학습한 단일 체크포인트를 여러 비디오 확산 모델에 그대로 전이합니다.
Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning잠재 동역학 추론으로 세계의 진화를 배우는 비디오 월드 모델⭐ 28
LDR은 잠재 전이를 명시적 운동학 적분으로 모델링하고 고차 잔차만 회귀해, PhyWorld의 OOD 물리 과제에서 픽셀 적합형 비디오 확산 모델보다 더 잘 외삽하는 월드 모델을 구현했습니다.
Ex-Omni-2D: Expressive Omni-Modal Dialogue Models with Native Visual Presence시각적 존재감을 갖춘 표현형 옴니모달 대화 모델⭐ 17
Ex-Omni-2D는 Visual Thought Plan과 공유 음향-시간 인터페이스를 통해 텍스트·개인화 음성·레퍼런스 기반 비디오를 동시 생성하며, 대규모 완전 정렬 데이터 없이도 아바타 응답을 학습합니다.
💡 멀티모달 생성은 더 이상 픽셀을 잘 그리는 데서 멈추지 않고, latent 구조·동역학·시각 증거의 인과성까지 모델링하는 방향으로 진화하고 있습니다. 실용 측면에서는 장문서 이해, 아바타 응답, 4D 생성처럼 계산 자원을 어디에 선택적으로 쓰느냐가 성능과 비용을 함께 가르는 포인트로 보입니다.
🗣️Language Models1
Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation오픈 LLM의 다국어 기계번역을 위한 레퍼런스 없는 사후학습⭐ 70
MiLMMT-46-v1.0은 품질추정 기반 보상과 언어 식별 게이팅을 적용한 GRPO, 그리고 SFT·RL 체크포인트 보간으로 46개 언어 번역 품질을 일관되게 끌어올리며 여러 오픈·상용 강자를 상회했습니다.
💡 번역 분야에서는 레퍼런스 없는 품질추정 보상과 RL 후처리가 오픈 LLM의 실전 경쟁력을 크게 끌어올리는 흐름이 뚜렷합니다. 지도학습만으로는 넘기 어려운 품질 프런티어를, 보상 설계와 체크포인트 보간 같은 사후학습 기법이 메우고 있습니다.
👁️Computer Vision3
Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands손 관절별 가시성 추정을 위한 핸드 비저빌리티 디텍터⭐ 36
Hand Visibility Detector는 손 자세 추정의 보조 신호가 아닌 독립 과제로서 관절별 가시성 추정을 체계화했고, 대규모 사전학습 HPE 백본 활용이 가려짐 상황의 신뢰도 판단을 크게 높인다고 보여줍니다.
Gaze Target Estimation Anywhere with Concepts개념 프롬프트로 어디서나 시선 타깃 추정⭐ 21
이 논문은 '빨간 셔츠를 입은 소년' 같은 텍스트나 포인트 입력으로 대상을 지정하는 Promptable Gaze Target Estimation을 제안해, 기존 다단계 파이프라인의 검출 오류 전파 문제를 줄였습니다.
From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection물리 기반 반사 합성부터 확산형 비디오 반사 제거까지
이 연구는 거칠기·유리 두께·반사율 변화를 반영한 S2R-Synthesis로 paired 데이터를 만들고, 이를 바탕으로 첫 확산 기반 비디오 반사 제거 모델 S2R-Removal과 전용 벤치마크를 함께 제시했습니다.
💡 비전 연구는 예측 정확도 자체뿐 아니라 예측의 신뢰도와 데이터 생성 파이프라인까지 함께 다루는 방향으로 넓어지고 있습니다. 손 관절 가시성, 시선 타깃 지정, 비디오 반사 제거처럼 실제 배치 환경의 가림·반사·모호성을 정면으로 다루는 점이 인상적입니다.
📄Robotics & RL1
360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents실사형 가상 도시 내비게이션을 위한 360CityArena⭐ 11
360CityArena는 도쿄 아키하바라를 602개 360도 영상과 175개 과제로 재구성한 도시 탐험 벤치마크이며, Gemini 2.5 Flash조차 인간 수준에 크게 못 미쳐 현실적 공간 추론의 난도를 보여줍니다.
💡 현실적인 도시 탐험 벤치마크가 등장하면서 embodied agent의 공간 이해 격차가 더 선명하게 드러나고 있습니다. 실사형 환경과 장기 경로 추론이 결합될수록, 현재의 강한 멀티모달 모델도 여전히 기초적인 현장 적응에서 멀었다는 점을 보여줍니다.