오늘의 한줄
오늘은 장기 맥락을 다루는 LLM 에이전트 인프라와 벤치마크, 그리고 비디오·월드모델을 중심으로 한 멀티모달 생성 연구가 특히 두드러졌습니다. 동시에 장기 소프트웨어 진화, 레드팀 자동화, 현실적인 내비게이션 평가처럼 에이전트를 실제 환경과 시간축 위에 올려놓는 흐름도 강해지고 있습니다.
💻Code & Agents9
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM RoutersLLM 라우터 개발·평가·배포를 위한 통합 인프라⭐ 2,346
LLMRouter는 라우팅을 5개 구성요소의 순차 의사결정 문제로 통합 정식화하고 xRouteBench와 16종 이상 라우터를 제공해, 품질·비용을 함께 최적화하는 학습형 라우터가 휴리스틱보다 우수함을 보여줍니다.
LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation의미 단위 세그먼트 통합으로 효율화한 LLM 에이전트 장기 기억⭐ 1,161
LycheeMemory V2는 매 턴마다 기억을 요약하던 방식을 의미적 세그먼트 단위 통합으로 바꿔 LLM 호출 빈도를 줄이면서도 사건·시간 맥락을 보존해 장기 에이전트 메모리의 구축 비용을 낮춥니다.
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill조합형 스킬로 구현한 엔드투엔드 연구 논문 생성⭐ 531
Spark-to-Paper는 문헌 검색, 실험 설계·실행, 그림 생성, 주장 수정까지 13개 스킬로 분해해 코딩 어시스턴트 안에서 논문 작성 전 과정을 수행하며 Self-Refutation Loop를 억제하는 무결성 점검을 도입했습니다.
💡 에이전트 연구는 이제 단일 태스크 성능보다 장기 지속성, 자기개선, 안전성, 그리고 작업 환경 자체의 설계로 무게중심이 이동하고 있습니다. 특히 메모리·라우팅·하네스·버전 히스토리·환경 진화처럼 에이전트 바깥의 운영 인프라가 성능을 결정하는 핵심 레이어로 부상하고 있습니다.
🗣️Language Models1
Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation오픈 LLM의 다국어 기계번역을 위한 레퍼런스 없는 사후학습⭐ 70
MiLMMT-46-v1.0은 46개 언어에서 품질추정 기반 GRPO와 체크포인트 보간을 결합해 번역 품질을 일관되게 끌어올렸고, 여러 오픈 베이스라인과 일부 상용 시스템 대비 선도적 레퍼런스 프리 점수를 달성했습니다.
💡 번역 분야에서는 레퍼런스가 없는 보상 신호와 RL 후처리가 실용적인 성능 향상 수단으로 자리잡고 있습니다. 지도학습 체크포인트와 RL 체크포인트를 보간하는 식의 단순하지만 강한 조합이, 오픈 모델의 품질 상한을 현실적으로 끌어올리는 방향으로 보입니다.
📄Multimodal & Generative5
Beyond Pixels: From Video Priors to 4D Worlds비디오 사전지식에서 4D 월드로⭐ 73
Latent-to-4D는 비디오 모델의 최종 latent를 재사용 가능한 4D 인터페이스로 삼아 RGB 재구성 없이 직접 4D 장면을 생성하며, 약 1천 개 클립만으로 여러 비디오 확산 모델에 동일 체크포인트를 전이합니다.
LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time실시간 장기 스트리밍 인간 애니메이션 LiveAnimate⭐ 14
LiveAnimate는 14B 비디오 DiT를 블록-인과 생성기로 적응시키고 3스텝 증류와 PR-Sink 캐시를 적용해, 단일 참조 이미지 기반 포즈 구동 인간 애니메이션을 실시간·장시간 안정적으로 생성합니다.
Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning잠재 동역학 추론으로 외삽하는 비디오 월드모델⭐ 28
LDR은 잠재 전이를 명시적 운동학 적분으로 모델링하고 고차 잔차만 회귀해, 물리 벤치마크 5개 과제의 OOD 설정에서 픽셀 적합형 비디오 확산모델보다 더 잘 외삽하는 월드모델을 구현했습니다.
💡 비디오 생성은 더 이상 보기 좋은 픽셀을 넘어서 4D 구조, 동역학, 실시간성, 음성-영상 동기화까지 함께 다루는 단계로 진화하고 있습니다. 공통 latent 인터페이스와 소수 스텝 증류가 다양한 생성기와 응용을 연결하는 실용적 축으로 반복해서 등장하는 점이 인상적입니다.
👁️Computer Vision2
Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands손 관절별 가시성 추정을 위한 핸드 비저빌리티 디텍터⭐ 36
Hand Visibility Detector는 손 자세 추정과 별개로 관절별 가시성을 독립 과제로 정식화하고, 대규모 사전학습 HPE 백본을 활용해 가림 상황에서 포즈 신뢰도를 직접 판단할 수 있게 했습니다.
Gaze Target Estimation Anywhere with Concepts개념 프롬프트로 어디서나 시선 대상을 추정하기⭐ 21
GazeAnywhere는 '빨간 셔츠를 입은 소년' 같은 텍스트·시각 프롬프트로 피험자 지정과 시선 대상 추정을 한 번에 수행하는 Promptable Gaze Target Estimation을 제안해, 기존 다단계 파이프라인의 오류 전파를 줄입니다.
💡 비전 태스크도 점점 더 독립적인 신뢰도 추정과 프롬프트 기반 유연성을 요구받고 있습니다. 즉, 단순히 좌표를 잘 맞히는 모델보다 가려짐을 설명하고, 사용자가 지정한 개념에 맞춰 바로 분석할 수 있는 인터페이스가 중요해지고 있습니다.
📄Robotics & RL3
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation로봇 조작을 위한 행동 조건부 비디오 월드모델 DreamX-Phi 1.0⭐ 38
DreamX-Phi 1.0은 PRoPE식 SE(3) 인코딩, 깊이 브랜치, SAM3+V-JEPA 기반 객체 일관성, 소수 스텝 증류를 결합해 로봇 조작에서 명령된 팔 궤적과 물체 상태를 더 충실히 예측하는 비디오 월드모델을 제시합니다.
PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives장기 목표를 따라 에이전트 플레이어로 평가하는 월드모델 벤치마크⭐ 48
PlayWorld는 고정 액션 시퀀스 대신 멀티모달 에이전트 플레이어가 171개 장기 목표 시나리오를 수행하도록 해, 상호작용형 비디오 월드모델을 더 공정하고 실제 사용 방식에 가깝게 비교합니다.
360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents현실적인 가상 도시 내비게이션 벤치마크 360CityArena⭐ 11
360CityArena는 도쿄 아키하바라의 602개 360도 비디오와 175개 수작업 과제로 구성된 도시 탐색 벤치마크로, Gemini 2.5 Flash조차 인간 수준에 크게 못 미쳐 현실적 공간 추론의 난도를 드러냈습니다.
💡 월드모델과 embodied 평가 모두 장기 목표 달성과 물리적 충실성을 더 엄격하게 따지는 방향으로 가고 있습니다. 실제 조작과 도시 탐색 같은 환경에서는 그럴듯한 비디오보다 행동 결과의 일관성과 현실적 공간 추론이 훨씬 더 중요한 평가 기준이 되고 있습니다.