오늘의 한줄
오늘은 장기 과제에서의 에이전트 신뢰성·안전성 평가와, 비디오/월드모델의 물리적 일관성 및 실시간성 개선이 특히 두드러졌습니다. 동시에 LLM 인프라, 메모리, 해석 가능성까지 포함해 실제 배포와 운영을 위한 시스템 연구가 빠르게 성숙하고 있음을 보여줍니다.
🗣️Language Models3
LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM RoutersLLM 라우터 개발·평가·배포를 위한 통합 인프라⭐ 2,346
LLMRouter는 라우팅을 5요소 순차 의사결정으로 통합 정식화하고 xRouteBench와 16종 이상 라우터 인프라를 제공해, 품질·비용을 함께 최적화하는 학습형 라우터가 강한 기준선을 일관되게 앞선다는 점을 보여줍니다.
LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation의미 구간 단위 통합으로 효율을 높인 LLM 에이전트 장기 기억⭐ 1,161
LycheeMemory V2는 턴마다 요약하던 기존 방식 대신 의미 구간 단위로 메모리를 통합해 LLM 인코딩 호출을 줄이면서도 사건·시간 맥락을 보존해, 장기 대화 에이전트의 메모리 구축 비용을 크게 낮춥니다.
Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence지능 메커니즘 발견을 위한 과학 도구로서의 AI⭐ 28
Mechanist는 1.3만 편 해석가능성 지식그래프와 4,300만 편 학술 데이터, 32개 메커니즘 분석 기법을 결합한 에이전트 시스템으로, 기존 AI 과학자·코딩 에이전트보다 더 가치 있는 메커니즘 가설과 검증 경로를 생성합니다.
💡 LLM 연구는 이제 단순 성능 경쟁보다 운영 인프라, 장기 기억, 해석 가능성처럼 실제 시스템화에 필요한 기반 기술로 무게중심이 이동하고 있습니다. 특히 라우팅과 메모리 최적화, 메커니즘 탐구 자동화는 더 큰 모델을 쓰는 것보다 ‘어떻게 통제하고 배치할 것인가’가 핵심 과제로 떠오름을 보여줍니다.
💻Code & Agents7
Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill조합형 스킬로 구현한 종단간 연구논문 생성⭐ 531
Spark-to-Paper는 문헌 검색·실험 설계·실행·도표 생성·주장 수정까지 13개 조합형 스킬로 논문 작성을 종단간 자동화하며, 결정적 무결성 검사와 Self-Refutation Loop 억제로 긴 연구 궤적의 신뢰성을 높였습니다.
Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive NarrativesLLM 에이전트는 서사를 끝까지 지킬 수 있을까? 장기 일관성 벤치마크⭐ 25
NCP-Bench는 영화 시놉시스 기반 100개 인터랙티브 서사 환경에서 Narrative Commitment Preservation을 자동 점검하며, 강력한 LLM도 언어 품질과 별개로 장기 논리 일관성 유지에는 큰 격차가 있음을 드러냈습니다.
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design장기 에이전트 디자인을 위한 메타 하니스 최적화⭐ 26
AutoDesign은 메타 하니스 최적화기가 코드 에이전트의 설계 파이프라인을 롤아웃 피드백으로 재귀 개선하게 하며, 새로 제안한 PosterBench에서 78.32점으로 상용 시스템을 능가해 장기 디자인 작업의 자기개선 가능성을 보였습니다.
💡 에이전트 분야는 논문 작성, 디자인, 소프트웨어 진화처럼 장기 과업을 실제로 끝내는 능력과, 그 과정에서의 일관성·보안·안전성을 함께 검증하는 방향으로 빠르게 확장되고 있습니다. 정적인 단발성 평가를 넘어 상태가 누적되는 환경과 재귀적 자기개선 루프를 다루는 것이 다음 경쟁력으로 보입니다.
👁️Computer Vision3
Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands손 관절별 가시성 추정을 위한 핸드 비저빌리티 디텍터⭐ 36
Hand Visibility Detector는 손 자세 추정의 보조 신호가 아닌 독립 과제로 손 관절별 가시성 추정을 체계화하고, 대규모 사전학습 HPE 백본을 활용해 가려짐 상황에서 신뢰도 판단에 유의미한 성능을 달성했습니다.
Gaze Target Estimation Anywhere with Concepts개념 프롬프트로 어디서나 시선 목표 추정⭐ 21
이 논문은 사람 박스나 포즈 입력에 의존하던 다단계 파이프라인을 버리고, 텍스트·시각 프롬프트로 대상을 지정하는 Promptable Gaze Target Estimation을 제안해 주체 식별과 시선 추정을 하나의 종단간 문제로 통합했습니다.
RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived ProjectionsCT 투영 영상 기반 이중평면 갈비뼈 골절 탐지와 선택적 3D 위치 추정⭐ 2
RibAssist 3D는 CT 유래 AP·측면 투영에서 골절을 짝지어 3D 위치를 복원하며, 정답 대응이 주어지면 중앙 오차 4.0mm와 93.6% rib-exact를 달성해 핵심 병목이 기하가 아니라 측면 검출기 품질임을 밝혔습니다.
💡 비전 연구는 단순 검출 정확도보다 ‘무엇을 얼마나 믿을 수 있는가’와 ‘사용자가 어떻게 문제를 지정하는가’에 더 초점을 맞추고 있습니다. 관절 가시성, 프롬프트 기반 시선 추정, 선택적 3D 위치화 모두 신뢰 가능한 인간 중심 인터페이스로의 진화를 시사합니다.
📄Robotics & RL1
DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation로봇 조작을 위한 행동 조건부 비디오 월드모델⭐ 38
DreamX-Phi 1.0은 PRoPE식 SE(3) 기하 인코딩, 깊이 분기, SAM3+V-JEPA 기반 객체 일관성, 분포 정합 증류를 결합해 로봇 조작 비디오 예측에서 그럴듯함을 넘어 명령된 팔 궤적과 물체 상태를 더 충실히 따릅니다.
💡 로보틱스용 월드모델은 이제 그럴듯한 영상 생성만으로는 부족하고, 행동 명령·기하 구조·객체 일관성을 얼마나 충실히 보존하느냐가 핵심 평가축이 되고 있습니다. 실제 조작에 쓰려면 시각적 사실감보다 제어 가능성과 물리적 정합성이 우선이라는 메시지가 분명합니다.
📄Multimodal & Generative5
PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives장기 목표를 수행하는 에이전트 플레이어 기반 월드모델 벤치마크⭐ 48
PlayWorld는 고정 액션 대신 멀티모달 에이전트 플레이어가 171개 시나리오에서 장기 목표를 수행하게 해, 상호작용형 월드모델을 실제 사용 방식에 가깝게 공정 비교하는 평가 패러다임을 제시합니다.
LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time실시간 장편 스트리밍 인간 애니메이션⭐ 14
LiveAnimate는 14B 비디오 DiT를 블록-인과형 생성기로 적응시키고 3스텝 증류와 PR-Sink 캐시를 도입해, 단일 참조 이미지 기반 인간 애니메이션을 실시간 스트리밍과 장시간 외형 안정성까지 동시에 달성했습니다.
Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning잠재 동역학 추론으로 외삽하는 비디오 월드모델⭐ 28
Latent Dynamics Reasoning은 잠재 전이를 명시적 운동학 적분으로 모델링해 고차 잔차만 학습함으로써, PhyWorld의 OOD 물리 과제에서 픽셀 적합형 비디오 확산모델보다 법칙 준수와 외삽 능력을 더 잘 확보했습니다.
💡 멀티모달 생성은 실시간성, 장기 일관성, 물리 법칙 준수, 그리고 오디오-비주얼 공동 제어까지 요구 수준이 빠르게 높아지고 있습니다. 동시에 평가도 고정 입력 기반 점수에서 벗어나, 에이전트가 목표를 수행하며 모델 세계를 시험하는 상호작용형 방식으로 이동하는 흐름이 뚜렷합니다.
📄Training & Optimization1
Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus하이브리드 선형 어텐션 LLM의 대규모 활성화: 사전 어텐션 스파이크와 스파이크 간 평탄부⭐ 5
이 연구는 하이브리드 선형 어텐션 LLM에서 Massive Activation이 full attention 직전 PAS와 그 사이 ISP 형태로 반복됨을 1.2B~397B 모델 전반에서 체계적으로 규명해, 안정성·해석 가능성 분석의 새로운 구조적 단서를 제공합니다.
💡 학습·최적화 측면에서는 새로운 아키텍처를 키우는 것만큼, 그 내부에서 반복적으로 나타나는 활성화 패턴을 이해하고 제어하는 일이 중요해지고 있습니다. 특히 하이브리드 어텐션 구조의 공통 현상을 체계화한 이번 연구는 향후 안정화와 효율화 기법의 이론적 발판이 될 가능성이 큽니다.