오늘의 한줄

오늘은 장기 과제에서의 에이전트 신뢰성·안전성 평가와, 비디오/월드모델의 물리적 일관성 및 실시간성 개선이 특히 두드러졌습니다. 동시에 LLM 인프라, 메모리, 해석 가능성까지 포함해 실제 배포와 운영을 위한 시스템 연구가 빠르게 성숙하고 있음을 보여줍니다.

🗣️Language Models3

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM RoutersLLM 라우터 개발·평가·배포를 위한 통합 인프라2,346

LLMRouter는 라우팅을 5요소 순차 의사결정으로 통합 정식화하고 xRouteBench와 16종 이상 라우터 인프라를 제공해, 품질·비용을 함께 최적화하는 학습형 라우터가 강한 기준선을 일관되게 앞선다는 점을 보여줍니다.

LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation의미 구간 단위 통합으로 효율을 높인 LLM 에이전트 장기 기억1,161

LycheeMemory V2는 턴마다 요약하던 기존 방식 대신 의미 구간 단위로 메모리를 통합해 LLM 인코딩 호출을 줄이면서도 사건·시간 맥락을 보존해, 장기 대화 에이전트의 메모리 구축 비용을 크게 낮춥니다.

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence지능 메커니즘 발견을 위한 과학 도구로서의 AI28

Mechanist는 1.3만 편 해석가능성 지식그래프와 4,300만 편 학술 데이터, 32개 메커니즘 분석 기법을 결합한 에이전트 시스템으로, 기존 AI 과학자·코딩 에이전트보다 더 가치 있는 메커니즘 가설과 검증 경로를 생성합니다.

💡 LLM 연구는 이제 단순 성능 경쟁보다 운영 인프라, 장기 기억, 해석 가능성처럼 실제 시스템화에 필요한 기반 기술로 무게중심이 이동하고 있습니다. 특히 라우팅과 메모리 최적화, 메커니즘 탐구 자동화는 더 큰 모델을 쓰는 것보다 ‘어떻게 통제하고 배치할 것인가’가 핵심 과제로 떠오름을 보여줍니다.

💻Code & Agents7

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill조합형 스킬로 구현한 종단간 연구논문 생성531

Spark-to-Paper는 문헌 검색·실험 설계·실행·도표 생성·주장 수정까지 13개 조합형 스킬로 논문 작성을 종단간 자동화하며, 결정적 무결성 검사와 Self-Refutation Loop 억제로 긴 연구 궤적의 신뢰성을 높였습니다.

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive NarrativesLLM 에이전트는 서사를 끝까지 지킬 수 있을까? 장기 일관성 벤치마크25

NCP-Bench는 영화 시놉시스 기반 100개 인터랙티브 서사 환경에서 Narrative Commitment Preservation을 자동 점검하며, 강력한 LLM도 언어 품질과 별개로 장기 논리 일관성 유지에는 큰 격차가 있음을 드러냈습니다.

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design장기 에이전트 디자인을 위한 메타 하니스 최적화26

AutoDesign은 메타 하니스 최적화기가 코드 에이전트의 설계 파이프라인을 롤아웃 피드백으로 재귀 개선하게 하며, 새로 제안한 PosterBench에서 78.32점으로 상용 시스템을 능가해 장기 디자인 작업의 자기개선 가능성을 보였습니다.

💡 에이전트 분야는 논문 작성, 디자인, 소프트웨어 진화처럼 장기 과업을 실제로 끝내는 능력과, 그 과정에서의 일관성·보안·안전성을 함께 검증하는 방향으로 빠르게 확장되고 있습니다. 정적인 단발성 평가를 넘어 상태가 누적되는 환경과 재귀적 자기개선 루프를 다루는 것이 다음 경쟁력으로 보입니다.

👁️Computer Vision3

Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands손 관절별 가시성 추정을 위한 핸드 비저빌리티 디텍터36

Hand Visibility Detector는 손 자세 추정의 보조 신호가 아닌 독립 과제로 손 관절별 가시성 추정을 체계화하고, 대규모 사전학습 HPE 백본을 활용해 가려짐 상황에서 신뢰도 판단에 유의미한 성능을 달성했습니다.

Gaze Target Estimation Anywhere with Concepts개념 프롬프트로 어디서나 시선 목표 추정21

이 논문은 사람 박스나 포즈 입력에 의존하던 다단계 파이프라인을 버리고, 텍스트·시각 프롬프트로 대상을 지정하는 Promptable Gaze Target Estimation을 제안해 주체 식별과 시선 추정을 하나의 종단간 문제로 통합했습니다.

RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived ProjectionsCT 투영 영상 기반 이중평면 갈비뼈 골절 탐지와 선택적 3D 위치 추정2

RibAssist 3D는 CT 유래 AP·측면 투영에서 골절을 짝지어 3D 위치를 복원하며, 정답 대응이 주어지면 중앙 오차 4.0mm와 93.6% rib-exact를 달성해 핵심 병목이 기하가 아니라 측면 검출기 품질임을 밝혔습니다.

💡 비전 연구는 단순 검출 정확도보다 ‘무엇을 얼마나 믿을 수 있는가’와 ‘사용자가 어떻게 문제를 지정하는가’에 더 초점을 맞추고 있습니다. 관절 가시성, 프롬프트 기반 시선 추정, 선택적 3D 위치화 모두 신뢰 가능한 인간 중심 인터페이스로의 진화를 시사합니다.

📄Robotics & RL1

DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation로봇 조작을 위한 행동 조건부 비디오 월드모델38

DreamX-Phi 1.0은 PRoPE식 SE(3) 기하 인코딩, 깊이 분기, SAM3+V-JEPA 기반 객체 일관성, 분포 정합 증류를 결합해 로봇 조작 비디오 예측에서 그럴듯함을 넘어 명령된 팔 궤적과 물체 상태를 더 충실히 따릅니다.

💡 로보틱스용 월드모델은 이제 그럴듯한 영상 생성만으로는 부족하고, 행동 명령·기하 구조·객체 일관성을 얼마나 충실히 보존하느냐가 핵심 평가축이 되고 있습니다. 실제 조작에 쓰려면 시각적 사실감보다 제어 가능성과 물리적 정합성이 우선이라는 메시지가 분명합니다.

📄Multimodal & Generative5

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives장기 목표를 수행하는 에이전트 플레이어 기반 월드모델 벤치마크48

PlayWorld는 고정 액션 대신 멀티모달 에이전트 플레이어가 171개 시나리오에서 장기 목표를 수행하게 해, 상호작용형 월드모델을 실제 사용 방식에 가깝게 공정 비교하는 평가 패러다임을 제시합니다.

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time실시간 장편 스트리밍 인간 애니메이션14

LiveAnimate는 14B 비디오 DiT를 블록-인과형 생성기로 적응시키고 3스텝 증류와 PR-Sink 캐시를 도입해, 단일 참조 이미지 기반 인간 애니메이션을 실시간 스트리밍과 장시간 외형 안정성까지 동시에 달성했습니다.

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning잠재 동역학 추론으로 외삽하는 비디오 월드모델28

Latent Dynamics Reasoning은 잠재 전이를 명시적 운동학 적분으로 모델링해 고차 잔차만 학습함으로써, PhyWorld의 OOD 물리 과제에서 픽셀 적합형 비디오 확산모델보다 법칙 준수와 외삽 능력을 더 잘 확보했습니다.

💡 멀티모달 생성은 실시간성, 장기 일관성, 물리 법칙 준수, 그리고 오디오-비주얼 공동 제어까지 요구 수준이 빠르게 높아지고 있습니다. 동시에 평가도 고정 입력 기반 점수에서 벗어나, 에이전트가 목표를 수행하며 모델 세계를 시험하는 상호작용형 방식으로 이동하는 흐름이 뚜렷합니다.

📄Training & Optimization1

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus하이브리드 선형 어텐션 LLM의 대규모 활성화: 사전 어텐션 스파이크와 스파이크 간 평탄부5

이 연구는 하이브리드 선형 어텐션 LLM에서 Massive Activation이 full attention 직전 PAS와 그 사이 ISP 형태로 반복됨을 1.2B~397B 모델 전반에서 체계적으로 규명해, 안정성·해석 가능성 분석의 새로운 구조적 단서를 제공합니다.

💡 학습·최적화 측면에서는 새로운 아키텍처를 키우는 것만큼, 그 내부에서 반복적으로 나타나는 활성화 패턴을 이해하고 제어하는 일이 중요해지고 있습니다. 특히 하이브리드 어텐션 구조의 공통 현상을 체계화한 이번 연구는 향후 안정화와 효율화 기법의 이론적 발판이 될 가능성이 큽니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택