오늘의 한줄

오늘은 장기 과제를 다루는 에이전트의 인프라·안전성·일관성을 체계화하려는 연구와, 비디오 월드모델 및 실시간 생성의 평가·제어력을 끌어올리는 연구가 두드러졌습니다. 동시에 LLM 내부 메커니즘, 메모리, 라우팅처럼 실제 배포 효율과 신뢰성을 높이는 기반 연구도 함께 진전되고 있습니다.

🗣️Language Models3

LLMRouter: Unified Infrastructure for Developing, Evaluating, and Deploying LLM RoutersLLM 라우터 개발·평가·배포를 위한 통합 인프라2,346

LLMRouter는 라우팅을 5요소 순차 의사결정으로 통합 정식화하고 16종 이상 라우터와 xRouteBench를 제공해, 품질·비용을 함께 최적화하는 학습형 라우터의 우수성을 공정 비교 가능하게 했습니다.

LycheeMemory V2: Efficient Long-Term Memory for LLM Agents via Semantic Segment-Level Consolidation의미 단위 세그먼트 통합으로 효율화한 LLM 에이전트 장기 메모리1,161

LycheeMemory V2는 매 턴마다 메모리를 요약하던 방식을 의미 경계 기반 세그먼트 통합으로 바꿔 장기 대화의 메모리 구축 비용을 줄이면서도 사건·시간 맥락 보존을 강화했습니다.

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus하이브리드 선형 어텐션 LLM의 대규모 활성화: 사전 어텐션 스파이크와 스파이크 간 평탄부5

이 연구는 하이브리드 선형 어텐션 LLM에서 Massive Activation이 full attention 직전 PAS와 그 사이 ISP 형태로 조직된다는 사실을 1.2B~397B 모델 전반에서 체계적으로 규명했습니다.

💡 LLM 연구는 이제 성능 자체보다 실제 운영에서의 선택·기억·내부 거동 이해로 무게중심이 옮겨가고 있습니다. 라우팅과 장기 메모리, 활성화 메커니즘 분석은 모두 더 싸고 길게, 그리고 더 예측 가능하게 LLM을 쓰기 위한 기반을 다집니다.

💻Code & Agents8

Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill조합형 스킬로 구현한 종단간 연구 논문 생성531

Spark-to-Paper는 문헌조사·실험·도표·수정까지 13개 조합형 스킬로 논문 작성 전 과정을 코딩 어시스턴트 안에서 수행하며, Self-Refutation Loop를 억제하는 무결성 검사와 자기비평으로 장기 생성 신뢰성을 높였습니다.

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive NarrativesLLM 에이전트는 설정을 끝까지 지킬 수 있을까: 장기 내러티브 일관성 벤치마크25

NCP-Bench는 영화 시놉시스 기반 100개 환경에서 Narrative Commitment Preservation을 자동 검증해, 강력한 LLM도 문장 품질과 별개로 장기 서사 일관성에서는 큰 격차를 보인다는 점을 드러냈습니다.

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence지능 메커니즘 발견을 위한 과학 도구로서의 AI28

Mechanist는 1.3만 편 해석가능성 지식그래프, 4,300만 편 학술 데이터베이스, 32개 메커니즘 분석 기법을 결합한 에이전트 시스템으로, 기존 AI 과학자·코드 에이전트보다 더 가치 있는 메커니즘 가설과 검증 계획을 생성했습니다.

💡 에이전트 연구는 단발성 데모를 넘어 장기 과업의 구조화, 자기개선, 안전성 검증으로 빠르게 확장되고 있습니다. 특히 벤치마크와 실행 환경 자체를 설계하는 흐름이 강해지며, 앞으로는 '좋은 모델'보다 '좋은 에이전트 시스템'의 차별화가 더 중요해질 것으로 보입니다.

👁️Computer Vision3

Hand Visibility Detector: Per-Keypoint Visibility Estimation for Hands손 관절별 가시성 추정을 위한 핸드 비저빌리티 디텍터36

Hand Visibility Detector는 손 자세 추정의 부가 신호가 아닌 독립 과제로 손 관절별 가시성 추정을 체계화하고, 대규모 사전학습 HPE 백본 활용이 가림 상황의 신뢰도 판단에 효과적임을 보였습니다.

Gaze Target Estimation Anywhere with Concepts개념 프롬프트로 어디서나 시선 대상을 추정하기21

이 연구는 '빨간 셔츠를 입은 소년' 같은 텍스트·시각 프롬프트로 대상 지정과 시선 추정을 한 번에 수행하는 Promptable Gaze Target Estimation을 제안해, 기존 다단계 파이프라인의 오류 전파 문제를 줄였습니다.

RibAssist 3D: Biplanar Rib-Fracture Detection, Addressing, and Selective 3D Localization from CT-Derived ProjectionsCT 투영 영상 기반 양면 늑골 골절 검출과 선택적 3D 위치 추정2

RibAssist 3D는 AP·측면 CT 유도 투영에서 골절을 짝지어 3D 위치를 추정하며, 정확한 대응이 주어지면 중앙 오차 4.0mm와 93.6%의 정확한 늑골 식별을 달성해 병목이 기하가 아닌 대응 신뢰도임을 보여줬습니다.

💡 비전 분야에서는 단순 인식 정확도보다 실제 사용성에 직결되는 신뢰도·프롬프트 가능성·3D 위치화가 핵심 화두로 보입니다. 즉, 모델이 무엇을 봤는지뿐 아니라 얼마나 믿을 수 있는지와 어떻게 상호작용할 수 있는지가 중요해지고 있습니다.

📄Robotics & RL1

DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation로봇 조작을 위한 행동 조건부 비디오 월드모델38

DreamX-Phi 1.0은 PRoPE식 SE(3) 기하 인코딩, 깊이 브랜치, SAM3·V-JEPA 기반 객체 일관성 유지, 소수 스텝 증류를 결합해 로봇 조작용 미래 관측 예측의 충실도와 효율을 함께 끌어올렸습니다.

💡 로보틱스용 월드모델은 이제 그럴듯한 영상 생성만으로는 부족하고, 행동 명령과 물체 상태를 얼마나 충실하게 보존하느냐가 핵심 평가축이 되고 있습니다. 기하 구조와 객체 일관성을 명시적으로 주입하는 방식이 조작 작업의 실용성을 끌어올리는 방향으로 보입니다.

📄Multimodal & Generative4

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives장기 목표 기반 에이전트 플레이어로 월드모델을 평가하는 벤치마크48

PlayWorld는 고정 액션 대신 멀티모달 Agent Player가 171개 시나리오에서 장기 목표를 달성하도록 해, 상호작용형 월드모델의 일관성·제어성을 더 공정하게 비교하는 평가 틀을 제시했습니다.

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time실시간 장기 스트리밍 인간 애니메이션14

LiveAnimate는 14B 비디오 DiT를 블록-인과형 생성기로 적응시키고 3스텝 증류와 PR-Sink Attention을 도입해, 실시간 스트리밍과 장시간 외형 일관성을 동시에 달성한 인간 애니메이션 시스템입니다.

Learning How the World Evolves: Extrapolative Video World Models via Latent Dynamics Reasoning잠재 동역학 추론으로 외삽하는 비디오 월드모델28

LDR은 잠재 전이를 명시적 운동학 적분으로 모델링하고 고차 잔차만 회귀해, PhyWorld의 OOD 물리 과제들에서 픽셀 적합형 비디오 확산모델보다 더 잘 법칙을 외삽하도록 만들었습니다.

💡 생성 연구는 긴 시퀀스에서의 안정성, 물리적 외삽, 실시간성, 그리고 평가 방법까지 함께 재설계하는 단계에 들어섰습니다. 단순히 보기 좋은 결과보다 장기 상호작용 속에서 제어 가능하고 검증 가능한 생성기가 중요해지고 있습니다.

📄Training & Optimization1

TailBooster: A Dual-Layer Generative Framework for Extreme Value Augmentation with Operational Validity Enforcement운영 타당성을 보장하는 극단값 증강용 이중 계층 생성 프레임워크

TailBooster는 IQR 기반 극단값 추출과 오토인코더 기반 정제의 이중 계층으로 희귀 항공 운항 이상 사례를 증강해, 꼬리 분포를 더 잘 복원하면서도 비현실적 조합 생성을 억제하는 탭уляр 생성 프레임워크를 제안했습니다.

💡 희귀하지만 중요한 데이터 영역을 따로 다루는 학습 전략이 다시 주목받고 있습니다. 특히 꼬리 분포를 증강하면서 운영 제약까지 함께 반영하는 접근은 산업 데이터 생성의 실전성을 크게 높일 수 있습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택