오늘의 한줄
오늘은 단일 모델 성능을 넘어서 에이전트 시스템 설계, 멀티모달 상호작용, 그리고 실제 배포를 위한 효율화가 동시에 진전되는 흐름이 두드러집니다. 특히 평가 벤치마크와 추론·안전 제어·양자화 같은 실전형 연구가 연구 방향을 더 명확하게 만들고 있습니다.
💻Code & Agents3
Graph Engineering in the Era of LLM Agents: From Individual Intelligence to System IntelligenceLLM 에이전트 시대의 그래프 엔지니어링: 개별 지능에서 시스템 지능으로⭐ 40
이 서베이는 프롬프트·컨텍스트·하니스·루프 엔지니어링을 넘어, 다중 전문 에이전트를 그래프로 조직하는 '시스템 지능'이 복잡한 장기 과제의 핵심 아키텍처임을 정리했습니다.
AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale비즈니스 시나리오용 검증 가능한 환경을 대규모 합성하는 에이전트
AgentMercury는 작업별 환경 제작 대신 엔터티·서비스·상태·불변식을 갖춘 지속 세계를 먼저 생성해 14개 산업·50개국의 4,783개 실행 환경을 만들고 RL 학습 기반으로 활용했습니다.
Peer-Voted LLM-Agent Stress Tests Find Feed-Induced Lexical Convergence but No Reliable Matched-Exposure Advantage for Distributed Sources피드 노출이 LLM 에이전트 언어 수렴을 만들지만 분산 출처 이점은 불확실하다는 스트레스 테스트⭐ 0
PV-SST는 448회 실험에서 동료 게시물 피드가 최종 라운드 어휘 유사도를 유의하게 높였지만, 분산 출처의 matched-exposure 이점은 일관되게 재현되지 않아 집단적 LLM 행동 평가의 난점을 보여줬습니다.
💡 에이전트 연구는 이제 단일 프롬프트 성능보다 시스템 설계와 환경 구성 능력으로 무게중심이 이동하고 있습니다. 그래프 기반 조정, 실행 가능한 비즈니스 세계 생성, 집단 행동 스트레스 테스트는 에이전트를 '모델'이 아니라 '운영되는 사회적 시스템'으로 다루기 시작했음을 보여줍니다.
📄Training & Optimization3
Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models지지 집합은 나누고 잔차는 복원하는 학습 없는 희소 어텐션⭐ 14
SparsePR은 Response-Coupled Partitioning과 Probe-Fitted Residual Reconstruction을 결합해 학습 없이 비디오·월드모델의 블록 희소 어텐션 오차를 일관되게 줄여 더 빠른 추론 가능성을 보여줬습니다.
Llama-Mobile: Efficient 2.7-Bit Quantization of VLMsVLM을 위한 효율적인 2.7비트 양자화
Llama-Mobile은 모델 자체 생성 데이터와 Arm CPU 친화적 2.7비트 포맷을 결합해 Llama 3.2 11B Vision Instruct를 3.7GB로 압축하면서 표준 VQA 성능을 대체로 유지했습니다.
Let's Scale Step by Step: Compute-Efficient Hyperparameter Transfer for Large-Scale Mixture-of-Experts대규모 MoE를 위한 단계적 하이퍼파라미터 전이
이 논문은 μP·MLA·Muon 기반 2단계 전이 프레임워크로 폭과 토큰 축에서 최적 학습률을 예측해, 대규모 MoE의 비싼 하이퍼파라미터 스윕을 줄이는 실용적 스케일링 방법을 제안했습니다.
💡 효율화 연구는 단순 압축을 넘어 추론 연산자, 양자화 포맷, 대규모 학습률 전이까지 전 스택으로 확장되고 있습니다. 특히 학습 없는 보정과 스케일 법칙 기반 전이는 실제 배포와 초대형 학습 비용을 동시에 줄이려는 흐름이 강합니다.
📄Multimodal & Generative4
OmniAssistBench: Assistant-style Interaction Benchmark for Omni-LLMs옴니 LLM을 위한 어시스턴트형 상호작용 벤치마크⭐ 20
OmniAssistBench는 인터넷 영상을 역설계해 동일 목표를 같은 경로로 안내하도록 평가하는 상호작용형 벤치마크를 제안해, 실시간 비디오 어시스턴트형 Omni-LLM 평가 공백을 메웠습니다.
InfinityEdit: Infinite Video Editing with a Lightweight Edit-Ignition Adapter경량 어댑터로 구현한 무한 비디오 편집⭐ 9
InfinityEdit는 고정 길이 클립 편집을 넘어 도착하는 미래 프레임까지 연속 편집하는 '무한 비디오 편집' 과제를 정의하고, 경량 Edit-Ignition Adapter로 누적 편집에서도 안정적 품질을 노렸습니다.
UniSpace: Unified Visual Representation and Scalable Multimodal Modeling통합 시각 표현과 확장형 멀티모달 모델링⭐ 6
UniSpace는 Patch Reparameterization으로 사전학습 semantic ViT의 의미 경로는 유지하면서 세밀한 복원 정보를 살려, 이해·생성·편집을 하나의 시각 표현 공간에서 다루려는 방향을 제시했습니다.
💡 멀티모달 분야는 생성 품질 향상만이 아니라 상호작용 평가와 응답 행태 정렬까지 포함하는 방향으로 성숙하고 있습니다. 비디오 편집의 시간 확장성, 통합 시각 표현, 어시스턴트형 벤치마크는 '잘 보이고 잘 만드는 것'에서 '지속적으로 맞게 돕는 것'으로 초점이 넓어졌습니다.
👁️Computer Vision2
Human-Centric Intelligence in the Era of Foundation Models: A Survey파운데이션 모델 시대의 인간 중심 지능⭐ 12
이 서베이는 외형·기하·동역학·상호작용·세계 시뮬레이션·체화 에이전시를 잇는 6단계 인간 맥락 분류체계로 인간 중심 지능 연구를 파운데이션 모델 관점에서 재구성했습니다.
EviRank: Structured Relevance Evidence for Multimodal Image Re-ranking구조화된 관련성 증거 기반 멀티모달 이미지 재정렬
EviRank는 멀티모달 검색 질의를 6개 의미 슬롯의 required/forbidden/ignorable 증거 패키지로 바꿔, 훈련 없이도 체크리스트형 검증과 리스트 비교를 결합한 재정렬을 수행합니다.
💡 비전 연구는 표현의 해석 가능성과 인간·질의 구조를 더 정교하게 모델링하는 쪽으로 가고 있습니다. 인간 중심 지능의 체계화와 증거 기반 이미지 재정렬은 시각 모델이 장면을 보는 수준을 넘어 사람과 의도를 구조적으로 이해해야 함을 시사합니다.
🗣️Language Models6
FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth실행 가능한 요리 정답으로 프런티어 LLM을 순위화하는 벤치마크⭐ 4
FlavourBench는 534개 과제에서 27개 모델을 실행 가능한 요리 점수로 비교하고, 50,000회 부트스트랩과 100,000회 대조 검정까지 포함해 인간·모델 심사자 의존 없는 LLM 랭킹 방식을 제안했습니다.
Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models온폴리시 증류 일반화의 양면성
이 연구는 OPD가 정답보다 교사의 추론 행동을 전이하며, 동일 계열 교사-학생에서는 언어·추론 길이·도메인을 넘어 잘 일반화하지만 교차 계열에서는 분포 내 적합에 머문다는 점을 보여줬습니다.
ParaTempo: Efficient Parallel Reasoning via Temporal Confidence시간적 신뢰도로 구현한 효율적 병렬 추론⭐ 1
ParaTempo는 중간 답 분포의 수렴도를 나타내는 temporal confidence 하나로 분기 확장·중단·비동기 제어를 수행해, 학습 없이 병렬 추론의 계산비를 줄이면서 정확도를 유지하도록 설계됐습니다.
💡 언어모델 연구는 성능 향상보다 일반화 방식, 안전-유틸리티 균형, 평가 신뢰성 같은 '행동의 질'을 더 깊게 파고들고 있습니다. OPD, CLEAR, ParaTempo, FlavourBench는 이제 좋은 LLM이란 단순 정답률이 아니라 어떻게 추론하고 얼마나 안전하며 어떻게 측정되는가로 정의된다는 점을 보여줍니다.
📄Robotics & RL2
Hydra-0: Action Flow for Generalist World Modeling and Control액션 플로우 기반 범용 월드모델과 제어
Hydra-0는 로봇 행동을 픽셀 모션인 action flow로 표현해 embodiment를 넘나드는 범용 월드모델을 학습했으며, 기준선 대비 로봇 모션 오차 90.4%, 객체 모션 오차 60.2%를 낮췄습니다.
PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration물리 기반 탐색으로 코드-정책 에이전트를 접지하는 방법
PhysCaP는 질량·강성을 고유감각으로 추정하는 학습 없는 물성 추출과 Planner-Prioritizer 이중 에이전트를 결합해, 수동 관찰에 약한 조작 정책을 능동 물리 탐색형 코드 에이전트로 확장했습니다.
💡 로보틱스는 시각-행동 인터페이스와 능동 탐색을 결합해 더 일반적인 월드모델과 조작 정책으로 나아가고 있습니다. action flow와 물리 기반 탐색은 로봇이 보이는 것만 따라 하는 단계를 넘어, 물체의 숨은 속성과 결과를 스스로 실험하며 이해하는 방향을 강화합니다.