오늘의 한줄
오늘은 로봇·에이전트 시스템이 고정된 정책 자체보다 실행 하니스, 검증 루프, 테스트타임 계산으로 성능을 끌어올리는 흐름이 두드러졌습니다. 동시에 비디오·이미지 생성과 과학/코드 벤치마크는 모델의 겉보기 점수보다 실제 과업 완수력과 일관성을 더 정밀하게 측정하는 방향으로 진화하고 있습니다.
📄Robotics & RL5
τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation월드모델 기반 테스트타임 계산을 갖춘 계층형 로봇 파운데이션 모델 τ_0-VLA⭐ 514
τ_0-VLA는 상위 정책이 월드모델과 실행 메모리로 서브태스크를 탐색·재고하는 테스트타임 계산을 도입해, 40,115시간 실세계 데이터 학습 후 장기 조작과 분포 이동 환경에서 성능을 유의미하게 높였습니다.
Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence자가 진화형 물리 지능을 위한 효율적 폐루프 체화 하니스 Zetta⭐ 186
Zetta는 기본 정책을 고정한 채 코드 기반 런타임 비평가와 복구 스킬을 온라인 진화시키는 3중 루프로 LIBERO-Pro 등에서 SOTA 성공률을 달성한 폐루프 체화 하니스입니다.
GOAG: Generative and Object-Agnostic Grasp Planner for Dexterous Robotic Manipulation정교한 로봇 조작을 위한 생성형 객체 불가지론 파지 계획기 GOAG⭐ 3
GOAG는 그리퍼 접촉면 분포의 잠재 표현만 학습하고 객체 특징은 추론 시에만 주입해, 객체별 데이터 없이도 새로운 물체에 대한 유효한 다지점 파지를 생성하는 생성형 계획기입니다.
💡 로봇 분야는 더 큰 정책 자체보다 테스트타임 탐색, 폐루프 하니스, VLM 유도 탐험처럼 실행 중 추가 계산과 구조적 보조 장치를 붙여 장기 과업을 푸는 방향이 강해지고 있습니다. 동시에 GOAG·CoToGrasp처럼 객체 불가지론적 표현으로 파지 일반화를 노리는 연구는 데이터 수집 병목을 줄이면서 기능적 조작까지 확장하려는 흐름을 보여줍니다.
📄Multimodal & Generative3
4DAnyone: Create Anyone in 4D from a Casual Monocular Video일상 단안 영상만으로 누구나 4D로 복원하는 4DAnyone⭐ 162
4DAnyone는 RCP와 TCA로 다중 시점 비디오의 전역 일관성 문제를 해결해, 보정되지 않은 단안 영상만으로 재구성 품질의 멀티뷰 영상을 만들고 이를 4D Gaussian Splatting으로 끌어올립니다.
ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models적은 스텝의 행동 조건 비디오 월드모델을 위한 점진적 인과 학습 ForgeWM⭐ 89
ForgeWM은 양방향 액션 조건 생성기를 도메인 적응·인과 일관성 증류·온정책 분포 정합으로 1·2·4스텝 학생 월드모델로 압축해, 저지연 상호작용과 재생 시 정교화까지 함께 지원합니다.
WithEveryone: Unified Planning and Identity Grounding for Group Image Generation그룹 이미지 생성을 위한 통합 계획과 정체성 고정 WithEveryone⭐ 38
WithEveryone는 최대 10명 참조 인물을 주소 지정 토큰과 구조적 레이아웃 계획으로 묶고 Layout-Grounded ID Loss를 적용해, identity-disjoint 벤치마크에서 얼굴 유사도를 0.462에서 크게 끌어올렸습니다.
💡 생성 분야는 단순히 그럴듯한 샘플을 만드는 단계를 넘어, 다중 인물 정체성 고정·다중 시점 일관성·행동 조건 인과성처럼 실제 활용에서 무너지는 제약을 정면으로 다루고 있습니다. 즉 생성 품질 경쟁에서 이제는 구조적 계획과 조건 제어가 핵심 차별점이 되고 있습니다.
💻Code & Agents9
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?코딩 에이전트는 과학 소프트웨어 공학 과제를 해결할 수 있을까?⭐ 44
SWE-bench Science는 20개 과학 분야 119개 저장소 수준 과제를 통해 최고 성능의 Claude Code Opus-5도 pass@1 50% 미만임을 보이며, 과학 지식·탐색·재현성·도구 사용의 실패 원인을 구조화했습니다.
EnvHarness: Awakening Static Worlds for Agent Learning에이전트 학습을 위해 정적 환경을 깨우는 EnvHarness⭐ 54
EnvHarness는 기존 환경 로직을 바꾸지 않고 플러그인 계층으로 난이도와 행동을 재구성하며, EnvRigger가 블랙박스 정책의 약점을 진단해 검증 가능한 적응형 학습 환경을 자동 합성합니다.
SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code GenerationPLC 코드 생성을 위한 프로젝트 기반 검증 게이트형 에이전트 하니스 SemaPLC⭐ 32
SemaPLC는 명세·컴파일·실행 런타임 검증을 모두 통과해야 완료로 인정하는 엄격한 하니스로, 117개 독립 POU 과제에서 7개 모델 평균 strict verified pass rate 72.6%를 기록했습니다.
💡 코드·에이전트 연구는 모델 자체보다 하니스 설계, 외부 검증, 환경 적응, 자기개선 루프가 성패를 좌우한다는 점을 반복해서 보여줍니다. 특히 과학·산업·터미널·장기 운영처럼 현실적인 설정으로 갈수록, 단일 성공률보다 실패 경로와 실행 경계까지 계측하는 벤치마크가 중요해지고 있습니다.
👁️Computer Vision2
SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation비디오 생성의 의미적 과업 완수를 평가하는 SemComp-Bench⭐ 11
SemComp-Bench는 중간 프레임 일관성보다 최종 결과의 과업 달성과 의미 정합성에 초점을 맞춘 비디오 생성 평가 체계로, 6개 도메인 데이터와 VLM 기반 자동 평가 프로토콜을 제안합니다.
NARU: A Benchmark for NARrative Evolution and Cultural Nuance Understanding in Japanese Extreme Long Video일본어 초장편 비디오의 서사 전개와 문화적 뉘앙스 이해 벤치마크 NARU⭐ 3
NARU는 146.8시간 일본 장편 영상과 1,481개 질문으로 서사 변화와 문화적 함의를 함께 평가하며, 비영어권 고맥락 장기 비디오 이해의 빈틈을 메우는 벤치마크를 제시했습니다.
💡 비전 평가도 짧은 클립의 표면적 일관성에서 벗어나, 최종 과업 완수와 장기 서사·문화 이해 같은 더 높은 수준의 의미 평가로 이동하고 있습니다. 앞으로는 생성과 이해 모두에서 사람이 실제로 중요하게 여기는 결과 중심 지표가 더 큰 비중을 차지할 가능성이 큽니다.
📄Training & Optimization1
TinyCast: Probabilistic Zero-Shot Forecasting with Computed Periodicity계산된 주기성으로 확률 예측을 수행하는 제로샷 예측기 TinyCast⭐ 2
TinyCast는 14만 6,505개 파라미터와 무어텐션 구조로 주기성을 직접 계산해 확률 분포를 출력하며, GIFT-Eval과 Chronos-ZS 계열에서 초소형 제로샷 예측의 크기-정확도 경계를 새로 정의했습니다.
💡 TinyCast는 대형화 일변도와 다른 길을 제시하며, 구조적으로 계산 가능한 성질은 학습보다 명시적으로 넣는 편이 더 효율적일 수 있음을 보여줍니다. 특정 문제에서는 아키텍처 편향과 배포 친화성이 여전히 강력한 최적화 축임을 시사합니다.