오늘의 한줄

오늘은 에이전트와 로보틱스가 정적 파이프라인을 넘어 실행 중 적응·검증·환경 생성으로 확장되는 흐름이 두드러졌습니다. 동시에 생성 모델은 픽셀·비디오·4D 표현을 더 정교하게 다루며, 벤치마크 연구는 과학·관리·비디오 과업처럼 더 현실적인 장기 평가로 이동하고 있습니다.

📄Robotics & RL4

τ_0-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation월드모델 기반 테스트타임 컴퓨트로 확장하는 계층형 로봇 파운데이션 모델 τ_0-VLA514

τ_0-VLA는 상위 정책에서 실행 메모리와 월드모델 탐색을 활용해 어려운 서브태스크에만 추가 추론을 배분하는 계층형 VLA로, 40,115시간 실세계 데이터 학습 후 분포 이동 환경까지 장기 조작 성능을 유의미하게 높였습니다.

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient Navigation가리키고, 생각하고, 기억하고, 정렬하는 효율적 체화 내비게이션215

TAMP-Nav는 VLM의 행동을 2D 픽셀 선택으로 바꾸는 Pixel-to-3D 액션과 선택적 CoT·Anchor 메모리를 결합해, 기존 체화 내비게이션의 비효율적 추론과 메모리 사용을 줄이면서 자연스러운 2D 사전학습 정렬을 달성했습니다.

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence자가 진화형 물리 지능을 위한 효율적 폐루프 체화 하네스 Zetta186

Zetta는 기본 정책을 고정한 채 실행 중 코드 기반 critic과 복구 스킬을 온라인 진화시키는 3중 루프 폐루프 하네스로, LIBERO-Pro 등에서 최신 성능을 달성하며 사후 반성 중심 에이전트의 한계를 넘었습니다.

💡 로보틱스와 강화학습은 이제 더 큰 기본 정책 자체보다, 실행 중 어디에 계산을 더 쓰고 어떻게 복구·적응할지를 설계하는 방향으로 이동하고 있습니다. 테스트타임 탐색, 폐루프 critic 진화, 자기 생성 환경이 결합되며 장기 과업의 안정성과 확장성이 핵심 경쟁력이 되고 있습니다.

📄Multimodal & Generative5

4DAnyone: Create Anyone in 4D from a Casual Monocular Video일상 단안 영상 하나로 누구나 4D로 복원하는 4DAnyone162

4DAnyone은 RCP와 TCA로 다중 시점 비디오 생성의 일관성 병목을 해결해, 보정되지 않은 단안 영상만으로도 4D Gaussian Splatting용 재구성급 멀티뷰 영상을 만들고 사람 4D 복원을 가능하게 했습니다.

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models소수 스텝 액션 조건 비디오 월드모델을 위한 점진적 인과 학습 ForgeWM89

ForgeWM은 양방향 액션 조건 비디오 생성기를 1·2·4스텝 학생 월드모델로 증류하는 점진적 인과 학습 프레임워크로, 저지연 상호작용과 리플레이 정제를 함께 지원해 게임형 인터랙티브 월드모델의 실용성을 높였습니다.

WithEveryone: Unified Planning and Identity Grounding for Group Image Generation그룹 이미지 생성을 위한 통합 계획과 정체성 정렬, WithEveryone38

WithEveryone은 최대 10명 참조 인물을 addressed token과 구조화된 identity-layout plan으로 묶고 Layout-Grounded ID Loss를 적용해, 얼굴 유사도를 0.462에서 크게 개선하며 다인물 정체성 보존을 안정화했습니다.

💡 생성 연구는 단순히 그럴듯한 샘플을 만드는 단계를 넘어, 4D 일관성·다인물 정체성·비디오 잠재공간·과업 완료도처럼 구조적 제약을 직접 모델링하는 흐름이 강합니다. 실무적으로는 더 적은 후처리로 원하는 결과를 정확히 얻는 제어 가능성이 중요해지고 있습니다.

💻Code & Agents7

SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?코딩 에이전트는 과학 소프트웨어 엔지니어링 문제를 해결할 수 있을까?44

SWE-bench Science는 20개 과학 분야 98개 저장소의 119개 과업으로 과학 소프트웨어 수리 능력을 측정하며, 최고 에이전트도 pass@1 50% 미만에 머물러 과학 지식·탐색·재현성·복잡성 대응의 취약점을 드러냈습니다.

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation프로젝트 맥락과 검증 게이트를 결합한 PLC 코드 생성 에이전트 하네스32

SemaPLC는 명세·컴파일·실행 로그가 모두 통과해야 완료로 인정하는 검증 게이트 방식으로 PLC 코드 생성을 통제해, 117개 독립 POU 과업에서 7개 모델 평균 strict verified pass rate 72.6%를 기록했습니다.

EnvHarness: Awakening Static Worlds for Agent Learning에이전트 학습을 위해 정적 세계를 깨우는 EnvHarness54

EnvHarness는 기존 환경 로직을 바꾸지 않고 플러그인 계층으로 행동을 재구성하며, EnvRigger가 정책 궤적을 보고 약점을 겨냥한 환경 변형을 자동 합성해 정적 학습 환경의 수명을 연장합니다.

💡 에이전트 연구는 성능 과시보다 검증 가능한 실행, 현실적인 저장소 맥락, 장기 의사결정 평가로 빠르게 성숙하고 있습니다. 특히 과학·산업·관리 영역에서 벤치마크와 하네스가 함께 발전하면서, '할 수 있나'보다 '믿고 맡길 수 있나'가 더 중요한 질문이 되고 있습니다.

👁️Computer Vision1

PixRestore: Unified Image Restoration via Pixel Diffusion Transformer픽셀 디퓨전 트랜스포머로 통합 이미지 복원하는 PixRestore32

PixRestore는 VAE 없이 픽셀 공간 DiT에서 직접 flow matching을 수행하고 DINO 기반 신뢰도 예측으로 조건 특징을 융합해, 다양한 열화 조건에서 세부 복원력과 내용 일관성을 함께 끌어올렸습니다.

💡 이미지 복원은 대형 T2I 사전학습을 빌려오는 대신, 과업에 맞는 픽셀 공간 생성기와 신뢰도 기반 조건 주입을 직접 설계하는 쪽으로 재편되는 모습입니다. 복원에서는 생성 능력보다 세부 보존과 내용 일관성의 균형이 다시 핵심 기준이 되고 있습니다.

📄Training & Optimization3

FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution대역폭 적응 실행을 갖춘 엣지 네이티브 MoE 서빙, FreeToken48

FreeToken은 모델 배치·전문가 상주·CPU-GPU 실행·상태 재사용을 함께 최적화해 8GB 노트북 GPU부터 워크스테이션까지 20개 이상 MoE 모델과 에이전트 워크로드를 유연하게 구동하는 엣지 서빙 스택을 제시했습니다.

Energy-Guided Flow Matching에너지 유도 플로우 매칭16

EG-FM은 고정된 깨끗한 이미지 종단점 대신 열 커널로 필터링된 이동 종단점과 이미지별 에너지 스케줄링을 도입해, 백본 수정 없이 ImageNet 클래스 조건 생성의 FID를 일관되게 낮췄습니다.

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements최소 GPU로 장기 지평 LLM 에이전트를 미세조정하는 Agentic ESOpt20

Agentic ESOpt는 장기 에이전트 미세조정에 RL 대신 진화전략을 적용해, 추론 수준 메모리만으로 대형 LLM 전체 파라미터 최적화를 가능하게 하고 희소 보상·긴 궤적의 credit assignment 문제를 단순화했습니다.

💡 학습·최적화 측면에서는 더 적은 자원으로 더 큰 모델을 다루고, 생성 궤적 자체를 더 잘 구조화하려는 시도가 눈에 띕니다. 서빙부터 미세조정, 생성 목표 함수까지 전 스택에서 효율성과 적응성을 함께 챙기는 방향이 분명해졌습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택