오늘의 한줄

오늘은 에이전트 하네스의 신뢰성·안전성·학습 효율을 높이려는 연구와, 비전·비디오 생성의 표현 공간을 다시 설계하는 흐름이 두드러집니다. 동시에 로보틱스와 과학 자동화에서는 폐루프 실행과 검증 게이팅을 통해 실제 환경 적응력을 끌어올리려는 시도가 본격화되고 있습니다.

📄Robotics & RL3

Embodied-Navigator: Point, Think, Memorize, and Align for Efficient NavigationEmbodied-Navigator: 가리키고, 생각하고, 기억하고, 정렬하는 효율적 내비게이션215

TAMP-Nav는 VLM의 행동을 2D 픽셀 선택으로 바꿔 3D 제어와 정렬하고, 선택적 추론·앵커 메모리로 불필요한 CoT와 메모리 비용을 줄여 embodied navigation 효율을 높였습니다.

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical IntelligenceZetta ζ: 자기 진화형 물리 지능을 위한 효율적 폐루프 embodied 하네스186

Zetta는 기본 정책을 고정한 채 런타임 비평가와 복구 스킬을 온라인 진화시키는 3중 폐루프 하네스로, LIBERO-Pro 등에서 최신 성능을 달성하며 실제 로봇 실행 중 적응을 가능하게 했습니다.

SPADE: Self-Play in Adaptive Synthetic Executable EnvironmentsSPADE: 적응형 합성 실행 환경에서의 자기 대전16

SPADE는 하나의 LLM이 실행 가능한 Gym 스타일 환경을 직접 설계하고 다른 에이전트가 이를 푸는 자기대전 RL로, 힌트 유무 보상 격차를 이용해 학습자 수준에 맞는 장기 과제를 자동 생성합니다.

💡 로보틱스 쪽은 거대 모델을 직접 제어기에 억지로 끼워 넣기보다, 2D 행동 정렬·폐루프 비평·자기 생성 환경처럼 실행 계층을 재설계하는 방향이 뚜렷합니다. 결국 성능의 핵심은 더 큰 모델 자체보다, 실시간 적응과 장기 학습을 받쳐주는 하네스 구조에 있다는 인상을 줍니다.

👁️Computer Vision3

PixRestore: Unified Image Restoration via Pixel Diffusion TransformerPixRestore: 픽셀 디퓨전 트랜스포머로 통합한 이미지 복원32

PixRestore는 VAE 없이 픽셀 공간 DiT를 처음부터 학습하고 DINO 기반 신뢰도 조건화를 더해, 다양한 열화 유형을 하나의 모델로 복원하면서 세부 정보 손실과 내용 불일치 아티팩트를 줄였습니다.

EDITBRIDGE: Towards Faithful and Efficient Ultra-High-Resolution Image EditingEDITBRIDGE: 충실하고 효율적인 초고해상도 이미지 편집으로7

EditBridge는 저해상도 편집 결과를 원본 고해상도 이미지에 조건부로 연결하는 diffusion bridge를 제안해, 1K 이상 편집에서 정보 왜곡과 텍스처 열화를 줄이며 메모리 비용도 낮췄습니다.

MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video UnderstandingMoE-ViE: 효율적 이미지·비디오 이해를 위한 전문가 혼합 비전 인코더4

MoE-ViE는 세밀한 MoE 토폴로지와 보조손실 없는 밸런싱, 전용 커널, 프레임 단위 증류를 결합해 CLIP형 비전 인코더를 더 낮은 지연으로 확장하며 이미지·비디오 성능을 함께 끌어올렸습니다.

💡 비전 연구는 단순히 더 큰 생성 모델을 쓰는 대신, 복원·편집·인코딩 각각의 목적에 맞는 표현 공간과 계산 구조를 다시 짜는 흐름이 강합니다. 특히 초고해상도 처리와 이미지·비디오 겸용 인코더처럼 실사용 제약을 정면으로 다루는 설계가 많아졌습니다.

💻Code & Agents7

SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code GenerationSemaPLC: 프로젝트 맥락과 검증 게이팅을 갖춘 PLC 코드 생성 에이전트 하네스32

SemaPLC는 명세·컴파일·실행 검증을 모두 통과해야 완료로 인정하는 엄격한 하네스로, 117개 독립 POU 과제에서 7개 모델 평균 strict verified pass rate 72.6%를 기록했습니다.

ASI-Bench: At the Dawn of Artificial SuperintelligenceASI-Bench: 인공 초지능의 문턱에서32

ASI-Bench는 11개 과학 분야 60개 프로젝트 과제로 혁신적 탐색과 자율 과학 수행을 함께 측정하며, 인간 방법론 가이드를 점진적으로 제거해 AI가 어디까지 스스로 연구를 이어가는지 평가합니다.

OmniScientist: An Omni-Modal Omni-Discipline AI ScientistOmniScientist: 모든 모달리티와 학문 분야를 아우르는 AI 과학자17

OmniScientist는 원시 텍스트·이미지·시계열·절차 데이터를 직접 다루는 3에이전트 파이프라인과 코드 기반 검증을 결합해, 아이디어 발굴부터 실험·논문 작성까지 멀티모달 과학 워크플로를 자동화합니다.

💡 에이전트 분야는 이제 프롬프트 기교보다 검증 가능한 실행, 안전한 하네스, 장기 의사결정 평가로 무게중심이 옮겨가고 있습니다. 실제로 코드 생성·과학 자동화·안전성 벤치마크 모두에서 '모델이 말했다'가 아니라 외부 검증과 운영 전 과정 관리가 성패를 가릅니다.

📄Training & Optimization3

FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive ExecutionFreeToken: 대역폭 적응 실행을 갖춘 엣지 네이티브 MoE 서빙48

FreeToken은 CPU·GPU·메모리·에이전트 상태를 런타임에 재배치하는 엣지 전용 MoE 서빙 스택으로, 8GB 노트북 GPU부터 워크스테이션까지 20개 이상 모델과 실제 에이전트 워크로드를 유연하게 구동합니다.

Energy-Guided Flow MatchingEnergy-Guided Flow Matching: 에너지 유도형 플로우 매칭16

EG-FM은 고정 종점 대신 열 커널로 점진적으로 선명해지는 moving endpoint를 도입해 coarse-to-fine 생성 궤적을 명시적으로 학습하며, 백본 변경 없이 ImageNet 생성 FID를 일관되게 낮췄습니다.

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU RequirementsAgentic ESOpt: 최소 GPU로 장기 지평 LLM 에이전트를 파인튜닝하기20

Agentic ESOpt는 RL 대신 진화전략을 써서 추론 수준 메모리만으로 대형 에이전트를 전파 없이 전파하고, 장기 궤적의 희소 보상·크레딧 할당 문제를 더 단순하게 다룹니다.

💡 학습·최적화 연구는 거대한 모델을 더 싸고 유연하게 다루기 위한 시스템·목적함수 혁신에 집중합니다. 엣지 MoE 서빙, moving endpoint 기반 flow matching, ES 기반 에이전트 튜닝은 모두 기존 학습 공식을 바꾸지 않고도 효율과 확장성을 얻으려는 시도로 읽힙니다.

📄Multimodal & Generative4

V-RAE: Rethinking Video Latent Spaces for GenerationV-RAE: 생성 모델을 위한 비디오 잠재공간 재고34

V-RAE는 고정된 비전 파운데이션 표현 위에 의미 보존형 비디오 잠재공간을 구축해 K600에서 2.13 rFVD를 달성하며, 재구성 중심 VAE보다 생성 친화적 표현이 더 중요함을 보여줍니다.

CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video EditingCoinVE-200K: 조합형 지시 기반 비디오 편집을 위한 대규모 고품질 데이터셋12

CoinVE-200K는 1080p·최대 201프레임 규모에서 2~5개의 원자 편집을 한 번에 요구하는 조합형 비디오 편집 데이터셋으로, 충실도·시간 일관성·구성 다양성을 함께 강화했습니다.

SemComp-Bench: Benchmarking Semantic Task Completion in Video GenerationSemComp-Bench: 비디오 생성의 의미적 과업 완수 벤치마크11

SemComp-Bench는 중간 과정이 아니라 최종 결과의 과업 완수와 의미 정합성을 평가하는 새로운 비디오 생성 기준을 제시해, 결과 중심 생성 모델 평가의 빈칸을 메웠습니다.

💡 멀티모달·생성 연구에서는 좋은 결과를 위해 데이터셋, 잠재공간, 평가 기준, 표현 형식까지 전 스택을 함께 손보는 움직임이 보입니다. 특히 비디오에서는 '얼마나 그럴듯한가'보다 '의미를 보존하며 원하는 결과를 달성했는가'가 점점 더 중요한 축이 되고 있습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택