오늘의 한줄

오늘은 에이전트의 실행 인프라와 자기개선, 그리고 멀티모달 생성의 일관성과 제어력을 높이려는 연구가 두드러졌습니다. 특히 모바일·웹·GUI 환경에서의 실사용형 에이전트와, 비디오·3D·오디오비주얼 생성의 평가 및 정렬 체계가 빠르게 구체화되고 있습니다.

📄Multimodal & Generative6

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and GenerationBoogu-Image-0.1: 오픈소스 통합 멀티모달 이해·생성 성능 끌어올리기755

Boogu-Image-0.1은 Base·Turbo·Edit 계열로 구성된 오픈소스 통합 멀티모달 모델로, 이해·데이터·학습 파이프라인 개선과 에이전트형 추론 스케일링만으로 제한된 연산 예산에서도 생성·편집 성능을 상용급에 가깝게 끌어올렸습니다.

From Pixels to States: Rethinking Interactive World Models as Game Engines픽셀에서 상태로: 인터랙티브 월드 모델을 게임 엔진으로 다시 보기406

이 논문은 인터랙티브 월드 모델을 액션-상태-관측 루프로 재해석하며, 플레이어 제어·상태 동역학·장기 지속성·실시간 생성의 네 축에서 차세대 게임 엔진형 생성 모델이 갖춰야 할 조건을 체계화했습니다.

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video UnderstandingVideoChat3: 효율적 범용 비디오 이해를 위한 완전 공개 비디오 MLLM43

VideoChat3는 I3D-ViT와 Adaptive Frame Resolution을 통해 시공간 표현 효율을 높인 완전 공개 비디오 MLLM으로, 다양한 비디오 유형에서 일반화와 재현성을 동시에 강화했습니다.

💡 멀티모달 생성은 이제 단순 품질 경쟁을 넘어 상태 추적, 시공간 일관성, 능동적 개입, 다중 참조 결합처럼 더 복합적인 상호작용 문제로 이동하고 있습니다. 동시에 오픈소스화와 체계적 벤치마크 구축이 함께 진행되면서, 생성 모델이 실제 시스템으로 쓰이기 위한 평가 기준도 빠르게 정교해지고 있습니다.

💻Code & Agents6

PalmClaw: A Native On-Device Agent Framework for Mobile PhonesPalmClaw: 모바일 폰을 위한 네이티브 온디바이스 에이전트 프레임워크1,123

PalmClaw는 탭·스와이프 중심 GUI 조작 대신 기기 기능을 명시적 인자와 구조화된 결과를 갖는 디바이스 툴로 노출해, 모바일에서 세션·메모리·스킬·에이전트 루프를 모두 온디바이스로 실행하는 프레임워크를 제안했습니다.

AgentCompass: A Unified Evaluation Infrastructure for Agent CapabilitiesAgentCompass: 에이전트 역량 평가를 위한 통합 인프라32

AgentCompass는 Benchmark·Harness·Environment를 분리한 경량 평가 인프라로, 20개 이상 벤치마크와 비동기 장애 허용 실행 및 궤적 분석을 제공해 에이전트 평가의 재현성과 확장성을 높였습니다.

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and SkillKnowAct-GUIClaw: 자기진화 메모리와 스킬을 갖춘 개인 GUI 어시스턴트45

KnowAct-GUIClaw는 Know-Route-Act-Reflect 구조로 장기 작업 분해, 크로스플랫폼 GUI 조작, 실행 경험 기반 자기개선을 결합해 OpenClaw의 플랫폼 제약과 지속 학습 한계를 보완했습니다.

💡 에이전트 연구는 모델 자체보다 실행 환경, 메모리, 상태 외부화, 평가 인프라 같은 시스템 설계가 성능을 좌우하는 단계로 들어섰습니다. 특히 모바일·GUI·웹 탐색·보안처럼 도메인이 넓어질수록 자기개선과 재현 가능한 평가 체계가 핵심 경쟁력이 되고 있습니다.

📄Robotics & RL3

SPEAR: A Simulator for Photorealistic Embodied AI ResearchSPEAR: 사실적 임바디드 AI 연구를 위한 시뮬레이터529

SPEAR는 Unreal Engine 앱을 Python에서 제어할 수 있는 플러그인형 시뮬레이터로, 1.4만 개 이상의 UE 함수를 노출하고 1080p 이미지를 73fps로 렌더링해 기존 UE 기반 도구보다 범용성과 속도를 크게 높였습니다.

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and ImaginationRxBrain: 언어-시각 추론과 상상을 결합한 임바디드 인지 파운데이션 모델74

RxBrain은 언어 계획과 시각적 상상을 하나의 계획 시퀀스로 통합한 Mixture-of-Transformers 기반 임바디드 모델로, 작업 분해와 물리적 중간 상태 예측을 함께 수행해 장기 계획의 실행 가능성을 높였습니다.

BadWAM: When World-Action Models Dream Right but Act WrongBadWAM: 월드-액션 모델이 상상은 맞고 행동은 틀릴 때32

BadWAM은 작은 시각 교란으로 월드-액션 모델의 상상과 실행을 어긋나게 만드는 World-Action Drift Attack을 정의하고, 강한 교란형과 은밀한 교란형 공격을 통해 WAM의 안전성과 해석 가능성 가정이 취약함을 보였습니다.

💡 임바디드 AI에서는 더 좋은 계획 표현과 더 강한 시뮬레이션 인프라가 함께 요구되고 있으며, 세계를 상상하는 능력만으로는 안전성과 강건성이 보장되지 않는다는 점도 분명해지고 있습니다. 즉, 표현·환경·보안 평가를 함께 다루는 통합적 접근이 앞으로 중요해질 것으로 보입니다.

📄Training & Optimization3

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement LearningSEED: 에이전트 강화학습을 위한 자기진화형 온폴리시 증류81

SEED는 완료된 온폴리시 궤적에서 재사용 가능한 자연어 hindsight skill을 추출해 다시 정책에 증류함으로써, 희소한 에피소드 보상과 토큰 수준 학습 사이의 감독 공백을 메우는 자기진화형 에이전트 RL 프레임워크입니다.

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity GeneratorsMeanFlowNFT: 평균 속도 생성기에 전방 과정 강화학습 적용하기21

MeanFlowNFT는 MeanFlow의 평균 속도와 순간 속도를 잇는 identity를 이용해 유도된 순간속도 예측기에 DiffusionNFT 목적함수를 적용함으로써, 빠른 few-step 샘플링을 유지한 채 보상 정렬을 가능하게 했습니다.

UniVR: Thinking in Visual Space for Unified Visual ReasoningUniVR: 통합 시각 추론을 위한 비주얼 공간 사고9

UniVR는 이미지-텍스트 쌍 없이 순수 시각 시연만으로 복합 추론·물리 동역학·장기 계획을 학습하며, 글로벌·스텝 보상을 결합한 VR-GRPO와 VR-X 벤치마크를 통해 최대 25% 성능 향상을 달성했습니다.

💡 최적화 연구는 희소 보상 문제를 완화하거나 생성기의 파라미터화 차이에 맞춰 RL 목적을 재정의하는 등, 학습 신호를 더 잘 연결하는 방향으로 진화하고 있습니다. 또한 시각 추론에서도 RL이 본격적으로 쓰이기 시작하면서, 멀티모달 모델의 사고 과정을 직접 강화하려는 흐름이 뚜렷합니다.

👁️Computer Vision2

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry PriorsMetaView: 스케일 인지형 암시적 기하 사전으로 단안 신규 시점 합성16

MetaView는 단일 이미지에서 큰 시점 변화까지 지원하는 확산 기반 신규 시점 합성 기법으로, 암시적 기하 사전과 metric depth 앵커를 결합해 일반화와 기하 일관성의 균형을 맞췄습니다.

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image GuardrailsPolicyShiftGuard: 정책 적응형 이미지 가드레일의 평가와 개선20

PolicyShiftGuard는 2,000개 정책-구분 사례로 구성된 PolicyShiftBench와 RP-SFT+BP-Adapt의 2단계 학습을 제안해, 이미지 자체가 아니라 주어진 정책 변화에 맞춰 안전 판단을 적응적으로 수행하도록 만들었습니다.

💡 비전 연구는 기하 일관성과 안전 정책 적응처럼 실제 배포에서 바로 부딪히는 문제를 정면으로 다루고 있습니다. 한쪽은 3D 구조 이해를, 다른 한쪽은 정책 조건부 판단을 강화하면서, '잘 보이는 모델'에서 '상황에 맞게 믿고 쓸 수 있는 모델'로 무게중심이 이동하고 있습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택