오늘의 한줄
오늘은 에이전트의 실행 인프라와 자기개선, 그리고 멀티모달 생성의 일관성과 제어력을 높이는 연구가 두드러졌습니다. 특히 모바일·검색·GUI·보안처럼 실제 환경으로 들어가는 에이전트와, 비디오·3D·오디오비디오 생성의 평가 및 안정화가 함께 진전되고 있습니다.
📄Multimodal & Generative6
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and GenerationBoogu-Image-0.1: 오픈소스 통합 멀티모달 이해·생성 성능 끌어올리기⭐ 755
Boogu-Image-0.1은 Base·Turbo·Edit 계열로 텍스트-이미지 생성, 지시 기반 편집, 중영문 텍스트 렌더링을 통합했으며, 제한된 연산 예산에서도 데이터·학습 파이프라인·에이전트형 추론 확장으로 주요 오픈소스 모델을 능가하거나 근접 성능을 보였습니다.
From Pixels to States: Rethinking Interactive World Models as Game Engines픽셀에서 상태로: 인터랙티브 월드 모델을 게임 엔진으로 다시 보기⭐ 406
이 논문은 인터랙티브 월드 모델을 게임 엔진의 행동-상태-관측 루프로 재해석하며, 실시간 상호작용을 위해서는 픽셀 예측보다 명시적 상태 동역학과 장기 일관성이 핵심이라는 설계 관점을 체계적으로 정리했습니다.
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video UnderstandingVideoChat3: 효율적 범용 비디오 이해를 위한 완전 공개 비디오 MLLM⭐ 43
VideoChat3는 I3D-ViT와 스트리밍 비디오용 Adaptive Frame Resolution을 도입해 계산량을 줄이면서도 다양한 비디오 도메인에 일반화되는 완전 공개형 비디오 MLLM을 제시했습니다.
💡 멀티모달 생성은 이제 단순 품질 경쟁을 넘어 편집 가능성, 시공간 일관성, 명시적 상태 표현, 그리고 오디오·비디오·3D를 아우르는 평가 체계로 확장되고 있습니다. 특히 생성 모델을 실제 인터랙션 시스템이나 게임 엔진처럼 다루려는 흐름이 강해지며, '잘 그리는 것'보다 '지속적으로 맞게 반응하는 것'이 핵심 과제가 되고 있습니다.
💻Code & Agents6
PalmClaw: A Native On-Device Agent Framework for Mobile PhonesPalmClaw: 모바일 폰용 네이티브 온디바이스 에이전트 프레임워크⭐ 1,123
PalmClaw는 스마트폰 GUI 조작 대신 기기 기능을 명시적 인자와 구조화된 결과를 갖는 디바이스 도구로 노출해, 세션·메모리·스킬·에이전트 루프를 모두 기기 내에서 안정적으로 실행하는 온디바이스 에이전트 프레임워크를 제안했습니다.
AgentCompass: A Unified Evaluation Infrastructure for Agent CapabilitiesAgentCompass: 에이전트 역량 평가를 위한 통합 인프라⭐ 32
AgentCompass는 Benchmark·Harness·Environment를 분리한 경량 평가 인프라로, 20개 이상 벤치마크와 비동기 장애 허용 실행 및 궤적 분석을 제공해 에이전트 평가의 재현성과 디버깅 가능성을 높였습니다.
KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and SkillKnowAct-GUIClaw: 자기진화 메모리와 스킬을 갖춘 개인 GUI 어시스턴트⭐ 45
KnowAct-GUIClaw는 Know-Route-Act-Reflect 구조로 장기 과업 분해, 크로스플랫폼 GUI 조작, 실행 경험 기반 메모리·스킬 자기개선을 결합해 개인용 GUI 에이전트의 적응성과 성공률 향상을 노렸습니다.
💡 에이전트 연구는 모델 성능 자체보다 실행 인프라, 상태 관리, 평가 표준화, 자기개선 루프처럼 시스템 설계로 무게중심이 이동하고 있습니다. 모바일·GUI·검색·보안처럼 실제 제약이 강한 환경에서 성공하려면, 명시적 메모리와 도구 인터페이스, 실패 추적이 필수라는 점이 분명해졌습니다.
📄Robotics & RL3
SPEAR: A Simulator for Photorealistic Embodied AI ResearchSPEAR: 사실적 체화형 AI 연구를 위한 시뮬레이터⭐ 529
SPEAR는 Unreal Engine 애플리케이션을 Python에서 제어하는 플러그인 구조로 1.4만 개 이상의 UE 함수를 노출하고, 1080p 이미지를 73fps로 렌더링해 기존 UE 기반 시뮬레이터보다 범용성·속도·GT 모달리티를 크게 확장했습니다.
RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and ImaginationRxBrain: 언어-시각 추론과 상상을 결합한 체화 인지 파운데이션 모델⭐ 74
RxBrain은 언어 계획과 시각적 상상을 하나의 플래닝 시퀀스로 통합한 Mixture-of-Transformers 기반 체화 인지 모델로, 작업 분해와 중간·최종 물리 상태 예측을 함께 수행해 embodied planning을 더 직접적으로 다룹니다.
BadWAM: When World-Action Models Dream Right but Act WrongBadWAM: 월드-액션 모델이 제대로 상상해도 잘못 행동할 때⭐ 32
BadWAM은 작은 시각 교란으로 월드-액션 모델의 상상과 실행 정렬을 무너뜨리는 World-Action Drift Attack을 정의하고, 성능 저하와 은밀성 축에서 WAM 특유의 새로운 공격면을 체계적으로 평가했습니다.
💡 체화형 AI는 더 나은 시뮬레이터와 계획 표현을 통해 학습 기반 제어를 확장하는 한편, WAM 공격처럼 안전성과 정렬 취약점도 함께 드러내고 있습니다. 즉, 더 사실적인 세계 모델을 만드는 것과 그 모델이 실제 행동에서 얼마나 믿을 만한지를 검증하는 일이 동시에 중요해지고 있습니다.
📄Training & Optimization3
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement LearningSEED: 에이전트 강화학습을 위한 자기진화형 온폴리시 증류⭐ 81
SEED는 완료된 온폴리시 궤적에서 재사용 가능한 hindsight skill을 자연어로 추출한 뒤 다시 정책에 증류해, 희소한 에피소드 보상과 토큰 수준 학습 사이의 감독 공백을 메우는 에이전트 RL 프레임워크입니다.
MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity GeneratorsMeanFlowNFT: 평균 속도 생성기에 전방 과정 RL 적용하기⭐ 21
MeanFlowNFT는 MeanFlow의 평균 속도와 순간 속도를 잇는 identity를 이용해 유도된 순간 속도 예측기를 만들고, DiffusionNFT 목적함수를 적용해 빠른 few-step 샘플링을 유지한 채 보상 정렬을 가능하게 했습니다.
UniVR: Thinking in Visual Space for Unified Visual ReasoningUniVR: 통합 시각 추론을 위한 비주얼 공간 사고⭐ 9
UniVR는 이미지-텍스트 쌍 없이 순수 시각 데모만으로 복합 추론·물리 동역학·장기 계획을 학습하며, 글로벌·스텝 보상을 결합한 VR-GRPO와 VR-X 벤치마크에서 최대 25% 향상을 달성했습니다.
💡 최적화 연구는 희소 보상을 보완하는 자기증류, 생성 모델에 맞춘 RL 목적 재설계, 순수 시각 추론을 위한 보상 설계처럼 학습 신호 자체를 정교화하는 방향으로 진화하고 있습니다. 공통적으로는 기존 목적함수를 그대로 쓰기보다, 모델 구조와 과업 형식에 맞는 중간 감독을 새로 만드는 접근이 성과를 내고 있습니다.
👁️Computer Vision2
MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry PriorsMetaView: 스케일 인지 암시적 기하 사전을 활용한 단안 신규 시점 합성⭐ 16
MetaView는 단일 이미지에서 큰 시점 변화까지 지원하는 확산 기반 신규 시점 합성기로, 암시적 기하 사전과 metric depth를 결합해 일반화와 카메라 제어, 구조 일관성을 함께 잡으려 했습니다.
PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image GuardrailsPolicyShiftGuard: 정책 적응형 이미지 가드레일의 평가와 개선⭐ 20
PolicyShiftGuard는 2,000개 인스턴스의 PolicyShiftBench와 RP-SFT+BP-Adapt 2단계 학습을 통해, 이미지 자체의 안전성 편향이 아니라 주어진 정책 정의 변화에 맞춰 판정을 적응시키는 가드레일을 제안했습니다.
💡 비전 분야에서는 단안 3D 이해와 정책 조건부 안전 판정처럼, 정적인 인식 문제에 기하와 정책 문맥을 더해 실제 사용성을 높이는 시도가 눈에 띕니다. 이는 비전 모델이 '무엇이 보이는가'를 넘어서 '어떤 규칙 아래 어떻게 해석해야 하는가'까지 다뤄야 함을 보여줍니다.