오늘의 한줄
오늘은 에이전트 시스템의 실행 인프라·자기개선·평가 체계가 빠르게 성숙하는 흐름과, 멀티모달 모델이 생성·문서·비디오·시각 추론까지 더 넓은 실전 영역으로 확장되는 흐름이 두드러집니다. 동시에 embodied AI와 생성 모델에서는 시뮬레이터, 월드모델, RL 정렬, 안전성 평가처럼 배치 밖 운영 이슈를 직접 다루는 연구가 늘고 있습니다.
📄Multimodal & Generative5
Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and GenerationBoogu-Image-0.1: 오픈소스 통합 멀티모달 이해·생성 성능 끌어올리기⭐ 755
Boogu-Image-0.1은 이해·데이터·학습 파이프라인 개선과 에이전트형 추론 스케일링으로 텍스트-이미지 생성, 편집, 중영문 렌더링을 강화해 제한된 연산 예산에서도 주요 오픈소스 모델을 넘어서고 일부 클로즈드 시스템에 근접했습니다.
MuScriptor: An Open Model for Multi-Instrument Music TranscriptionMuScriptor: 다중 악기 음악 전사를 위한 오픈 모델⭐ 556
MuScriptor는 합성 데이터 사전학습에 실제 음악 파인튜닝과 RL 후학습, 악기 존재 조건부 전사를 결합해 복잡한 실제 믹스에서도 동작하는 오픈 가중치 다중 악기 전사 모델을 제시했습니다.
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video UnderstandingVideoChat3: 효율적 범용 비디오 이해를 위한 완전 공개 비디오 MLLM⭐ 43
VideoChat3는 I3D-ViT와 Adaptive Frame Resolution을 통해 시공간 표현 효율을 높이고 스트리밍 비디오 처리 비용을 낮춘, 학습 코드와 전략까지 공개한 범용 비디오 MLLM입니다.
💡 멀티모달 연구가 단순 생성 품질 경쟁을 넘어 문서·비디오·음악·시각 추론·선제적 어시스턴트처럼 실제 사용 시나리오별 전문화로 빠르게 퍼지고 있습니다. 동시에 Boogu-Image와 UniVR처럼 오픈소스 진영도 시스템 설계와 RL을 결합해 클로즈드 모델 격차를 줄이려는 흐름이 뚜렷합니다.
💻Code & Agents6
PalmClaw: A Native On-Device Agent Framework for Mobile PhonesPalmClaw: 모바일폰에서 네이티브로 동작하는 온디바이스 에이전트 프레임워크⭐ 1,123
PalmClaw는 탭·스와이프 중심 GUI 자동화를 넘어 기기 기능을 명시적 도구로 노출하고 세션·메모리·스킬·에이전트 루프를 폰 내부에서 직접 관리해 모바일 에이전트의 실행 경계와 신뢰성을 높였습니다.
AgentCompass: A Unified Evaluation Infrastructure for Agent CapabilitiesAgentCompass: 에이전트 역량 평가를 위한 통합 인프라⭐ 32
AgentCompass는 Benchmark·Harness·Environment를 분리한 경량 평가 인프라와 비동기 장애복구 런타임, 궤적 분석 도구를 제공해 20개 이상 벤치마크에서 에이전트 평가의 재현성과 확장성을 높였습니다.
KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and SkillKnowAct-GUIClaw: 자기진화형 메모리와 스킬을 갖춘 개인 GUI 어시스턴트⭐ 45
KnowAct-GUIClaw는 Know-Route-Act-Reflect 프레임워크로 크로스플랫폼 GUI 조작과 실행 경험 기반 자기개선을 결합해 OpenClaw의 장기 작업 분해와 개인화된 실행 정확도 한계를 보완했습니다.
💡 에이전트 분야의 무게중심이 이제 모델 자체보다 운영체제, 평가 인프라, 상태 관리, 자기개선 메커니즘으로 이동하고 있습니다. 특히 모바일 실행, 정보탐색 협업, 펜테스팅 평가처럼 환경 특화 스캐폴드가 성능과 신뢰성의 핵심이 되고 있습니다.
📄Robotics & RL4
From Pixels to States: Rethinking Interactive World Models as Game Engines픽셀에서 상태로: 인터랙티브 월드모델을 게임 엔진으로 다시 보기⭐ 406
이 논문은 인터랙티브 월드모델을 게임 엔진의 action-state-observation 루프로 재해석하며, 플레이어 제어·상태 동역학·장기 지속성·실시간성 관점에서 향후 게임형 생성 세계 모델의 핵심 설계 축을 정리했습니다.
SPEAR: A Simulator for Photorealistic Embodied AI ResearchSPEAR: 사실적인 Embodied AI 연구를 위한 시뮬레이터⭐ 529
SPEAR는 Unreal Engine 애플리케이션을 파이썬에서 제어하는 플러그인 구조로 1.4만 개 이상의 함수와 1080p 기준 73fps 렌더링을 제공해 기존 UE 기반 embodied 시뮬레이터보다 범용성·속도·프로그래밍 가능성을 크게 높였습니다.
RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and ImaginationRxBrain: 언어-시각 추론과 상상을 결합한 embodied 인지 파운데이션 모델⭐ 74
RxBrain은 언어 계획과 시각적 상상을 하나의 planning sequence로 통합한 Mixture-of-Transformers 구조로, 태스크 분해와 물리적 중간 상태 예측을 함께 다루는 embodied cognition 모델을 제안했습니다.
💡 embodied AI는 더 좋은 정책 하나보다 상호작용 세계를 어떻게 표현·시뮬레이션·검증할지로 관심이 확장되고 있습니다. 게임 엔진형 상태 모델, 고속 사실적 시뮬레이터, 언어-시각 계획 통합, WAM 공격 분석은 모두 '행동 가능한 세계모델'의 설계와 안전성이 다음 경쟁축임을 시사합니다.
📄Training & Optimization2
SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement LearningSEED: 에이전트 강화학습을 위한 자기진화형 온폴리시 증류⭐ 81
SEED는 완료된 온폴리시 궤적에서 자연어 hindsight skill을 추출해 다시 정책에 증류함으로써 에피소드 수준 희소 보상과 토큰 수준 학습 사이의 감독 공백을 메우는 자기진화형 에이전트 RL 프레임워크입니다.
MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity GeneratorsMeanFlowNFT: 평균 속도 생성기에 전방과정 RL 적용하기⭐ 21
MeanFlowNFT는 MeanFlow identity로 평균 속도 생성기에서 유도된 순간 속도 예측기를 구성해 DiffusionNFT식 전방과정 RL을 적용하면서도 빠른 few-step 샘플링 이점은 유지하도록 설계했습니다.
💡 최적화 연구에서는 RL을 더 넓은 생성기와 에이전트 학습에 맞게 재구성하는 시도가 눈에 띕니다. 희소 보상을 hindsight skill로 바꾸는 SEED와 평균 속도 생성기에 RL을 이식한 MeanFlowNFT는, 학습 신호를 어떻게 번역하느냐가 실전 성능을 결정한다는 점을 보여줍니다.
👁️Computer Vision3
MonkeyOCRv2: A Visual-Text Foundation Model for Document AIMonkeyOCRv2: 문서 AI를 위한 비주얼-텍스트 파운데이션 모델⭐ 144
MonkeyOCRv2는 17개 언어 1억1300만 장 규모의 MonkeyDoc v2와 이미지-텍스트 생성+픽셀 복원 공동 사전학습으로 문자 획과 레이아웃을 보존해 OCR, 수식, 변조 탐지 등 5개 문서 과제 전반의 인코더 성능을 일관되게 끌어올렸습니다.
MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry PriorsMetaView: 스케일 인지형 암시적 기하 사전지식을 활용한 단안 신규 시점 합성⭐ 16
MetaView는 단일 이미지에서 큰 시점 변화까지 다루기 위해 확산 기반 합성에 암시적 기하 priors와 metric depth 앵커를 결합해, 명시적 3D 제약의 일반화 한계와 암시적 모델의 기하 불안정을 동시에 완화했습니다.
PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image GuardrailsPolicyShiftGuard: 정책 적응형 이미지 가드레일의 벤치마킹과 개선⭐ 20
PolicyShiftGuard는 이미지 자체의 안전 priors가 아니라 주어진 정책 정의에 적응하도록 2,000개 사례의 PolicyShiftBench와 RP-SFT+BP-Adapt 2단계 학습을 제안해 정책 변경 상황의 이미지 가드레일링을 정조준했습니다.
💡 비전 연구는 범용 백본보다 도메인 구조를 얼마나 잘 반영하느냐가 성능을 좌우하는 방향으로 가고 있습니다. 문서 이미지의 문자 획 보존, 단안 뷰합성의 기하 priors, 정책 조건부 가드레일처럼 입력 자체보다 맥락과 구조를 함께 모델링하는 접근이 늘고 있습니다.