오늘의 한줄

오늘은 에이전트 시스템의 실행 인프라·자기개선·평가 체계가 빠르게 성숙하는 흐름과, 멀티모달 모델이 생성·문서·비디오·시각 추론까지 더 넓은 실전 영역으로 확장되는 흐름이 두드러집니다. 동시에 embodied AI와 생성 모델에서는 시뮬레이터, 월드모델, RL 정렬, 안전성 평가처럼 배치 밖 운영 이슈를 직접 다루는 연구가 늘고 있습니다.

📄Multimodal & Generative5

Boogu-Image-0.1: Boosting Open-Source Unified Multimodal Understanding and GenerationBoogu-Image-0.1: 오픈소스 통합 멀티모달 이해·생성 성능 끌어올리기755

Boogu-Image-0.1은 이해·데이터·학습 파이프라인 개선과 에이전트형 추론 스케일링으로 텍스트-이미지 생성, 편집, 중영문 렌더링을 강화해 제한된 연산 예산에서도 주요 오픈소스 모델을 넘어서고 일부 클로즈드 시스템에 근접했습니다.

MuScriptor: An Open Model for Multi-Instrument Music TranscriptionMuScriptor: 다중 악기 음악 전사를 위한 오픈 모델556

MuScriptor는 합성 데이터 사전학습에 실제 음악 파인튜닝과 RL 후학습, 악기 존재 조건부 전사를 결합해 복잡한 실제 믹스에서도 동작하는 오픈 가중치 다중 악기 전사 모델을 제시했습니다.

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video UnderstandingVideoChat3: 효율적 범용 비디오 이해를 위한 완전 공개 비디오 MLLM43

VideoChat3는 I3D-ViT와 Adaptive Frame Resolution을 통해 시공간 표현 효율을 높이고 스트리밍 비디오 처리 비용을 낮춘, 학습 코드와 전략까지 공개한 범용 비디오 MLLM입니다.

💡 멀티모달 연구가 단순 생성 품질 경쟁을 넘어 문서·비디오·음악·시각 추론·선제적 어시스턴트처럼 실제 사용 시나리오별 전문화로 빠르게 퍼지고 있습니다. 동시에 Boogu-Image와 UniVR처럼 오픈소스 진영도 시스템 설계와 RL을 결합해 클로즈드 모델 격차를 줄이려는 흐름이 뚜렷합니다.

💻Code & Agents6

PalmClaw: A Native On-Device Agent Framework for Mobile PhonesPalmClaw: 모바일폰에서 네이티브로 동작하는 온디바이스 에이전트 프레임워크1,123

PalmClaw는 탭·스와이프 중심 GUI 자동화를 넘어 기기 기능을 명시적 도구로 노출하고 세션·메모리·스킬·에이전트 루프를 폰 내부에서 직접 관리해 모바일 에이전트의 실행 경계와 신뢰성을 높였습니다.

AgentCompass: A Unified Evaluation Infrastructure for Agent CapabilitiesAgentCompass: 에이전트 역량 평가를 위한 통합 인프라32

AgentCompass는 Benchmark·Harness·Environment를 분리한 경량 평가 인프라와 비동기 장애복구 런타임, 궤적 분석 도구를 제공해 20개 이상 벤치마크에서 에이전트 평가의 재현성과 확장성을 높였습니다.

KnowAct-GUIClaw: Know Deeply, Act Perfectly, Personal GUI Assistant with Self-Evolving Memory and SkillKnowAct-GUIClaw: 자기진화형 메모리와 스킬을 갖춘 개인 GUI 어시스턴트45

KnowAct-GUIClaw는 Know-Route-Act-Reflect 프레임워크로 크로스플랫폼 GUI 조작과 실행 경험 기반 자기개선을 결합해 OpenClaw의 장기 작업 분해와 개인화된 실행 정확도 한계를 보완했습니다.

💡 에이전트 분야의 무게중심이 이제 모델 자체보다 운영체제, 평가 인프라, 상태 관리, 자기개선 메커니즘으로 이동하고 있습니다. 특히 모바일 실행, 정보탐색 협업, 펜테스팅 평가처럼 환경 특화 스캐폴드가 성능과 신뢰성의 핵심이 되고 있습니다.

📄Robotics & RL4

From Pixels to States: Rethinking Interactive World Models as Game Engines픽셀에서 상태로: 인터랙티브 월드모델을 게임 엔진으로 다시 보기406

이 논문은 인터랙티브 월드모델을 게임 엔진의 action-state-observation 루프로 재해석하며, 플레이어 제어·상태 동역학·장기 지속성·실시간성 관점에서 향후 게임형 생성 세계 모델의 핵심 설계 축을 정리했습니다.

SPEAR: A Simulator for Photorealistic Embodied AI ResearchSPEAR: 사실적인 Embodied AI 연구를 위한 시뮬레이터529

SPEAR는 Unreal Engine 애플리케이션을 파이썬에서 제어하는 플러그인 구조로 1.4만 개 이상의 함수와 1080p 기준 73fps 렌더링을 제공해 기존 UE 기반 embodied 시뮬레이터보다 범용성·속도·프로그래밍 가능성을 크게 높였습니다.

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and ImaginationRxBrain: 언어-시각 추론과 상상을 결합한 embodied 인지 파운데이션 모델74

RxBrain은 언어 계획과 시각적 상상을 하나의 planning sequence로 통합한 Mixture-of-Transformers 구조로, 태스크 분해와 물리적 중간 상태 예측을 함께 다루는 embodied cognition 모델을 제안했습니다.

💡 embodied AI는 더 좋은 정책 하나보다 상호작용 세계를 어떻게 표현·시뮬레이션·검증할지로 관심이 확장되고 있습니다. 게임 엔진형 상태 모델, 고속 사실적 시뮬레이터, 언어-시각 계획 통합, WAM 공격 분석은 모두 '행동 가능한 세계모델'의 설계와 안전성이 다음 경쟁축임을 시사합니다.

📄Training & Optimization2

SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement LearningSEED: 에이전트 강화학습을 위한 자기진화형 온폴리시 증류81

SEED는 완료된 온폴리시 궤적에서 자연어 hindsight skill을 추출해 다시 정책에 증류함으로써 에피소드 수준 희소 보상과 토큰 수준 학습 사이의 감독 공백을 메우는 자기진화형 에이전트 RL 프레임워크입니다.

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity GeneratorsMeanFlowNFT: 평균 속도 생성기에 전방과정 RL 적용하기21

MeanFlowNFT는 MeanFlow identity로 평균 속도 생성기에서 유도된 순간 속도 예측기를 구성해 DiffusionNFT식 전방과정 RL을 적용하면서도 빠른 few-step 샘플링 이점은 유지하도록 설계했습니다.

💡 최적화 연구에서는 RL을 더 넓은 생성기와 에이전트 학습에 맞게 재구성하는 시도가 눈에 띕니다. 희소 보상을 hindsight skill로 바꾸는 SEED와 평균 속도 생성기에 RL을 이식한 MeanFlowNFT는, 학습 신호를 어떻게 번역하느냐가 실전 성능을 결정한다는 점을 보여줍니다.

👁️Computer Vision3

MonkeyOCRv2: A Visual-Text Foundation Model for Document AIMonkeyOCRv2: 문서 AI를 위한 비주얼-텍스트 파운데이션 모델144

MonkeyOCRv2는 17개 언어 1억1300만 장 규모의 MonkeyDoc v2와 이미지-텍스트 생성+픽셀 복원 공동 사전학습으로 문자 획과 레이아웃을 보존해 OCR, 수식, 변조 탐지 등 5개 문서 과제 전반의 인코더 성능을 일관되게 끌어올렸습니다.

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry PriorsMetaView: 스케일 인지형 암시적 기하 사전지식을 활용한 단안 신규 시점 합성16

MetaView는 단일 이미지에서 큰 시점 변화까지 다루기 위해 확산 기반 합성에 암시적 기하 priors와 metric depth 앵커를 결합해, 명시적 3D 제약의 일반화 한계와 암시적 모델의 기하 불안정을 동시에 완화했습니다.

PolicyShiftGuard: Benchmarking and Improving Policy-Adaptive Image GuardrailsPolicyShiftGuard: 정책 적응형 이미지 가드레일의 벤치마킹과 개선20

PolicyShiftGuard는 이미지 자체의 안전 priors가 아니라 주어진 정책 정의에 적응하도록 2,000개 사례의 PolicyShiftBench와 RP-SFT+BP-Adapt 2단계 학습을 제안해 정책 변경 상황의 이미지 가드레일링을 정조준했습니다.

💡 비전 연구는 범용 백본보다 도메인 구조를 얼마나 잘 반영하느냐가 성능을 좌우하는 방향으로 가고 있습니다. 문서 이미지의 문자 획 보존, 단안 뷰합성의 기하 priors, 정책 조건부 가드레일처럼 입력 자체보다 맥락과 구조를 함께 모델링하는 접근이 늘고 있습니다.

매일 아침, 받은편지함에서 만나보세요

새로운 뉴스레터가 발행될 때마다 이메일로 받아볼 수 있습니다.

받아볼 뉴스레터 선택