오늘의 한줄
오늘은 촉각을 본격적으로 통합한 로봇 파운데이션 모델, RL 기반 LLM 학습 신호를 더 정교하게 다루는 방법, 그리고 멀티모달 생성·편집 품질을 끌어올리는 평가 설계가 두드러졌습니다. 동시에 LLM의 상식 추론 편향과 안전장치의 구조적 한계를 짚는 분석도 많아지며, 성능 향상과 신뢰성 확보가 함께 연구의 중심으로 이동하고 있습니다.
🗣️Language Models5
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-ImprovementRLVR에서 RLSVR로: 과제 변환으로 열린 과제용 자기검증 보상을 만드는 LLM 자기개선⭐ 143
RLSVR는 열린 과제를 검증 가능한 프록시 환경으로 바꿔 자기생성 보상을 얻는 학습 패러다임이며, SpyRL 자기대전 인스턴스로 인간 선호나 LLM 심판 없이도 오픈엔디드 LLM 자기개선을 가능하게 합니다.
Mental World Modeling마음 상태를 포함하는 월드 모델링⭐ 8
Mental World Modeling은 물리 상태뿐 아니라 믿음·의도·감정 같은 정신 상태를 월드모델 핵심 변수로 넣고, 학습 없는 MENTIS 베이스라인으로 사람 행동 예측에서 왜 '보이는 장면'만으로는 부족한지 보여줍니다.
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications사용자 중심 LLM 애플리케이션 시스템 프롬프트 감사⭐ 5
AISPA는 상용 AI 제품 88개의 시스템 프롬프트 3,249개 지시문을 8개 사용자 관점 차원에서 감사해, 제품별 보호·문제 지시 편차와 비공개 프롬프트가 만드는 신뢰성 공백을 체계적으로 드러냈습니다.
💡 LLM 연구는 단순히 더 잘 푸는 모델보다, 어떤 보상으로 학습시키고 어떤 맥락에서 실패·오용되는지를 더 깊게 파고들고 있습니다. 열린 과제용 자기검증 보상, 상식 추론 편향, 시스템 프롬프트 감사, 안전성 삼중 딜레마까지 이어지며 성능·정렬·거버넌스를 함께 설계하려는 흐름이 뚜렷합니다.
📄Robotics & RL7
N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens잠재 촉각 토큰으로 확장한 비전-촉각-언어-행동 모델⭐ 36
N_0-VTLA는 대규모 NeoData로 시각-촉각 사전학습을 수행하고 ALTER 오프라인 정책개선까지 결합해, 촉각 피드백이 중요한 정밀 조작과 배포 데이터 기반 성능 향상을 동시에 노립니다.
N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation접촉 중심 조작을 위한 촉각 네이티브 월드-액션 모델 확장⭐ 48
N_0-TWAM은 미래 영상과 접촉을 함께 예측하는 최초의 대규모 촉각 월드-액션 모델로, NeoForce와 contact event staging, 비대칭 Mixture-of-Transformers로 장기·다단계 접촉 조작을 강화했습니다.
ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow물리 시간 흐름으로 구현한 연속형 예측 아키텍처⭐ 14
ODEWorld는 PT-Flow로 잠재 공간의 연속 시간 속도장을 ODE로 학습해 미래 예측을 적분 문제로 바꾸며, 이산 시계열 중심 월드모델보다 물리 동역학을 더 효율적으로 포착하려는 연속형 대안을 제시합니다.
💡 로보틱스는 촉각을 본격적인 기본 모달리티로 끌어올리면서, 월드모델·테스트타임 조향·분산 예측까지 학습과 실행 전반을 재설계하고 있습니다. 특히 대규모 사전학습과 경량 추론 개입을 결합해 데이터 효율과 실환경 적응성을 동시에 확보하려는 방향이 강해 보입니다.
📄Multimodal & Generative2
Scaling Properties of Text Conditioning in Visual Generation시각 생성에서 텍스트 조건화의 스케일링 법칙⭐ 55
이 연구는 구조화된 프롬프트 정도가 확산 모델 손실과 선형·멱법칙 관계를 보인다는 점을 GPG·ED로 정량화하고, 의미·기하 주석과 verifier-gated distillation으로 합성 생성 성능을 오픈웨이트 최고 수준으로 끌어올렸습니다.
Evaluation-Verification Reward for Consistent Multi-Reference Image Editing일관된 멀티레퍼런스 이미지 편집을 위한 평가-검증 보상
EVR은 멀티레퍼런스 편집 보상을 시각 기준별 평가와 근거 검증으로 분해해 MLLM 환각을 줄였고, 이를 활용한 RL 학습으로 참조 간 일관성과 전체 시각 조화를 더 잘 맞추는 편집을 유도했습니다.
💡 생성 연구는 더 큰 모델 자체보다 텍스트 조건의 구조, 보상 설계, 검증 가능한 평가 루프를 정교화하는 쪽으로 움직이고 있습니다. 프롬프트의 구조를 계량하고, 편집 품질을 다면적으로 검증하는 접근은 멀티모달 생성의 제어 가능성을 실무 수준으로 끌어올리는 데 중요합니다.
💻Code & Agents2
EMBL AI Librarian: Life-Sciences Knowledge Layer for AI AgentsAI 에이전트를 위한 생명과학 지식 레이어, EMBL AI Librarian⭐ 8
EMBL AI Librarian은 Europe PMC 위에 자연어 질의→하위 쿼리 계획→논문 근거 추출을 한 번에 수행하는 지식 레이어를 얹어, 생명과학 에이전트가 논문 전체를 뒤지지 않고도 바로 증거 중심 답변을 얻도록 설계됐습니다.
Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants질문은 더 적게, 코드는 더 정확하게: 코딩 어시스턴트의 세션 간 개인화 모호성 적응 벤치마크
CAPA는 사용자의 과거 해결 세션을 기억해 새 세션의 반복적 모호성을 적은 확인 질문으로 해소하는 개인화 코딩 보조 과제를 정의하며, 기존 세션 단위 접근의 한계를 드러내는 실행 가능 벤치마크를 제안합니다.
💡 에이전트와 코딩 보조는 이제 단발성 질의응답보다 사용자·도메인 맥락을 장기 기억하는 방향으로 진화하고 있습니다. 생명과학 근거 검색과 개인화된 모호성 해소 모두, '정답 생성'보다 '필요한 근거와 사용자 습관을 얼마나 잘 축적하느냐'가 경쟁력이 되고 있음을 보여줍니다.
👁️Computer Vision2
Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark어둠 속에서 더 강건한 3D 인지 RGB-NIR 영상화⭐ 1
이 방법은 깨끗한 RGB 정답 없이도 3D 공간에서 극저조도 RGB와 NIR을 암묵적으로 융합해 복원하는 모델을 학습하며, 다양한 노이즈 조건의 합성·실제 데이터에서 기존 RGB-NIR 저조도 복원보다 강한 일반화를 보였습니다.
SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift도메인 시프트 환경의 UAV/UGV 지뢰 탐지를 위한 정제된 RGB 데이터셋 SULAND v2⭐ 2
SULAND v2는 33,771장 이미지와 12,433개 박스를 재정제해 기존 SULAND의 라벨 오류·OOD 클래스 문제를 바로잡고, 안전 필수 도메인인 지표면 지뢰 탐지에서 신뢰할 수 있는 RGB 벤치마크를 제공합니다.
💡 비전 쪽에서는 데이터셋 정제와 3D·멀티센서 융합처럼 현장 배포에 직접 연결되는 기반 작업이 눈에 띕니다. 저조도 복원과 지뢰 탐지처럼 실패 비용이 큰 문제일수록, 깨끗한 라벨 의존도를 낮추고 도메인 시프트를 견디는 설계가 핵심이 되고 있습니다.
📄Training & Optimization2
Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning모든 토큰이 같은 공로를 받으면 안 된다: 긴 CoT 추론을 위한 반사실 민감도 기반 크레딧 재할당
이 논문은 RLVR·OPSD가 토큰 기여도를 잘못 추정한다는 점을 반사실 재채점으로 보이고, 정답·오답 조건에서 부호가 갈리는 핵심 토큰에 학습 신호를 재배분하는 방향의 장기 CoT 크레딧 설계 필요성을 제기합니다.
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation온폴리시 증류를 위한 안정적 어드밴티지 융합
SAF-OPD는 RLVR와 OPD 결합 시 생기는 크기·시간 불일치로 인한 엔트로피 붕괴를, OPD 어드밴티지에 대한 희소화·압축과 워밍업·어닐링 4단계 파이프라인으로 완화하는 안정적 융합 기법입니다.
💡 학습 최적화에서는 '좋은 보상 신호를 어떻게 토큰 수준으로 나눌 것인가'가 핵심 과제로 떠올랐습니다. RLVR, OPD, 크레딧 재할당, 어드밴티지 안정화 연구를 보면 앞으로의 성능 차이는 모델 크기보다 학습 신호의 정밀도에서 더 크게 날 가능성이 있습니다.