DAPD (Dual-Anchored Policy Distillation)
- Policy Distillation Reinforcement Learning: Shanghai AI Laboratory에서는 두 개의 앵커 정책을 활용하여 정책 증류 과정의 안정성과 성능을 동시에 개선하는 이중 앵커 정책 증류(DAPD) 기법을 제안
- 단일 앵커 대신 두 개의 앵커 정책을 사용하여 증류 과정에서 발생하는 편향과 불안정성을 완화
- 학습된 정책이 두 앵커 사이에서 균형을 이루도록 유도하는 새로운 손실 함수 설계
- 기존 정책 증류 기법 대비 다양한 벤치마크에서 성능 및 안정성 향상을 실험적으로 검증
https://github.com/uanu2002/DAPD
Mental World Model
- Agent Mental State Modeling: University of Oxford에서는 에이전트가 환경뿐 아니라 타인의 신념·의도·감정 등 정신 상태까지 내재적으로 시뮬레이션하는 '정신적 세계 모델(Mental World Model)' 프레임워크를 제안하여 사회적 추론과 계획 능력을 향상시키는 방법을 개발
- 물리적 환경 상태뿐 아니라 상호작용 대상의 신념, 의도, 정서 등 마음 상태를 예측하는 통합 세계 모델 구조를 도입함
- 이론적 마음(Theory of Mind) 추론을 세계 모델링에 결합하여 다중 에이전트 환경에서의 계획 및 의사결정 성능을 개선함
- 기존 물리 기반 세계 모델 대비 사회적 상호작용이 중요한 태스크에서 더 정확한 미래 예측과 행동 선택이 가능함을 실험적으로 보임
Mental World Modeling
RLSVR (Reinforcement Learning with Self-Verifiable Rewards)
- Self-Improving LLM Reasoning: Duke University, Adobe, Amazon에서는 검증 가능한 정답이 없는 개방형(open-ended) 문제를 자기 검증이 가능한 형태로 변환하여 외부 레이블 없이도 강화학습 기반 자기개선이 가능하도록 하는 RLVR에서 RLSVR로의 태스크 변환 프레임워크를 제안
- RLVR(Reinforcement Learning with Verifiable Rewards)의 한계인 검증 가능한 보상 신호 부재 문제를 해결하기 위해 태스크 자체를 변환하는 접근법을 도입
- 개방형 문제를 자기 검증 가능한(self-verifiable) 형태로 재구성함으로써 외부 정답 라벨 없이도 모델이 스스로 보상을 생성하고 개선할 수 있는 메커니즘을 설계
- 이를 통해 기존 RLVR이 적용되기 어려운 open-ended LLM 태스크 영역으로 강화학습 기반 자기개선을 확장
https://github.com/wangqinsi1/RLSVR
JoyAI-Video-Edit
- Autoregressive Video Editing Diffusion: Joy Future Academy에서는 자기회귀적 디퓨전 모델을 활용하여 실시간으로 개방형 지시에 따라 비디오를 편집할 수 있는 JoyAI-Video-Edit 프레임워크를 제안
- 자기회귀 방식의 디퓨전 구조를 도입하여 프레임 단위의 실시간 비디오 편집을 가능
- 오픈-엔디드(open-ended) 텍스트 지시를 입력으로 받아 다양한 편집 작업을 유연하게 수행할 수 있도록 설계
- 기존 비디오 편집 모델 대비 낮은 지연 시간으로 상호작용형 편집 경험을 제공
https://github.com/jd-opensource/JoyAI-Video-Edit
Hunyuan3D-Buffalo 1.0
- Unified 3D Multimodal Generation: Tencent Hunyuan에서는 3D 콘텐츠의 생성, 이해, 편집을 하나의 통합된 멀티모달 프레임워크로 처리할 수 있는 확장 가능한 3D 모델 Hunyuan3D-Buffalo 1.0을 공개
- 단일 모델 아키텍처 내에서 3D 생성(generation), 이해(understanding), 편집(editing) 태스크를 통합적으로 수행할 수 있도록 설계
- 대규모 데이터와 스케일러블한 학습 전략을 통해 다양한 3D 콘텐츠 제작 워크플로우에 적용 가능한 범용성을 확보
Hunyuan3D-Buffalo 1.0
AURORA-LM
- Continuous Latent Diffusion Language Modeling: Nanjing University에서는 연속 잠재 공간에서의 오토인코딩 표현을 활용하여 디퓨전 기반 언어 모델링을 수행하는 AURORA-LM을 제안
- 텍스트를 이산 토큰이 아닌 연속 잠재 벡터로 인코딩하여 디퓨전 프로세스에 적용하는 통합 표현 학습 프레임워크를 설계
- 오토인코더 구조를 통해 언어의 의미 정보를 압축된 연속 공간에 매핑함으로써 디퓨전 기반 생성의 효율성과 표현력을 동시에 확보
AURORA-LM
Meshy T2
- 3D Mesh Generation Flow Matching: Meshy AI에서는 Flow Matching 기법을 활용하여 빠르고 네이티브한 3D 메쉬를 직접 생성하는 Meshy T2 모델을 제안
- Flow Matching 기반의 생성 프로세스를 통해 기존 확산 모델보다 빠른 메쉬 생성 속도를 달성
- 중간 표현(예: 복셀, 포인트 클라우드)을 거치지 않고 네이티브 메쉬 구조를 직접 생성하는 방식을 채택