Orca
- World Model Reasoning Agent: BAAI에서는 기존의 단순 예측(토큰, 프레임 등) 패러다임에서 벗어나, 멀티모달 관측 데이터를 바탕으로 시공간적 일관성을 갖춘 '잠재 세계 상태(Latent world-state)'의 변화를 예측하는 차세대 아키텍처를 제안
- 연속적인 시각 경험에서 물리적 동역학을 체득하는 '무의식적 학습(Unconscious learning)'과, 언어적 단서로부터 인과적 구조와 시맨틱을 추출하는 '의식적 학습(Conscious learning)'을 상호 보완적으로 결합
- 구축된 단일 세계 잠재 표상(World latent representation)은 텍스트 기반의 의미적 추론, 이미지 예측, 그리고 로보틱스 제어(Action generation)를 위한 범용적인 다운스트림 인터페이스로 활용
Orca: The World is in Your Mind
DOPD
- On-policy Knowledge Distillation: NUS에서는 학생 모델과 교사 모델이 상호작용하는 이중 온폴리시 증류 기법을 통해 정책 기반 지식 증류의 성능과 안정성을 개선하는 방법을 제안
- 학생 정책과 교사 정책 간의 이중 방향 온폴리시 샘플링을 활용하여 분포 불일치 문제를 완화
- 기존 오프폴리시 증류 방식 대비 학습 안정성과 최종 성능을 향상시키는 프레임워크를 설계
DOPD: Dual On-policy Distillation
Horizon Scaling Agent
- Long-Horizon Agentic Task Planning: SAIL에서는 파라미터 수를 늘리는 대신 에이전트의 작업 수행 시간축(horizon)을 확장하여 350억 파라미터 모델만으로 조 단위 파라미터급 모델에 필적하는 성능을 달성하는 방법론을 제안
- 모델 크기 확장 대신 장기 계획 및 실행 능력을 강화하는 horizon scaling 전략을 도입하여 효율적인 성능 향상을 달성
- 35B 규모의 상대적으로 작은 에이전트가 다단계 추론과 지속적인 작업 수행을 통해 초대형 모델과 유사한 수준의 결과를 보임
- 파라미터 확장 중심의 기존 스케일링 법칙에 대한 대안적 접근법으로서 계산 자원 효율성을 크게 개선
Agents-A1 | 35B MoE Agentic Model
LiveEdit
- Streaming Video Editing Diffusion: Tsinghua University에서는 확산 모델 기반으로 실시간 스트리밍 환경에서 비디오를 즉각적으로 편집할 수 있는 LiveEdit 프레임워크를 제안
- 기존 오프라인 디퓨전 기반 비디오 편집과 달리 실시간 스트리밍 입력에 대응 가능한 구조를 설계
- 낮은 지연시간(latency)으로 프레임 단위 편집을 수행하여 실시간 상호작용성을 확보
- 확산 모델의 생성 품질을 유지하면서도 속도를 최적화하여 실용적인 비디오 편집 응용이 가능
https://github.com/cp-cp/LiveEdit
PhysisForcing
- Physics-Grounded World Model Simulation: NVIDIA에서는 물리 법칙을 명시적으로 반영한 월드 시뮬레이터를 통해 로봇 조작 작업에서 현실적이고 물리적으로 타당한 예측을 가능하게 하는 PhysisForcing 프레임워크를 제안
- 물리 기반 제약을 월드 모델 학습 과정에 강제로 주입하여 시뮬레이션 정확도를 향상
- 로봇 조작 작업에서 물리적으로 일관된 상태 전이 예측을 통해 정책 학습의 샘플 효율성을 개선
PhysisForcing
Qwen-Image-2.0-RL
- Text-to-Image Diffusion RLHF: Qwen에서는 강화학습 기반 미세조정을 통해 이미지 생성 품질과 인간 선호도 정렬을 개선한 Qwen-Image-2.0-RL 모델을 공개
- 기존 Qwen-Image 모델에 강화학습(RL) 기법을 적용하여 생성 이미지의 품질과 정렬성을 향상
- 인간 피드백 또는 보상 모델을 활용한 후처리 학습으로 텍스트-이미지 정합성을 개선
Qwen-Image-2.0-RL Technical Report
ReFreeKV
- KV Cache Compression: Tencent에서는 임계값(threshold) 설정 없이 동작하는 새로운 KV 캐시 압축 기법 ReFreeKV를 제안하여 대규모 언어모델의 추론 메모리 효율성을 개선
- 기존 KV 캐시 압축 방법들이 요구하던 수동 임계값 설정 과정을 제거한 threshold-free 접근법을 도입
- 메모리 사용량을 줄이면서도 모델 성능 저하를 최소화하는 KV 캐시 압축 전략을 설계