GDPO
- RL: Nvidia에서는 LLM용 다중 리워드 RL에서 기존 GRPO를 대체하는 Group reward–Decoupled Normalization Policy Optimization 알고리즘 개발
- GRPO가 여러 리워드를 합산한 뒤 정규화해 서로 다른 리워드 조합을 같은 advantage로 만들어 정보가 붕괴되는 문제를 지적하고, 이를 해결하도록 설계
- GDPO는 각 리워드를 그룹(rollouts) 단위로 개별 정규화한 후 가중합하여 advantage를 계산해, 리워드 조합마다 더 세밀하고 구분되는 학습 신호를 제공
GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization
LTX-2
- Video Gen: Lightricks에서는 텍스트 프롬프트로부터 영상과 오디오를 동시에 생성하는 오픈소스 오디오비주얼 디퓨전 모델 공개
- 오픈소스 시스템 중 최상급의 오디오비주얼 품질과 프롬프트 적합도를 보이면서도, 상용 모델 대비 훨씬 적은 계산 비용과 추론 시간으로 동등 수준의 성능을 달성
https://github.com/Lightricks/LTX-2
NeoVerse
- 4D World Model: CASIA에서는 단일 모노큘러 비디오만으로 4D 재구성, 새로운 카메라 궤적의 비디오 생성이 가능한 4D 월드 모델 개발
- 이미지→월드, 다양한 카메라 제어, ‘bullet time’, 비디오 편집, 로보틱스·자율주행 응용, 단일뷰→멀티뷰 생성 등 풍부한 downstream 응용을 지원
- distillation LoRA를 활용해 A800 GPU 1장 기준 30초 미만 추론 속도를 달성하며, 코드와 데모가 공개
NeoVerse
InfiniDepth
- Monocular Depth Estimation: Zhejiang University에서는 단일 이미지로부터 깊이 지도를 추정하는 monocular depth estimation 기법 개발
- 깊이를 픽셀 그리드 대신 연속적인 neural implicit field로 표현해서 임의 해상도(arbitrary-resolution)로 쿼리
- 4K 게임 데이터셋 Synth4K 등에서 SOTA급 성능을 보이고, 특히 고주파 디테일 영역에서 강력
InfiniDepth
Cosmos Reason 2 (2B/8B)
- VLM: Nvidia에서는 physical AI를 위한 개방형 고정밀 추론 비전 언어 모델 출시
- 향상된 시공간 이해력과 타임스탬프 정밀도, 최대 256K 토큰의 긴 컨텍스트 추론으로 복잡한 환경 전반에 걸친 확장된 시각적 인식
Cosmos-Reason2 — Cosmos
Nemotron Speech ASR
- ASR: Nvidia에서는 음성 에이전트와 같은 저지연 사용 사례를 위해 처음부터 설계된 새로운 오픈소스 음성 인식 모델 출시
- 24ms의 음성 인식 최종 처리 시간과 500ms 미만의 전체 음성-to-음성 답변 추론
nvidia/nemotron-speech-streaming-en-0.6b · Hugging Face
A.X K1 (519B)
- LLM: SKT에서는 독자 AI 파운데이션 모델 프로젝트에 제출한 ‘A.X K1(에이닷엑스 케이원)’의 상세 제원과 성능 지표를 담은 기술 보고서를 허깅페이스에 공개
- 국내 최대 매개변수 519B(5190억개) AI 모델
- 매개변수 685B의 ‘딥시크-V3.1’와 매개변수 357B의 ‘GLM-4.6’ 등 오픈 소스 모델과 성능을 비교 결과, 수학과 코딩 등 고도의 논리 추론 분야에서 우수한 성능