AuK
- Unified Speech Generation Editing: Tencent Hunyuan에서는 자연어 지시문과 오디오 컨텍스트를 공통 인터페이스로 음성 생성과 편집을 통합한 오픈소스 파운데이션 모델 AuK를 제안
- 약 30.3억 개의 instruction-audio 쌍과 195만 시간 규모의 지도학습 데이터를 5개 태스크군(생성, 콘텐츠 편집, 향상/분리, 파라링귀스틱 편집, 음향 편집)에 걸쳐 구축
- 멀티모달 LLM 기반 시맨틱 컨디셔닝, 음성·오디오·음악에 공동 학습된 VAE, dual-stream MMDiT와 single-stream DiT를 결합한 하이브리드 rectified-flow Transformer 구조를 설계하고 human-feedback 선호 최적화 및 보상 기반 RL 후처리를 적용
- consistency initialization과 task-routed Decoupled DMD로 증류한 경량 버전 AuK-Flash는 classifier-free guidance 없이 4-step 추론으로 동일 조건 대비 4.5배 속도 향상을 달성하며, 소스코드와 모델 가중치를 공개
AuK — Unified Audio Generation and Editing
① 핵심을 한줄로: 자연어 지시 기반의 음성 생성·편집을 통합한 대규모 파운데이션 모델 AuK와 경량 고속 추론 버전 AuK-Flash를 오픈소스로 공개
② 한줄 평: 생성과 편집을 하나의 지시문 인터페이스로 통합하고 대규모 데이터·하이브리드 아키텍처·증류 기법까지 엔드투엔드로 제시한 점이 인상적 — 다만 zero-shot 및 instruction-controlled 벤치마크에서의 우위 주장이 구체적 수치 비교 없이 서술되어 있어 독립적인 정량 검증과 신호 수준 복원 태스크에서의 '경쟁력' 수준에 대한 추가 확인이 필요
SenseNova-U1.5
- Native Unified Multimodal Generation: SenseTime에서는 인코더 없이 VAE 없는 구조에서 이해·추론·생성을 통합한 8B-MoT 규모의 네이티브 통합 멀티모달 모델 SenseNova-U1.5를 개발
- 공간적으로 일관된 패치 재구성과 최대 4K 네이티브 해상도를 지원하는 비주얼 인터페이스를 강화하고, 시각 미학·이중언어 텍스트 렌더링·인포그래픽 생성·이미지 편집에 특화된 전문가들을 멀티 전문가 온폴리시 증류로 통합
- 이미지 충실도, 텍스트 렌더링, 복잡한 구도 구성, 다중 참조 편집, 인터리브 생성 전반에서 성능을 크게 향상시키면서 지시 이행과 피사체 정체성·기하 구조·미변경 영역 보존 능력을 개선
- 구조화된 형식 노출이 제한적임에도 길고 복잡한 구조화된 시각 지시에 효과적으로 일반화하며, 지도 미세조정·강화학습·온폴리시 증류를 포함한 학습 코드를 오픈소스로 공개할 예정
https://github.com/OpenSenseNova/SenseNova-U1
① 핵심을 한줄로: 인코더·VAE 없는 아키텍처와 멀티 전문가 온폴리시 증류를 통해 이해·추론·생성을 하나로 통합한 8B 규모 네이티브 통합 멀티모달 모델 SenseNova-U1.5를 제시
② 한줄 평: 이해와 생성을 하나의 엔드투엔드 프레임워크로 통합하고 학습 코드를 공개하기로 한 점이 실용성 측면에서 큰 강점 — 다만 구체적 벤치마크 수치가 초록에 제시되지 않아 성능 개선 폭에 대한 독립적 검증과 인코더/VAE 제거가 실제 화질·다양성에 미치는 트레이드오프 확인이 필요
Uno
- Lossless Parallel Token Decoding: Institute of Foundation Models에서는 AR 목표로 학습된 가중치와 경량 디퓨전 가중치를 분리하여 자기회귀 모델 분포를 그대로 유지하면서 여러 토큰을 병렬로 샘플링하는 diffusion-augmented LLM인 Uno와 이를 위한 무손실 가속 샘플러 Ψ-Spec을 제안
- 별도의 드래프트 모델 없이도 모든 평가 배치 크기에서 주요 speculative decoding 기법보다 높은 처리량을 달성하고 기본 AR 모델 대비 최대 3배 속도 향상을 보임
- 8B Uno 모델이 26B DiffusionGemma 및 상용 Mercury 2보다 에이전틱 툴 사용, 코딩, 롱컨텍스트 추론 전 벤치마크에서 우수한 성능을 보임
- 기존 LLM 학습 파이프라인에 거의 오버헤드를 추가하지 않는 간단한 Diffusion Distillation 단계만으로 diffusion 가중치를 학습하여 기존 오픈웨이트 AR LLM에도 적용 가능
Uno project page
① 핵심을 한줄로: AR 가중치와 디퓨전 가중치를 분리 학습해 품질 손실 없이 다중 토큰 병렬 생성을 가능케 하는 Uno 모델과 Ψ-Spec 샘플러를 통해 대규모 오픈 및 상용 diffusion LLM 대비 우수한 성능과 최대 3배 속도 향상을 달성
② 한줄 평: 드래프트 모델이 필요 없는 무손실 가속과 기존 AR 모델 성능 보존이라는 실용적 장점이 크지만, 다양한 아키텍처·규모의 오픈소스 모델에 대한 diffusion distillation 일반화 가능성과 실제 배치/하드웨어 환경에서의 재현성 검증이 추가로 필요
Programmable World Model
- Interactive Video World Modeling: Alaya Lab에서는 자연어 지시를 실행 가능한 프로그램으로 변환해 월드 상태 변화와 시각적 생성을 분리하고, 상태 증강 3D 지향 바운딩 박스를 매개로 사전학습 비디오 모델에 픽셀 정합 조건 신호를 제공하는 Programmable World Model을 제안
- CombatStateBench에서 Count Accuracy 94%, State Accuracy 98%를 달성해 기존 인터랙티브 비디오 월드 모델 대비 크게 우수한 성능을 보임
- 자연어 지시를 엔티티 상태 및 상태 전이 규칙을 명시하는 프로그램으로 변환하고, 경량 엔진이 이를 실행해 화면 밖 엔티티와 비시각적 속성을 포함한 명시적이고 지속적인 전역 월드 상태를 유지
- 상태 증강 3D 지향 바운딩 박스(OBB)와 목표 카메라 궤적을 결정론적으로 컴파일해 사전학습된 비디오 모델용 픽셀 정합 시공간 조건 신호로 변환함으로써 개별 엔티티 직접 제어와 장기 지속 게임플레이가 가능한 플레이 가능 게임 생성을 지원
Programmable World Model
① 핵심을 한줄로: 월드 상태 진화를 명시적 프로그램 실행으로 분리하고 이를 3D OBB 기반 조건 신호로 변환해 사전학습 비디오 모델에 전달함으로써 지속적이고 규칙 기반의 플레이 가능한 월드를 생성하는 프레임워크를 제안하고 CombatStateBench에서 높은 상태·개수 정확도를 입증
② 한줄 평: 명시적 상태 관리와 생성적 렌더링을 분리해 장기 일관성과 규칙 기반 제어를 동시에 달성한 점이 흥미로움 — 다만 자체 제안한 CombatStateBench 벤치마크에 대한 독립적 검증과 실제 다양한 게임 장르·복잡한 상호작용 시나리오로의 일반화 가능성에 대한 추가 확인이 필요