AuK

AuK — Unified Audio Generation and Editing

핵심을 한줄로: 자연어 지시 기반의 음성 생성·편집을 통합한 대규모 파운데이션 모델 AuK와 경량 고속 추론 버전 AuK-Flash를 오픈소스로 공개

한줄 평: 생성과 편집을 하나의 지시문 인터페이스로 통합하고 대규모 데이터·하이브리드 아키텍처·증류 기법까지 엔드투엔드로 제시한 점이 인상적 — 다만 zero-shot 및 instruction-controlled 벤치마크에서의 우위 주장이 구체적 수치 비교 없이 서술되어 있어 독립적인 정량 검증과 신호 수준 복원 태스크에서의 '경쟁력' 수준에 대한 추가 확인이 필요

SenseNova-U1.5

https://github.com/OpenSenseNova/SenseNova-U1

핵심을 한줄로: 인코더·VAE 없는 아키텍처와 멀티 전문가 온폴리시 증류를 통해 이해·추론·생성을 하나로 통합한 8B 규모 네이티브 통합 멀티모달 모델 SenseNova-U1.5를 제시

한줄 평: 이해와 생성을 하나의 엔드투엔드 프레임워크로 통합하고 학습 코드를 공개하기로 한 점이 실용성 측면에서 큰 강점 — 다만 구체적 벤치마크 수치가 초록에 제시되지 않아 성능 개선 폭에 대한 독립적 검증과 인코더/VAE 제거가 실제 화질·다양성에 미치는 트레이드오프 확인이 필요

Uno

Uno project page

핵심을 한줄로: AR 가중치와 디퓨전 가중치를 분리 학습해 품질 손실 없이 다중 토큰 병렬 생성을 가능케 하는 Uno 모델과 Ψ-Spec 샘플러를 통해 대규모 오픈 및 상용 diffusion LLM 대비 우수한 성능과 최대 3배 속도 향상을 달성

한줄 평: 드래프트 모델이 필요 없는 무손실 가속과 기존 AR 모델 성능 보존이라는 실용적 장점이 크지만, 다양한 아키텍처·규모의 오픈소스 모델에 대한 diffusion distillation 일반화 가능성과 실제 배치/하드웨어 환경에서의 재현성 검증이 추가로 필요

Programmable World Model

Programmable World Model

핵심을 한줄로: 월드 상태 진화를 명시적 프로그램 실행으로 분리하고 이를 3D OBB 기반 조건 신호로 변환해 사전학습 비디오 모델에 전달함으로써 지속적이고 규칙 기반의 플레이 가능한 월드를 생성하는 프레임워크를 제안하고 CombatStateBench에서 높은 상태·개수 정확도를 입증

한줄 평: 명시적 상태 관리와 생성적 렌더링을 분리해 장기 일관성과 규칙 기반 제어를 동시에 달성한 점이 흥미로움 — 다만 자체 제안한 CombatStateBench 벤치마크에 대한 독립적 검증과 실제 다양한 게임 장르·복잡한 상호작용 시나리오로의 일반화 가능성에 대한 추가 확인이 필요