GPT-5.4
- LLM Foundation: OpenAI가 차세대 플래그십 모델 출시
- 이전까지는 추론(GPT-5.2 thinking)과 코딩(GPT-5.3-codex) 등으로 나뉘어 있던 모델을 하나로 통합
- AI가 컴퓨터 화면을 해석하고 마우스나 키보드 입력을 통해 다양한 애플리케이션을 조작할 수 있는 'Computer Use'가 기본 탑재
GPT-5.4를 소개합니다
Phi-4-reasoning-vision (15B)
- sLLM: Microsoft에서는 이미지와 텍스트를 동시에 이해하고 수학·과학 문제를 추론할 수 있는 새로운 멀티모달 AI 모델을 공개
- 오픈소스 데이터셋을 직접 검토해 오류를 수정하거나 품질이 낮은 데이터를 제거했으며, 잘못된 답변은 'GPT-4o'와 'o4-미니'로 재생성해 품질 향상
- 혼합 추론(mixed reasoning) 구조로, AI가 항상 긴 추론 과정을 거치는 대신, 필요할 때만 단계적 추론을 수행하도록 설계
Headline: Phi-4-Vision-Reasoning—training a multimodal reasoning model
HACRL (Heterogeneous Agent Collaborative Reinforcement Learning)
- RL: ByteDance에서는 다양한 능력의 에이전트들이 서로의 검증된 롤아웃을 공유해 롤아웃 활용도를 극대화하고 이종 에이전트 간 상호 지식 전이를 가능하게 하는 협력적 멀티에이전트 강화학습 패러다임을 제안
- 롤아웃 공유 기반의 협력적 학습으로 온-폴리시 최적화에서 발생하는 중복 계산과 데이터 낭비를 줄여 단일 에이전트 배포 환경에서도 다른 에이전트의 학습 혜택
Heterogeneous Agent Collaborative Reinforcement Learning
Utonia
- Point Cloud Encoding: The University of Hong Kong에서는 서로 다른 센서·포맷(LiDAR, RGB-D, 합성 데이터 등)에서 생성된 다양한 포인트 클라우드를 하나의 범용 인코더로 통합해 처리할 수 있는 아키텍처와 대규모 프리트레이닝 전략을 제안
- 모달리티 불변의 입력 표현과 계층적 인코더 설계로 서로 다른 포인트 클라우드 분포를 동일한 인코더로 효과적으로 처리 가능
- 마스킹 기반 재구성(또는 대조학습) 중심의 대규모 프리트레이닝으로 다운스트림 분류·분할·검출에서 강건한 일반화 성능을 달성
Utonia: Toward One Encoder for All Point Clouds
Helios
- Video Gen: Peking University에서는 Helios는 효율적인 스트리밍 생성과 장기 시간 일관성 유지를 목표로 실시간으로 긴 비디오를 생성할 수 있는 아키텍처를 제안
- 수십 초에서 수분 길이의 비디오를 저지연으로 생성하도록 설계된 모델 구조를 제시
pku-yuangroup.github.io
OmniLottie
- Vector Animation Gen: Fudan University에서는 파라미터화된 Lottie 토큰으로 Lottie JSON의 도형·경로·변형·타이밍 등을 시퀀스화하여 텍스트 조건 생성과 편집을 지원하는 벡터 애니메이션 생성 프레임워크를 제안
- Lottie 애니메이션을 세부 요소별로 파라미터화된 토큰으로 토크나이즈하여 원본 복원 및 편집이 가능한 시퀀스 표현을 제시
- 학습된 시퀀스 모델을 통해 텍스트-투-애니메이션, 조건부 생성 및 애니메이션 간 변환·편집을 지원하여 다목적 생성 파이프라인을 구현
OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens
ADE-CoT
- Image Editing CoT: Alibaba에서는 입력 특성에 따라 이미지 편집 모델의 연산 규모를 테스트-타임에 동적으로 조절해 속도와 품질의 트레이드오프를 개선하는 적응형 테스트-타임 스케일링을 제안
- 유사한 이미지 품질을 유지하면서 추론 속도를 크게 향상시켜 스케일-속도 간 균형을 개선