Gemini 3.5
- Agentic Coding Workflow Automation: Google DeepMind에서는 복잡한 장기 에이전틱 작업과 코딩 작업에서 프론티어급 지능과 빠른 속도를 결합한 Gemini 3.5 Flash 모델을 공개하고, Antigravity 플랫폼을 통해 다중 서브에이전트 기반의 대규모 워크플로우 실행을 지원함을 발표
- Terminal-Bench 2.1(76.2%), GDPval-AA(1656 Elo), MCP Atlas(83.6%) 등 코딩·에이전틱 벤치마크에서 Gemini 3.1 Pro를 능가하며 CharXiv Reasoning(84.2%)에서도 최고 수준의 멀티모달 이해력을 보임
- 출력 토큰 처리 속도가 다른 프론티어 모델 대비 4배 빠르며, 다른 프론티어 모델 대비 절반 이하 비용으로 장기 호라이즌 작업을 수행 가능
- 업데이트된 Antigravity 하네스와 결합해 협업형 서브에이전트를 배치하여 복잡한 다단계 코딩 및 워크플로우 작업을 감독 하에 안정적으로 수행
Gemini 3.5: frontier intelligence with action
Gemini Omni
- Conversational Video Generation Editing: Google DeepMind에서는 이미지, 오디오, 비디오, 텍스트 등 임의의 입력을 결합하여 Gemini의 실세계 지식에 기반한 고품질 비디오를 생성하고 자연어 대화를 통해 다중 턴에 걸쳐 일관되게 편집할 수 있는 네이티브 멀티모달 생성 모델 Gemini Omni Flash를 공개
- 자연어 명령을 누적 적용하여 캐릭터의 일관성과 장면의 물리적 타당성을 유지하면서 비디오를 순차적으로 편집할 수 있음
- 중력, 운동에너지, 유체역학 등에 대한 직관적 물리 이해를 개선하여 사실적인 장면과 의미 있는 스토리텔링을 결합
- Gemini 앱, Google Flow, YouTube Shorts에 우선 출시되며 향후 이미지 및 오디오 출력 모달리티까지 확장 예정
Introducing Gemini Omni
Recursive MAS
- LLM Foundation: Stanford University에서는 재귀적 구조를 통해 다중 에이전트 시스템이 스스로를 호출하고 확장할 수 있도록 하는 프레임워크를 제안
- 에이전트 간 재귀적 호출 구조를 도입하여 복잡한 작업을 하위 작업으로 분해 및 위임
- 다중 에이전트 시스템의 확장성과 유연성을 향상시키는 아키텍처 설계
Recursive Multi-Agent Systems
Eywa
- LLM Foundation: University of Illinois at Urbana-Champaign에서는 서로 다른 과학 분야에 특화된 이종 파운데이션 모델들이 협업하여 복합적인 과학적 문제를 해결할 수 있는 프레임워크를 제안
- 다양한 과학 도메인(물리, 화학, 생물 등)에 특화된 파운데이션 모델 간 협업 메커니즘을 설계
- 이종 모델 간 지식 전달 및 상호 보완을 통해 단일 모델로는 해결하기 어려운 복합 과학 문제 해결 능력을 향상
- 여러 과학 분야에 걸친 파운데이션 모델의 통합적 활용 가능성을 제시
Heterogeneous Scientific Foundation Model Collaboration
Agentic World Modeling
- World Model: HKUST등에서는 에이전트 기반 월드 모델링의 이론적 기초와 핵심 역량, 스케일링 법칙을 체계적으로 정리한 프레임워크를 제안
- 에이전트가 환경과 상호작용하며 세계 상태를 예측하고 계획하는 월드 모델링의 이론적 토대를 정립
- 에이전트형 월드 모델이 갖춰야 할 핵심 역량(추론, 계획, 행동 예측 등)을 정의하고 분석
- 모델 규모와 성능 간의 관계를 다루는 스케일링 법칙(laws)을 제시하여 향후 연구 방향을 제안
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
World-R1
- Video Gen: Microsoft Research에서는 텍스트-투-비디오 생성 모델이 물리적으로 타당한 3D 구조와 카메라 일관성을 학습하도록 강화학습 기반 보상 신호로 3D 제약 조건을 명시적으로 주입하는 World-R1 프레임워크를 제안
- 생성된 비디오의 깊이, 카메라 포즈, 기하학적 일관성을 평가하는 3D 인식 보상 모델을 설계하여 RLHF 스타일의 정책 최적화에 활용
- 기존 텍스트-투-비디오 확산 모델에 강화학습 기반 파인튜닝을 적용해 시공간적으로 3D 물리 법칙을 위반하지 않는 비디오 생성을 유도
- 정성적·정량적 실험을 통해 기존 방법 대비 3D 구조적 일관성과 시각적 사실성이 향상됨을 검증
World-R1 | Reinforcing 3D Constraints for Text-to-Video Generation
GLM-5V-Turbo
- VLM: Z.ai에서는 멀티모달 에이전트를 위한 네이티브 파운데이션 모델인 GLM-5V-Turbo를 제안하여 시각-언어 이해와 에이전트 기반 작업 수행 능력을 통합한 모델을 개발
- GLM 시리즈의 최신 비전-언어 모델로서 멀티모달 에이전트 태스크에 특화된 네이티브 아키텍처를 설계함
- 이미지, 비디오 등 다양한 시각 입력을 처리하며 에이전트 워크플로우에 최적화된 추론 및 행동 생성 능력을 강화함
- Turbo 버전을 통해 추론 속도와 효율성을 개선하여 실시간 멀티모달 에이전트 응용에 적합하도록 최적화함