Gemini 3.8 Live 推出 Live Avatar 实时虚拟形象功能
Google DeepMind 在 Gemini 3.8 Live 中推出 Live Avatar 功能,把近实时视频生成与原生语音对话结合,为企业场景提供带口型同步、自然表情和流畅轮换的对话体验。
Google DeepMind 在 Gemini 3.8 Live 中推出 Live Avatar 功能,把近实时视频生成与原生语音对话结合,为企业场景提供带口型同步、自然表情和流畅轮换的对话体验。
Google 的 Envisioning Studio 与时装设计师 Jane Wade 和 Sergio Hudson 合作,在 AI 创意工坊 Google Flow 中共同开发了两款定制工具,分别用于纽约时装周的造型与秀场设计。
The article is about MindTopo, a new benchmark from Microsoft Research for testing topological reasoning in multimodal AI models (VLMs - Vision Language Models). Key points。
Google DeepMind 推出音乐生成模型 Lyria 3,已在 Gemini app 内以 beta 形式上线,支持用文字或图片生成最长 30 秒的个性化音乐曲目。
推荐理由:Lyria 3 在 Gemini app 内提供文图生 30 秒音乐的能力,读者可据此了解自动写词、风格控制和 SynthID 水印的具体落地方式。
Google Research 提出 MapTrace 合成数据生成管线,用于教多模态大语言模型(MLLM)在地图上追踪路径。该管线利用 Gemini 2.5 Pro 与 Imagen-4 生成多样化地图,并由 MLLM 充当 Mask Critic 与 Path Critic 把关质量,最终产出 200 万组带标注问答对并开源。
Google DeepMind 上线 Project Genie 实验原型,基于 Genie 3 世界模型构建,面向 18 岁以上美国 Google AI Ultra 订阅者开放。该 Web 应用由 Genie 3、Nano Banana Pro 与 Gemini 共同驱动,支持通过文字与图像提示创建可实时生成路径的可探索世界,并可在已有世界基础上进行二次创作,单次生成时长上限 60 秒。