谷歌于5月19日发布新一代多模态模型 Gemini Omni,进一步拓展其在人工智能领域的技术布局。该模型可同时处理文本、音频、图像和视频等多种信息类型,实现更高效的跨模态理解与交互。谷歌表示,Gemini Omni 在响应速度、识别准确性及实时处理能力方面均有提升,可支持语音提问结合图像与视频内容的综合输出。该模型的推出有望推动教育、商业及内容交互等场景的应用升级,提升人机交互的自然性与效率。
谷歌于5月19日发布新一代多模态模型 Gemini Omni,进一步拓展其在人工智能领域的技术布局。该模型可同时处理文本、音频、图像和视频等多种信息类型,实现更高效的跨模态理解与交互。谷歌表示,Gemini Omni 在响应速度、识别准确性及实时处理能力方面均有提升,可支持语音提问结合图像与视频内容的综合输出。该模型的推出有望推动教育、商业及内容交互等场景的应用升级,提升人机交互的自然性与效率。