谷歌近日对其AI Pro订阅套餐中的Pics工具进行了一次重要升级,新增了两项由人工智能驱动的核心能力:更先进的图像生成与编辑功能,以及能够对视频内容进行深度分析的智能视频理解功能。
Google Pics是谷歌图像生成工具的最新进展。它依托于谷歌强大的Nano Banana图像生成模型,在原有基础上进一步增强了图像生成能力,新增了高级编辑和自定义工具。
从演示来看,Google Pics提供了多种先进的AI创作选项。除了基础的文字生成图像,它还支持语言翻译功能,以及在一张已生成的图像中继续添加和编辑元素的能力。这意味着,用户不再需要反复输入提示词去“碰运气”,而是可以在AI生成的画面上直接进行修饰和调整,按自己的需求逐步完善。
对于制作宣传材料这类日常需求来说,这套工具带来的改变相当实在。过去,用AI生成商业素材往往需要多次尝试才能得到可用的画面,而且成品常常带有一种“一眼AI”的生硬感。谷歌这次的升级,既简化了制作流程,又通过更强的编辑能力实现了更高的个性化定制,让最终图像更自然,也更有品牌个人风格。
与图像生成同步推出的,是谷歌的智能视频理解工具。它能够处理视频输入,识别并提取视频中呈现的内容,甚至还能辨认演讲者的身份信息,并对视频片段中的具体元素给出详细说明。简单来说,这段工具不只是“看视频”,而是真正在“理解视频”。
谷歌表示,其先进的视频处理工具能够更轻松地从视频片段中提取洞察和信息,在响应准确性和速度上都有提升,同时还减少了令牌使用量——对于需要处理大量视频素材的用户来说,这意味着更快、更便宜、更智能。
这套视频理解能力将在多种应用场景中发挥作用。从自动分析会议录像到从演示视频中学习,它都能帮助系统建立上下文理解能力,大幅简化视频内容分析的过程。
谷歌透露,其代理式视频理解模型即将在Gemini应用的Flash和Flash-Lite模型中向所有用户开放。此外,Pics还将很快被集成到YouTube视频播放页面上的“向YouTube提问”功能中。用谷歌自己的话说,届时将“利用Gemini技术,基于视觉内容提供更高质量的回答”。
图像生成看得懂需求、视频理解听得懂内容——这两项工具的同步升级,明显是在为AI在创作与分析两条主线上的应用能力加码。无论是营销人员制作视觉素材,还是分析师从视频中抓取关键信息,谷歌都在试图让AI从“能干活”进化到“懂你想要什么”。