谷歌一口气放两个模型,视频和语音都盯上了
Gemini新模型能看懂10秒视频,还能转写85种语言
谷歌把视频理解和语音转写,塞进了新模型
一个叫 Gemini Omni 1.1 Flash,能直接分析最长10秒的视频,场景一致性更好,还加了个360p的低成本草稿模式。说人话就是,先用便宜的方式试,满意了再出成品。
另一个叫 Gemini 3.5 Transcribe,主打语音转写,延迟更低、错字更少,支持85种以上的语言。
我做新媒体这十年,最头疼的就是字幕。一条十几分钟的视频,人工听一遍再敲一遍,大半天就没了。语音转写这块只要准一点、快一点,一年省下来的人力,够养一个小组。
这次谷歌的落点很有意思。它没有去比谁的模型更聪明,而是奔着视频和语音这两个最费时间、最靠人力的活儿去的。视频理解解决看,语音转写解决听,这两件事恰好是内容行业每天都要重复干的苦力活。
我常跟人说,工具的进步不在于它能聊多深的天,而在于它能替你干掉多少重复劳动。省下来的时间,才是创作者最贵的东西。
很多工具看着热闹,真用起来才发现是花架子。判断一个模型值不值得上,我只看一条:它是不是真的接走了一段原本非人不可的活儿。
真正的AI落地,不在实验室的跑分榜上,在你每天的工作流里。
你现在的工作里,最希望哪个环节被一个模型直接接走?评论区说说看。
