Gemini Live 上线视障引导视觉

谷歌在 Gemini Live 里加了一个叫 Guided Vision 的功能,专门给盲人和低视力用户做实时视觉辅助。简单说就是打开摄像头,Gemini 会用语音持续描述你面前的环境,还会用自然的语言提示你怎么调整手机角度,比如「往左一点」「再抬高一些」,帮用户把镜头对准想了解的东西。

这个功能最值得注意的地方,是它和盲人及低视力社区一起做的,不是工程师拍脑袋想出来的无障碍补丁。产品经理来自 Gemini Live 团队和谷歌无障碍工程团队,说明这是两条线协作的产物。对做无障碍产品的团队来说,这种「共同设计」的思路比功能本身更有参考价值。从产品定位看,Guided Vision 走的是对话式、实时的路线,而不是拍一张照片再等模型返回结果。实时意味着延迟必须压得很低,语音描述也要足够自然,不能像机器报菜单一样一句一顿。这对多模态模型的推理速度和语音合成的节奏感都是考验,也是它和普通「看图说话」类功能拉开差距的地方。我比较关心的是实际可用性。视障用户真正需要的不是一段华丽的描述,而是能帮他们做判断的信息,比如前面是台阶还是平地、桌上那个杯子在左手边还是右手边。如果 Gemini 只是泛泛地说「你面前有一个房间」,那价值就很有限。所以这个功能能不能落地,取决于它描述得够不够具体、够不够稳。另一个看点是它把无障碍从「合规成本」变成了「产品能力」。谷歌愿意把 Gemini Live 的实时多模态能力优先用在视障场景,说明无障碍需求正在反过来推动交互设计创新。如果这套语音重定向的交互跑通了,未来在驾驶、维修、教育这些需要「边看边问」的场景里,同样有复用空间。
2

评论

登录后即可发表评论

参与讨论,和出海同行交流想法与经验

还没有评论,来抢沙发吧

说说你的看法,第一条评论最显眼