Gemini Live 盲人视觉助手
谷歌最近在 Gemini Live 里上线了一个叫 Guided Vision 的功能,专门为盲人和低视力人群做实时视觉辅助。用户把手机摄像头打开,Gemini 会用语音持续描述画面,还会用自然的语言提示你怎么调整角度,比如「往左一点」「再靠近一些」,让镜头对准你想了解的东西。
这个功能最值得注意的地方,是它和盲人及低视力社区一起打磨出来的,而不是先做出来再找人测试。谷歌负责无障碍工程的产品经理也参与了项目,说明这不是一个边缘的实验室功能,而是被放进了 Gemini 的主线产品里。从产品逻辑看,它和之前那些「拍照识别」类工具差别很大。过去盲人用 AI 看东西,往往要拍一张照、等结果、再拍一张,交互是断开的。Guided Vision 把摄像头变成持续的输入流,语音描述和取景引导同时进行,体验上更接近身边站了一个有耐心的朋友。当然,这类功能真正的门槛不在模型能力,而在延迟、误报和隐私。实时语音描述如果慢半拍,用户可能已经走过了路口;描述不准,反而会带来危险。摄像头一直开着,数据怎么处理、会不会被留存,也是无障碍用户格外敏感的问题。我觉得这是多模态助手走向日常场景的一个好信号。视觉辅助只是切口,同样的「实时画面加语音引导」能力,之后很可能被用到导览、维修、远程协作等场景。关键是谷歌愿不愿意把无障碍需求当成产品迭代的驱动力,而不是发布会的点缀。
这个功能最值得注意的地方,是它和盲人及低视力社区一起打磨出来的,而不是先做出来再找人测试。谷歌负责无障碍工程的产品经理也参与了项目,说明这不是一个边缘的实验室功能,而是被放进了 Gemini 的主线产品里。从产品逻辑看,它和之前那些「拍照识别」类工具差别很大。过去盲人用 AI 看东西,往往要拍一张照、等结果、再拍一张,交互是断开的。Guided Vision 把摄像头变成持续的输入流,语音描述和取景引导同时进行,体验上更接近身边站了一个有耐心的朋友。当然,这类功能真正的门槛不在模型能力,而在延迟、误报和隐私。实时语音描述如果慢半拍,用户可能已经走过了路口;描述不准,反而会带来危险。摄像头一直开着,数据怎么处理、会不会被留存,也是无障碍用户格外敏感的问题。我觉得这是多模态助手走向日常场景的一个好信号。视觉辅助只是切口,同样的「实时画面加语音引导」能力,之后很可能被用到导览、维修、远程协作等场景。关键是谷歌愿不愿意把无障碍需求当成产品迭代的驱动力,而不是发布会的点缀。
评论
登录后即可发表评论
参与讨论,和出海同行交流想法与经验
还没有评论,来抢沙发吧
说说你的看法,第一条评论最显眼