10月底,谷歌研究院(Google Research)正式发布了一款名为StreetReaderAI的创新技术原型,旨在为盲人及低视力用户打造真正无障碍的Google街景体验。该系统并非传统意义上的语音播报工具,而是一个深度融合计算机视觉、地理信息系统(GIS)与大语言模型(LLM)的多模态AI平台,让用户能够通过自然语言与虚拟城市环境进行实时互动,实现前所未有的自主探索自由。
StreetReaderAI的核心突破在于其“情境感知”能力。当用户“置身”于街景中的任意位置时,系统不仅能识别并描述当前视野内的建筑、商铺、交通设施等元素,还能结合精确的地理位置数据,生成结构化、上下文相关的语音反馈。例如:“您正面向一座红砖建筑,左侧是咖啡馆,右侧是公交站,前方50米处为十字路口。”这种动态描述让虚拟游览不再是被动接收信息,而是主动感知环境。

更引人注目的是其智能对话交互功能。用户无需记忆复杂指令,只需像日常交谈一样提问——“前面那栋楼是什么?”“附近有银行吗?”“这条路通向哪里?”——系统便会基于当前视角和地图数据库,给出准确、连贯的回答。这一能力依托于谷歌的Gemini大模型,构建了“AI Describer”(实时场景描述)与“AI Chat”(动态地理对话)两个子系统。

为确保操作对视障群体高度友好,StreetReaderAI采用了极简的交互设计。用户既可通过语音命令,也可使用标准键盘按键来控制视角旋转、前进后退或切换街景点位,全程无需依赖屏幕或触控界面。这种“语音+键盘”的双模输入方式,兼顾了不同用户的使用习惯,真正实现了“所问即所见,所控即所行”。
据悉,该原型系统支持对全球超过220个国家和地区的街景进行无障碍访问,并允许用户根据需求个性化设置描述的详细程度、关注重点(如导航或旅游)以及语音语速等参数。此外,系统还具备智能提醒功能,可主动提示附近的重要地标、潜在障碍物或导航方向确认,进一步提升使用安全与效率。
值得一提的是,StreetReaderAI的研发过程采用了包容性设计理念,由盲人用户与视力正常的研究人员共同参与开发,确保产品真正贴合目标群体的实际需求。这一创新不仅为视障人士打开了数字世界的新窗口,也为未来无障碍AI交互树立了新标杆。