当屏幕阅读器遇到图片,除了“图片”和乱码,它现在还能说点别的
visAware 是一款为 NVDA 提供 OCR、图像描述、自动识别和 AI 辅助计算机操作的插件。
技术,让许多曾经遥不可及的事情变得触手可及。书籍里的插图,社交媒体上的图片,聊天过程中朋友随手发来的截图,以往使用屏幕阅读器的你我都曾感到茫然。
还记得几年前我们为了学习高等数学,翻遍了盲文图书馆却找不到一本盲文版的高等数学教材,在电子书平台上购买了电子版,却发现所有的数学公式都是用图片呈现的,屏幕阅读器遇到只能读“图片”、“图片”、“图片”。最终我们只能在电商平台上付费找人制作真正可访问的版本——无非是把纸质版变成用 Markdown 排版的文字形式,把其中的数学公式用 LaTeX 写出来。一本同济版的《高等数学》(上册)的制作成本将近 900 元。
如今,有了多模态大模型的加持,一键识别公式、描述图片、追问照片细节都不再是难事,视障者的数字世界由此打开了更多可能。
功能概述
- 为书籍插图、界面截图和社交媒体内容生成文字描述,并支持追问图片细节。
- 识别图片里的文字、图表或数理化公式等内容,并提供可交互的阅读方式。
- 利用 AI Agent 按照用户指令协助操作计算机,适用于无障碍支持存在缺陷的自绘界面。
visAware 是一款屏幕阅读器扩展插件,可以灵活接入各种多模态大模型,充分发挥各个模型的专长。

我们推荐使用 Google 开源的 Gemma4 模型,它支持完全离线部署,即便是 Gemma4 12B 的量化版本,也能取得很好的效果。
本版也内置了其他视觉识别能力,包括传统的 OCR 识别。这是首个公开版本,我们会持续接受社区贡献和用户反馈,不断改进其功能。

典型应用场景
Agent 协助操作
针对没有提供无障碍支持的自绘界面,visAware Agent 可以结合屏幕内容定位需要操作的控件,完成点击、滑动、文字输入等操作。下面的视频记录了 Agent 协助完成火绒安全软件从安装到设置的过程。

自动描述
即时聊天中收到图片后,visAware 可以自动生成简洁描述,无需逐张打开图片或手动启动识别。下面的视频展示了 NVDA 对图片进行自动描述的过程。
数学公式识别
遇到教材中以图片呈现的公式时,visAware 可以识别公式内容,并交给 NVDA 朗读。下面的视频展示了从教材页面识别公式并朗读的过程。
使用反馈
这是 visAware 的首个公开版本,它源于我们的真实需求,也承载着我们对于更好工具的期待。如果您希望它走得更远,欢迎在文末留言区写下试用后的真实感受——无论是夸赞还是批评,我们都格外珍视。对于认真反馈的伙伴,我们将邀请您加入 visAware 核心用户体验群,抢先试用新功能,解锁更多未开放模型。
关注 visAware
- 官方网站:visAware.site
- GitHub:cary-rowen/visAware
- 开发者:cary@nvdacn.com
- 下载:NVDA 用户可直接在插件商店获取。
好插件,大力支持。相信这个插件是一个新纪元的起点,更多可能性即将诞生。