自动替代文本已经进步巨大,但不加思考地使用它,产出的依然是糟糕的无障碍体验。差距不在模型质量,而在于替代文本到底是干什么的。
替代文本真正的用途
替代文本传达的是图像在其语境中的功能,而不是它内容的清单。同一张照片,因为它出现在页面上的理由不同,替代文本也应不同:
- 在商品页上:"胡桃木桌面收纳盒,三格,正面视角。"
- 在一篇关于森林砍伐的文章里:"采自一片已被清伐林地的胡桃木。"
- 作为装饰性页头:写空的 alt 属性,让读屏软件跳过它。
视觉模型只看得到像素。它无法知道自己身处上述哪种情境,而这个局限是结构性的,不是暂时的。
AI 做对了什么
- 物体和场景识别——对常见主体通常准确。
- 颜色、数量、空间排布——大体可靠。
- 图中文字(OCR)——往往不错,而且确实有用,因为图片里的文字否则完全无法被获取。
- 规模化的速度。 面对一万张没有描述的图片库,AI 草稿远胜于"什么都没有",而后者才是现实中的替代方案。
它做错了什么
- 目的与语境。 上面说的核心问题。
- 描述过度。 模型倾向于把一切都描述出来,只需一句话的地方产出一长段。读屏用户会听到每一个字。
- 与周围文字重复。 如果图注已经说过了,替代文本再说一遍就是噪音。
- 以"一张……的图片"开头——读屏软件已经会宣告这是图片。
- 自信的错误。 把商品、物种、地标或人物认错,而且陈述时毫无不确定感。
- 姓名与身份。 模型无法知道这是*你们的 CEO* 或*客户的产品*。
- 图表和数据。 "一张柱状图"毫无用处;替代文本需要的是结论或数据,而模型可能读错。
- 文化与敏感内容——对人物外貌、残障、族裔或宗教着装的描述,需要模型不具备的判断力。
一套有效的工作流
- 用 AI 为整个图库生成草稿——这解决了覆盖率问题。
- 按重要性分流。 承载含义的信息类图片(商品、图表、示意图、人物)交人工审阅。纯装饰性图片写空 alt 属性,而这一点没有模型能替你决定。
- 按语境和长度编辑。 精简为一句清楚的话,服务于这张图在该页面上的目的。去掉"一张……的图片",去掉与图注重复的内容。
- 核实具体指认——商品名、人物、地点。
- 图表和示意图的替代文本手写,或者把数据写进周围正文、把图片标记为装饰性。
- 用读屏软件抽查。 听一遍自己的页面被朗读出来,能发现任何清单都查不出的问题。
哪些场景下自动化确实是正确选择
- 规模化的用户生成内容,因为替代方案是完全没有描述。
- 正在补做无障碍改造的历史存档。
- 供人工编辑使用的初稿。
把 AI 替代文本当作抬高下限的起点,而不是完成的答案。要避免的失败模式是:一个网站每张图技术上都有 alt 文本,却依然无法使用——这个结果比缺失 alt 文本更糟,因为它看起来是合规的。