随着 AI 生成内容越来越普遍,AI 水印和内容溯源技术也开始受到关注。与传统图片上的文字水印不同,部分 AI 水印并不会直接显示在内容表面,而是通过特殊的字符、文本生成规律、文件元数据或内容溯源信息进行标记,因此普通用户很难直接发现。
最近 GitHub 上的开源项目 watermarks-remover 就因为这一方向受到关注。该项目由 Guillaume Meyer 开发,定位并不是传统意义上的图片水印擦除工具,而是用于清理多种 AI 来源标记(AI provenance marks)的开源工具。
watermarks-remover GitHub 地址:https://github.com/guillaumemeyer/watermarks-remover

目前项目已经覆盖 Unicode 隐形字符、统计型文本水印,以及 C2PA、EXIF、XMP 和文档属性等多种信息。
什么是 watermarks-remover?
watermarks-remover 是一个面向开发者和 AI 工作流的开源项目,主要用于清理自己拥有或有权处理的文本和文件中的 AI 来源信息。项目采用多层处理思路,将不同类型的水印和来源标记分别处理。
其中第一层主要针对 Unicode 隐形字符,例如不可见控制字符、双向文本标记、特殊空格以及 Tag Characters 等。这类信息不会影响普通用户阅读,却可能被程序检测出来,因此可以通过确定性的 Python 脚本进行清理。
第二层则针对更加复杂的统计型文本水印。某些大语言模型可能通过调整 Token 的选择概率,在生成文本时形成一种人眼无法直接观察的统计规律。watermarks-remover 提供重写机制,通过改写、释义等方式尽可能破坏这种统计特征。不过项目作者也明确说明,这属于 best-effort 处理,并不能保证通过任何官方检测。
watermarks-remover 支持哪些类型的水印?
watermarks-remover 的一个特点是,它并没有把功能局限在 Claude 文本水印上,而是采用了多厂商、多类型 AI 来源标记的设计。
项目目前涉及 Claude、Gemini / SynthID-Text、OpenAI provenance surfaces,以及部分开源大模型采用的统计型水印方案。对于文本内容,它可以处理不可见 Unicode 字符和部分基于 Token 采样规律形成的统计水印。
对于文件,则主要针对 C2PA、EXIF、XMP 和文档属性等来源信息。当前项目已经扩展到 PNG、JPEG、WebP、AVIF、HEIC、BMP、GIF、TIFF、SVG、PDF、DOCX、XLSX、PPTX、EPUB、ODT、HTML、Markdown,以及部分音视频格式。
这意味着它更适合被理解为一个 AI 内容来源信息清理工具,而不是传统的 Photoshop 式水印去除工具。
它是如何处理隐形水印的?
watermarks-remover 的核心思路可以简单理解为三层。
第一层是 Unicode 清理。工具会检查文本中的不可见字符、特殊空格、双向控制符以及其他异常 Unicode 字符,并在需要时进行删除。这类操作具有比较明确的确定性,通常不会改变正常文本的语义。
第二层是文本重写。如果面对的是基于 Token 选择规律产生的统计型水印,仅仅删除不可见字符并不能解决问题。因此项目提供 rewrite_text.py,通过重新改写文本来降低原始生成文本中的统计特征。项目还支持连接 Ollama 等模型进行本地重写。
第三层是文件元数据清理。例如图片、PDF 或 Office 文档可能携带 C2PA、XMP、EXIF 或文档属性。watermarks-remover 可以检查并清理这些信息,必要时还可以结合 c2patool、ExifTool 和 qpdf 等工具进行更深入的处理。
如何安装 watermarks-remover?
对于开发者来说,项目提供了比较直接的 GitHub 开源代码安装方式。当前版本已经从早期的单纯脚本方案逐渐发展为包含 Python 服务、Agent Skill 和多个文件处理模块的项目。
项目要求 Python 3.10+,核心功能主要使用 Python 标准库,不依赖庞大的第三方 Python 包。也可以启动本地 HTTP 服务,然后让 Agent Skill 通过 HTTP 调用相关能力。官方 README 给出的默认服务地址为 127.0.0.1:8765。
对于普通开发者,如果只是想研究项目原理,可以直接查看 GitHub 源码和 skills/remove-ai-marks/ 目录;如果希望集成到自己的 AI 内容处理流程,则可以进一步研究 service、scripts 和相关测试代码。
watermarks-remover 能不能彻底去除 AI 水印?
这是使用这类工具时最需要注意的问题。不能简单地认为 watermarks-remover 可以 100% 去除所有 AI 水印。
项目作者在 README 中已经明确区分了可验证的清理功能和 best-effort 的水印破坏功能。尤其是统计型文本水印,由于检测算法、密钥以及具体生成机制可能并不公开,第三方工具无法保证处理后的文本一定无法被官方检测系统识别。
此外,项目不同版本的能力也在持续变化。GitHub Release 页面显示,项目近期已经增加了可选的 SynthID 像素评分能力,同时持续修复 C2PA 检测和清理相关问题。
因此,更准确的说法应该是:watermarks-remover 可以帮助用户 检测、清理或扰乱部分 AI 来源标记,但它不是一个能够保证“AI 检测结果为零”的万能工具。
watermarks-remover 适合哪些人?
对于开发者、AI 内容研究人员以及需要批量处理自己文件的人来说,这个项目比较有研究价值。例如开发者可以利用它研究 Unicode 隐形字符、AI 文本水印、C2PA 内容溯源以及文件元数据之间的区别,也可以把它集成到自己的内容处理流水线中。
如果你只是想去掉图片上的明显 Logo、文字或者半透明水印,那么 watermarks-remover 并不是传统意义上的最佳选择,因为它的重点是 AI 来源标记和元数据,而不是图像修复。
对于企业或团队来说,这类工具同样可以用于内容隐私和文件清理。例如在文件正式发布之前,对图片、文档以及 Markdown 内容进行元数据检查,避免无意中暴露不需要公开的来源信息。
写在最后
watermarks-remover 是一个比较有意思的开源项目,它反映了 2026 年 AI 内容生态中的一个新趋势:AI 水印已经不再只是图片角落里的 Logo,而可能存在于文本生成规律、Unicode 字符、C2PA 内容凭证、EXIF/XMP 元数据以及 Office 文档属性等多个层面。
从目前的项目定位来看,watermarks-remover 更适合开发者用来研究和清理自己拥有的内容,而不是简单理解成“AI 降检测工具”。尤其是对于统计型 AI 水印,项目本身也没有承诺能够绕过官方检测。
如果你对 Claude 隐形水印、Gemini SynthID、C2PA、AI 内容溯源以及 AI 水印检测技术感兴趣,watermarks-remover 是一个值得关注的 GitHub 开源项目。项目采用 MIT License 开源,目前仍在快速迭代,其功能也从最初的文本清理逐渐扩展到了更加完整的多媒体内容来源信息处理。
需要强调的是,在实际使用过程中,应当优先处理自己拥有版权或获得授权的内容,并遵守相关平台规则、学校或机构的 AI 使用政策以及当地法律法规。