一篇文章发到网上后,会被谁看见,又会被拿去做什么,作者往往说了不算。

普通读者点开网页,读完、收藏或转发;另一边,自动程序也可能悄悄爬过页面,把文字成批带走,放进AI训练数据中。很多创作者直到自己的表达方式出现在机器生成的内容里,才意识到作品可能早已被收集。

最近上线并开源的字体工具ShieldFont,想给作者多一种选择。

它利用字体里的字形替换功能,让屏幕上显示的文字和网页源代码中的文字不完全相同。读者看到的仍是作者写下的原句,抓取程序拿到的却可能是另一组被替换过的词。

比如,作者写的是“记者调查了这家公司”,程序读取时,句子中的关键词可能已经变成别的名词和动词。替换后的句子看起来还有语法,意思却偏离了原文。机器即使把内容带走,也不一定能得到准确的信息。

ShieldFont团队希望借此提高未经授权抓取的成本。质量太差的文字可能会被训练系统过滤;即便进入数据集,也可能因为含义错乱而失去价值。

这项技术并不是一把绝对安全的锁。抓取者仍可以研究字体文件、分析替换规则,也可以通过网页截图和文字识别还原内容。使用特殊字体还可能影响搜索引擎收录,屏幕阅读器等无障碍工具也可能受到干扰。

项目团队没有把ShieldFont包装成万能方案。它更像一道门槛:挡不住所有人,却能让大规模、低成本的自动抓取变得麻烦一些。

ShieldFont现阶段主要面向英文内容,对中文文章的支持仍有限。它能产生多大效果,还需要更多网站和创作者实际使用后才能判断。

但它已经说出了不少作者心里的那句话:文章公开发表,是希望被人阅读,并不代表同意它被随意搬走,拿去训练机器。

当平台和法律规则还在追赶技术变化时,一些创作者决定先从一款字体开始,试着把文字的主动权拿回来。