广电视听人工智能生成内容
标识与管理技术方案与实验结果

显式标识与隐式标识一体化承载 · 预研阶段成果

一、要解决的问题

现行治理框架要求人工智能生成内容附加中文显式标识。但显式标识可被裁剪、遮挡或直接去除; 而以 C2PA 为代表的元数据型凭证方案,把溯源信息放在文件容器里,一经转码、截屏或平台二次分发就必然被剥离。 两者分置,造成「可见的不可溯、可溯的不可见」

广电视听行业多级台网分发、内容二次编辑频繁、终端形态多样、平台转码普遍,这个缺口尤其突出。

二、技术主张

同一枚合规显式标识,同时成为隐式溯源载体

观众看到的是符合治理要求的中文提示「人工智能生成合成内容」;而这枚标识的汉字字形上, 带有肉眼不可察觉的几何微扰动,承载着机构编号、分发渠道、标识日期等溯源信息。 即便内容经过多级转码、大幅降采样乃至录屏搬运,元数据凭证已被剥离, 仍可从画面上残留的这行字里还原出内容来源。

在分层体系中的位置

显式标识 → 元数据凭证(C2PA) → 字形隐式载荷(本方法) → 指纹比对。 本方法的职责是元数据被剥离后的鲁棒溯源兜底,与 C2PA 互补而非替代

为什么用汉字

标识容量取决于载体可扰动的结构自由度。拉丁字母平均只有 2–3 个笔画单元, 而在一级字库 3753 字上实测,汉字平均有 9.9 个笔元、26.7 个特征点。 经可靠性筛选后,可用载荷达到 每字 6.9 bit 以上。 这一优势来自汉字结构本身,而非某个特定字体——同一方法在甲骨文矢量字形与行书字集上都得到同量级容量。 数据集详情见汉字笔元描述数据库

三、方法

嵌入。以「笔元」——提笔为界的连续运笔单元——作为载荷单元, 通过绕笔元中点的微小旋转编码比特。强度以端点位移 δ 而非旋转角度量, 按各笔元力臂反算旋转角,避免「同角度旋转在短笔元上只产生亚像素位移」的检测盲区。

检测。半盲条件——检测端已知标准标识模板的几何形状。 对每个载荷位渲染 ±δ 两个假设掩膜,取其差分与画面做匹配滤波,由内积符号定判决; 检测前做 ±3 px 平移配准,并剔除邻笔画可能覆盖的像素。 视频场景下进一步对连续帧做软判决合并,等效信噪比按帧数平方根提升。

两个关键发现

其一,扰动强度存在非单调最优工作点。并非越强越好:强度过小,几何位移淹没在编码噪声里; 过大,笔元会甩进邻笔画的邻域,检测端的干扰掩膜失效,误码率不降反升。实测最优点在 δ=2.0 px(占字身框 1.25%)。

其二,载荷位需要隔离度判据。笔画密集的字形中,大量位置「看着够长、实际无有效信号」。 引入「剔除邻笔画干扰后差分掩膜的有效面积须高于阈值」这一判据后, 无攻击基线误码率从 3%–6% 降至 0。这是本方法可用的前提。

四、数据基础

本方法的数据基础是一级字库汉字笔元描述数据库, 收录 3753 个一级汉字,共 37198 个笔元、100291 个特征点。

每个字形以有序的笔元序列描述,笔元即一次连续运笔的最小单元、以实际提笔为边界。 相较于位图或轮廓曲线,这种描述保留了书写的结构层次,使扰动可以精确作用在单个笔元上, 而不影响字形的整体识读——这正是它能充当标识载荷单元的原因。

五、实验结果

载体为一级字库标准字形 3753 字(已完成字序核验与数据修复),取 200 字、每条件约 1400 bit 载荷; 宿主为 1280×720@25fps 运动背景视频;攻击链使用真实 ffmpeg 编解码往返,而非仿真模拟

标识条实际效果
标识条实际效果
法定术语「人工智能生成合成内容」标识条,字身框 120 px。上:未嵌入,与标准字形逐点一致;中:已嵌入 48 bit 溯源载荷;下:两者差分放大 6 倍,显示扰动落点。上、中两图肉眼无法分辨。
不可察觉性逐字对照
不可察觉性逐字对照
δ=2.0 px 时逐字对照。扰动量仅占字身框 1.25%,标识区结构相似度 SSIM 0.9421,全帧峰值信噪比 37.38 dB。
跨平台传播保持:误码率随转码码率的变化
跨平台传播保持:误码率随转码码率的变化
1280×720@25fps,真实 ffmpeg 编解码往返。δ=2.0 px 时,H.264 1000 kbps 及以上、H.265 全档码率下误码率为 0;仅在 300 kbps 极端条件下升至 1.30%。
图像域攻击下的误码率
图像域攻击下的误码率
JPEG 压缩、缩放、模糊、噪声与录屏搬运链共 12 种攻击。δ=2.0 px 时多数为 0,最弱项为缩放至 35%(1.23%)与录屏搬运链(0.94%)。
标识尺寸与容量、鲁棒性的关系
标识尺寸与容量、鲁棒性的关系
字身框 128 px(墨迹高约 56 px,占 720p 画面高 7.8%)即可实现无攻击零误码;尺寸继续增大主要提升容量而非鲁棒性。

δ=2.0 px 时的单帧逐比特误码率

分发链路误码率分发链路误码率
无攻击0JPEG Q90 / Q700
H.264 4000 kbps0JPEG Q50 / Q300.07%
H.264 2000 kbps0高斯噪声 σ=3 / 80
H.264 1000 kbps0高斯模糊 σ=0.50.29%
H.264 600 kbps0.36%缩放至 75% / 50%0.51% / 0.94%
H.264 300 kbps1.30%缩放至 35%1.23%
H.265 2000 / 600 kbps0录屏搬运链0.94%

系统级溯源结果

上表为单帧逐比特误码率。实际系统还有两层机制:视频的时域冗余(24 帧软判决合并) 与载荷的 CRC 校验纠错。原型系统以 30 bit 载荷(机构 10 + 渠道 4 + 日期 8 + CRC 8)实测:

分发链路溯源结果
原始(未再压缩)✔ 机构、渠道、日期全部正确
H.264 转码 2000 / 1000 / 600 / 300 kbps✔ 全部正确
720p → 360p → 回放✔ 正确
720p → 252p → 回放✔ 正确

7 条分发链路全部成功溯源。

六、原型系统

原型包含溯源载荷编解码、视频嵌入、多帧软判决查验三个模块,采用零外部依赖实现。

纠错策略经实测校准:仅在候选解唯一时才接受单比特纠正。 实测表明,若放宽到双比特枚举纠错,约七成情况会输出「看似合法却错误」的溯源结果—— 对溯源系统而言,报错误答案的危害远大于报「验不出」,故宁可判定失败。

本页配套的可交互原型在浏览器端完整复现了上述算法, 可自行填写溯源信息、施加各类攻击并当场查验。

七、当前工作的边界

  1. 宿主视频为合成运动纹理,非真实广电素材。真实素材下的验证属应用试验阶段工作。
  2. 检测为半盲——已知标准标识模板几何。对固定文案的显式标识而言,这正是真实场景。
  3. 音频标识、防篡改判定与 C2PA 双向映射目前处于方案设计阶段,尚未完成实现。
  4. 当前标识字形按笔元骨架以等宽单线渲染,尚未实现符合行业排版规范的风格化外观。 笔元描述已实现结构与风格解耦,同一套骨架可渲染为不同笔形风格,该部分属后续研究内容。