笔元是书写过程中一次连续运笔的最小单元,以实际提笔为边界。 一个汉字的一个笔画可能包含多个笔元(如「横折钩」在转折处提笔或换向), 因此笔元数通常多于传统笔画数。
相较于把汉字当作整体位图或轮廓曲线,笔元描述保留了书写的结构层次: 每个笔元是一串有序特征点,可独立参数化、独立变换。这正是本项目将其用作 标识载荷单元的原因——扰动可以精确作用在单个笔元上, 而不影响字形的整体识读。
下方每个字形中,不同颜色代表不同笔元,圆点为特征点(端点画得更大), 数字为笔元顺序。可调节下方控件观察。
每个字形记录为一串整数序列,以 -64,0 为笔元分隔符,坐标取值范围 ±64,
字身框为 64 个坐标单位。解析后得到若干笔元,每个笔元是一个有序特征点序列。
本数据集在用于研究前完成了系统性核验。核验方法是把每条笔画数据渲染成字形, 与标准字序表逐位比对,并用分段偏移动态规划对齐定位错位区间。核验发现并修复了三类问题:
笔画数据与字序表虽然条数相同,但存在 3 条记录缺失、3 条记录冗余, 错位量沿文件累积成 −1/0/+1/+2 四段。表现为部分字形与标签不符, 且错位多发生在同音字组内部(如「鸣」对到「铭」、「石」对到「时」),不易察觉。
处理:补入缺失的 3 个字,删除 2 条重复记录与 1 条不在字序内的记录。
5 条记录含有远离字形主体的孤立特征点,使字形边长达到 49–94 坐标单位 (正常约 28)。这类点会撑大字身框、导致渲染偏小,并在参数化时引入误差。
处理:逐条打开修正,边长全部回到 24–28 的正常区间。
原始文件中字符列与笔画数据虽在同一行,但字符列系后期并排录入, 排序规则与笔画数据不完全一致,不能作为身份依据。
处理:改以标准一级字库字序表为准,通过字形匹配逐条校验对应关系。
| 核验项 | 结果 |
|---|---|
| 记录数与标准字序 | 3753 = 3753,逐行一致 |
| 字标重复 | 0 条 |
| 边长异常(超字身框或明显偏大) | 0 条 |
| 无有效笔画的空记录 | 0 条 |
该数据集是「显式标识与隐式标识一体化承载」方法的数据基础。 标识文案中的每个汉字,其笔元被用作独立的载荷单元; 扰动强度、可用载荷位的筛选判据,均建立在笔元的几何属性之上。
实测在该数据集上,经可靠性筛选后可用载荷达到每字 6.9 bit 以上, 10 字的法定标识文案「人工智能生成合成内容」容量达 48 bit, 足以承载机构编号、分发渠道、标识日期与校验码构成的 30 bit 溯源载荷。
相关技术方案与实验结果见技术说明页, 可交互演示见原型系统。
本页出于演示目的,抽样展示了全库约 的字形。 完整数据集及其解析工具可按需提供,请通过项目联系人获取。