一级字库汉字笔元描述数据库

面向内容标识的汉字结构化矢量描述数据 · 数据概况与抽样展示

一、什么是「笔元」

笔元是书写过程中一次连续运笔的最小单元,以实际提笔为边界。 一个汉字的一个笔画可能包含多个笔元(如「横折钩」在转折处提笔或换向), 因此笔元数通常多于传统笔画数。

相较于把汉字当作整体位图或轮廓曲线,笔元描述保留了书写的结构层次: 每个笔元是一串有序特征点,可独立参数化、独立变换。这正是本项目将其用作 标识载荷单元的原因——扰动可以精确作用在单个笔元上, 而不影响字形的整体识读。

下方每个字形中,不同颜色代表不同笔元,圆点为特征点(端点画得更大), 数字为笔元顺序。可调节下方控件观察。

二、数据结构

每个字形记录为一串整数序列,以 -64,0 为笔元分隔符,坐标取值范围 ±64, 字身框为 64 个坐标单位。解析后得到若干笔元,每个笔元是一个有序特征点序列。

三、数据质量核验

本数据集在用于研究前完成了系统性核验。核验方法是把每条笔画数据渲染成字形, 与标准字序表逐位比对,并用分段偏移动态规划对齐定位错位区间。核验发现并修复了三类问题:

问题一:字序错位

笔画数据与字序表虽然条数相同,但存在 3 条记录缺失、3 条记录冗余, 错位量沿文件累积成 −1/0/+1/+2 四段。表现为部分字形与标签不符, 且错位多发生在同音字组内部(如「鸣」对到「铭」、「石」对到「时」),不易察觉。

处理:补入缺失的 3 个字,删除 2 条重复记录与 1 条不在字序内的记录。

问题二:离群特征点

5 条记录含有远离字形主体的孤立特征点,使字形边长达到 49–94 坐标单位 (正常约 28)。这类点会撑大字身框、导致渲染偏小,并在参数化时引入误差。

处理:逐条打开修正,边长全部回到 24–28 的正常区间。

问题三:标签来源不可靠

原始文件中字符列与笔画数据虽在同一行,但字符列系后期并排录入, 排序规则与笔画数据不完全一致,不能作为身份依据。

处理:改以标准一级字库字序表为准,通过字形匹配逐条校验对应关系。

核验结果

核验项结果
记录数与标准字序3753 = 3753,逐行一致
字标重复0 条
边长异常(超字身框或明显偏大)0 条
无有效笔画的空记录0 条

四、在本项目中的作用

该数据集是「显式标识与隐式标识一体化承载」方法的数据基础。 标识文案中的每个汉字,其笔元被用作独立的载荷单元; 扰动强度、可用载荷位的筛选判据,均建立在笔元的几何属性之上。

实测在该数据集上,经可靠性筛选后可用载荷达到每字 6.9 bit 以上, 10 字的法定标识文案「人工智能生成合成内容」容量达 48 bit, 足以承载机构编号、分发渠道、标识日期与校验码构成的 30 bit 溯源载荷。

相关技术方案与实验结果见技术说明页, 可交互演示见原型系统

五、说明

本页出于演示目的,抽样展示了全库约 的字形。 完整数据集及其解析工具可按需提供,请通过项目联系人获取。