一级字库汉字笔元描述数据集

面向内容标识的汉字结构化矢量描述数据 · 数据概况与抽样展示

一、什么是「笔元」

笔元是书写过程中一次连续运笔的最小单元,以实际提笔为边界。 一个汉字的一个笔画可能包含多个笔元(如「横折钩」在转折处提笔或换向), 因此笔元数通常多于传统笔画数。

相较于把汉字当作整体位图或轮廓曲线,笔元描述保留了书写的结构层次: 每个笔元是一串有序特征点,可独立参数化、独立变换。这正是本项目将其用作 标识载荷单元的原因——扰动可以精确作用在单个笔元上, 而不影响字形的整体识读。

下方每个字形中,不同颜色代表不同笔元,圆点为特征点(端点画得更大), 数字为笔元顺序。可调节下方控件观察。

二、数据结构

每个字形记录为一串整数序列,以 -64,0 为笔元分隔符,坐标取值范围 ±64, 字身框为 64 个坐标单位。解析后得到若干笔元,每个笔元是一个有序特征点序列。

三、在本项目中的作用

该数据集是「显式标识与隐式标识一体化承载」方法的数据基础。 标识文案中的每个汉字,其笔元被用作独立的载荷单元; 扰动强度、可用载荷位的筛选判据,均建立在笔元的几何属性之上。

可用载荷位与字号强相关,引用时必须连同 em 框一并给出。实测(δ=2.0 px, 251 字抽样):em 框 160 px 时每字平均 6.75 bit,中位 7,区间 2–8; em 框 112 px 时每字平均 4.61 bit。

就完整标识条而言,10 字的法定标识文案「人工智能生成合成内容」在 em 框 116–120 px 下容量 48 bit(本页上方效果图即此文案); 本项目实验实例采用的「本视频由人工智能生成」在 em 框 112 px 下容量 47 bit。两者均足以承载机构编号、分发渠道、标识日期与校验码 构成的 30 bit 溯源载荷。两个数字对应不同文案与不同字号,并非相互矛盾。

相关技术方案与实验结果见技术说明页, 可交互演示见原型系统

四、说明

本页出于演示目的,抽样展示了全库约 的字形。 完整数据集及其解析工具可按需提供,请通过项目联系人获取。