17611538698
webmaster@21cto.com

Unicode 18.0 发布,新增 13,007 个字符,其中包括中国小篆体

动态 0 15 45分钟前
Unicode 18.0 发布,新增 13,007 个字符

21CTO 导读: 俗称“万国码”或称“统一码”的Unicode更新了,这次新字符集不少。

我们手机、电脑上显示的每一个文字、每一个表情,背后都离不开 Unicode 这套编码体系。而 2026 年 9 月 16 日,Unicode 联盟正式推出 18.0 版本,一次就新增 13007 个字符。有意思的是,普通人一眼能认出的新表情符号仅有 9 个,绝大部分新增名额,都留给了沉睡千百年的古老文字,其中 11328 个小篆字符更是重磅登场,让秦代文字正式走进全球数字世界。

很多人每天都在和 Unicode 打交道,却未必真正了解它到底是什么。

计算机底层只认得 0 和 1,它看不懂汉字、英文字母,更看不懂表情😀。Unicode(统一码)就相当于全世界文字的 “数字身份证”:给地球上几乎所有文字、符号分配独一无二的编码编号。电脑、手机依靠这套编号完成存储、传输,跨设备、跨系统打开文本,就不会出现乱码。

举几个大家熟悉的编码示例:

  • 大写字母 A → U+0041
  • 小写字母 a → U+0061
  • 数字 1 → U+0031
  • 汉字「中」 → U+4E2D
  • 汉字「小」 → U+5C0F
  • 笑脸表情😀 → U+1F600


当系统读到编码U+4E2D,就知道这代表汉字 “中”;读到U+1F600,就匹配笑脸表情,再调取字体库把字形渲染在屏幕上。

而这一次 Unicode18.0 把小篆、女真文纳入标准,这些尘封于古籍碑铭的华夏古文字,同样拿到了全球通用的数字身份。未来随着操作系统、字体文件逐步适配完善,手机、电脑就可以像显示简体中文一样,流畅渲染千年前的古老文字。

Unicode 18.0,这次都更新了什么


新版本合计新增13007 个字符,总编码字符数量达到 172808 个。更新覆盖古文字、全新 Emoji、多国货币符号,接近九成的新增字符,都用来收纳失传或小众的古代书写系统。

四大全新古文字正式入库


本次一口气新增四套独立书写系统:

  1. 小篆(Seal)
    本次更新分量最重,足足收录 11328 个字符。源自秦朝 “书同文”,是现代汉字最重要的远古源头,大量字形取自《说文解字》与秦汉碑铭文物,是中华文字文化的重要遗产。
  2. 女真文(Jurchen)
    共计 914 个字符,金朝创制的官方表意文字,曾经通行于我国东北,直至明初仍有少量使用。
  3. 奇索文(Chisoi)
    印度东北部地区使用的现代文字。
  4. 原始楔形文字(Proto‑Cuneiform)
    人类最古老的苏美尔文字雏形,本次优先收录其中数字类符号。


图片


全新 Emoji 表情符号


本次一共新增 9 款 Emoji 表情符号。

女真文、小篆两种中国古文字,共约 1.3 万字符,正式加入全球文字编码标准 Unicode 18.0 3

新增三套国家官方货币符号


货币符号想要进入 Unicode 标准,有一套严格流程:必须先由对应国家央行正式确立官方符号,再提交提案,才能完成编码收录。本次新增三款:

  • 马尔代夫拉菲亚符号
  • 阿联酋迪拉姆符号
  • 阿曼里亚尔符号


重点安全修复:针对 AI 风险,重定义变体选择器,这是非常容易被忽略,但对大模型系统至关重要的改动。


变体选择器原本的作用,是用来指定同一个字符的不同显示样式。过去部分变体选择器在界面上完全不可见,攻击者会利用它把恶意载荷、隐藏指令埋进肉眼看起来完全正常的文本,用来绕过内容过滤,对 AI 大模型进行隐式注入攻击。

Unicode18.0 重新修订规范,清晰划分合规、不合规的变体选择器用法,同时给出实现建议:不再把非法变体序列直接隐藏消掉,而是让它在界面上可见,不给隐蔽攻击留下隐身空间。

除此之外,新版本同步更新排序规则、国际化域名、链接识别等配套规范,并且新增 UAX #60 东亚表意文字数据附录,专门管理小篆、女真这类古文字的元数据。

完整官方公告请见:

https://blog.unicode.org/2026/09/announcing-unicode-standard-version-180.html

作者:场长

评论

我要赞赏作者

请扫描二维码,使用微信支付哦。

分享到微信