一位对埃及学感兴趣的开发者发布了名为 HieraticBench 的基准测试,旨在评估当前大模型识别古埃及僧侣体(hieratic)手写文字的能力。该基准的第一版包含 268 个项目,涵盖真实文献、符号及其他古埃及文字作为对照,还包括一句未公开发表的句子及其两种不同书写版本。

发生了什么

开发者因对埃及学的热爱,疫情期间曾委托牛津大学埃及学家将一句英文翻译成僧侣体,并请 Instagram 上的僧侣体专家以“圣经级”精度重绘。此后,每当有新模型发布,他都会用这句僧侣体测试模型,发现模型几乎无法正确识别,更不用说翻译。这促使他将测试系统化,构建了 HieraticBench。

基准中,当前最先进的基础模型在识别该未公开句子时表现糟糕,尤其对埃及学家手写版本,部分模型竟将其误判为藏文、乌尔都文、韩文,甚至出现“改革埃及文”(源自《摩门经》)这样的回答。在真实文献上,表现最佳的模型识别僧侣体的正确率为 95%,但单个符号的解读准确率仅约 13%,且这是在明确告知模型文字为僧侣体的前提下。对于没有答案密钥的密封句子,没有模型能真正翻译。

开发者表示,由于成本限制,并未对所有模型运行所有任务。目前仅 Claude 系列模型完成了符号解读测试,下一步计划用 Astra 和 Gemini 3.1 Pro 在真实文献上运行。他也坦言自己毫无基准测试经验,评分可能不完全准确。

为什么重要

现有许多基准测试正逐渐饱和,需要寻找新的维度来评估模型能力。古文字识别与翻译涉及视觉、语言和历史知识的综合理解,为衡量模型泛化能力提供了独特视角。HieraticBench 的初步结果揭示,即使模型在特定任务上表现良好,但在需要深度解读和跨领域知识的场景中仍存在显著短板。

开发者呼吁社区参与,希望有人能运行尚未覆盖的模型,并提供更多密封句子和标注符号。如有僧侣体知识或认识埃及学家,可通过 hieraticbench@veeza.ai 联系。源代码已在 GitHub 上开源。

来源:Show HN: HieraticBench – Can AI read ancient Egyptian handwr…(发布于 2026-10-06)