SEO优化部落

麻豆八零婚纱摄影工作室手机版-麻豆八零婚纱摄影工作室2026最新版v.3.84.42.2-22265安卓网

李怡杰头像

李怡杰

高级SEO优化分析师 · 十年经验

阅读 7分钟 已收录
麻豆八零婚纱摄影工作室手机版-麻豆八零婚纱摄影工作室2026最新版v.3.50.7.2-22265安卓网

图1:麻豆八零婚纱摄影工作室手机版-麻豆八零婚纱摄影工作室2026最新版v.2.7.53.85-22265安卓网

麻豆八零婚纱摄影工作室系列影视作品拥有独特的追剧情怀,一路见证角色成长与世界观拓展。老观众带着过往记忆观看新作,剧情伏笔相互呼应,情怀与新鲜感并存。

专场-6c808fbc

麻豆八零婚纱摄影工作室穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

金钟股份亏3429万实控方折价25%转让股权 蔚来资本5.86亿接盘绑定1.5亿业绩承诺-23aa4ecb

麻豆八零婚纱摄影工作室穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

电博会智慧康养展区呈现科技适老新产品 银发消费迎来新场景-news30fb2a6621eb843f
天语望远镜成功获取首光图像,一次曝光即完整摄下逾百万颗恒星-c46ad4af

两部门:进一步规范汽车企业供应商账期管理;理想汽车公布全系搭载自研电池计划-0a57354a

麻豆八零婚纱摄影工作室穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

泡泡玛特王宁:公司将在未来6个月内启动20亿元~50亿元股份回购计划-577b4c72

麻豆八零婚纱摄影工作室穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29

穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章 龟甲刻痕藏殷商旧事,青铜铭文载周礼风华,简帛笔墨记历代兴衰。甲骨文、金文、篆文等中国古文字,是镌刻在华夏大地上的文明密码。长久以来,这些古老文字深藏于残碑碎甲、古籍珍卷之中,因字形繁杂、异体繁多、文献残缺,始终难以被全面解读。 古文字研究依靠学者皓首穷经、逐字考据、手动缀合,凭借经验积累破解文明的密码。不过,仅凭人力研究,不仅耗时费力、效率低下,更有大量残字、孤字、疑难字陷入破译僵局。 如今,人工智能技术破壁而来,让冰冷的算法读懂温热的古文字,也为中华文脉的传承与创新开启了全新篇章。 人工智能的迭代升级,为古文字破译与传承带来颠覆性突破。AI不仅能精准切割拓片、文物上的残缺字形,还能通过分析笔画结构、刻痕深浅、书写风格,结合历史语境、文法逻辑推演字音字义,完成释义溯源、文献解读与文本缀合。但是,科技赋能并不意味着完全替代人文,人机协同才是古文字传承的最优解。AI只能提供数据参考与破译线索,最终的考证定论、文化解读、价值阐释,依然需要人文学者深耕细作。 在不久前举办的第二届CCF(中国计算机学会)人文智能大会上,三位学者分享了各自的研究成果。 全国古籍普查登记基本数据库已收录古籍949万余册(件),而古籍整理转录仍然需要大量人力投入,进展缓慢。面对海量文献,人工智能能否成为古籍整理的新帮手? 古籍有密集小字、双列夹注,书体跨越甲骨文、金文、篆隶行草楷,还常伴随残缺、污损和模糊。古籍OCR不只要回答“这是什么字”,还要判断“字在哪里”“先读哪一行”,更要保留底本原貌——这最后一条,正是“敬畏”的开始。为此,我们团队像带学徒一样,分三步“教”AI读古书。 我们团队研发的古籍OCR系统把识别粒度从文本行细化到单字符,并贯通版面分析、字符检测、文字识别和阅读顺序处理。相关研究覆盖3.4万余个字符类别、600余万样本,支持从甲骨文到楷书等七类书体,让机器既能辨认字形,也能找准文字在复杂页面中的位置。 大模型不能简单“整页通读”古籍:整页输入会压缩小字,逐行裁剪又会割裂语境;多栏、夹注中,视觉相邻也不等于阅读顺序相邻。团队研发的通古OCR大模型(TongguOCR),通过版面感知的智能分块兼顾字迹清晰度和上下文,并增强生僻字表示、引入行间转移标记,让模型同时学习“写什么”和“下一行在哪里”。公开数据集实验显示,其识别准确率明显超过现有同类方法。 异体字、通假字并非普通噪声,而是版本校勘、辨伪断代的重要证据——底本写作“爲”,就不能随意改成“為”。实验显示,让通用大模型自由修改识别结果,可能产生幻觉,还会按现代语言习惯把正确的异体字“规范化”。为此,团队提出“小模型识别、大模型后纠错”:小模型提供可信候选,大模型在候选范围内结合上下文判断,并设置异体字保护机制。小模型辨形,大模型通文,协同守住底本——教AI管住“顺手改字”的冲动,正是教它敬畏古籍。 目前,团队已上线古籍OCR实时演示系统。从小模型到大模型,再到大小模型融合,并非简单替代,而是让AI从“识字”走向对字形、版面、阅读顺序和语境的综合理解。需要强调的是,技术门槛正在降低,但面对承载深厚文化的古籍,人的知识积累、专业判断和学术品位依然起着决定性作用。AI更重要的价值,是成为研究者的伙伴,扩展人的研究能力边界,而不是取代人的学术判断。 汉字是三大古典文字中唯一传承至今的文字体系,维系着中华文明绵延不断。以甲骨文等古文字为研究对象的古文字学事关文化传承,却长期面临从业人员少、学术门槛高、成果产出难的困境,是典型的“冷门绝学”。进入数智时代后,为确保古文字学“有人做、有传承”,亟须推动传统科研范式向科学智能转型。 但是,大模型擅长现代通用文本,面对甲骨文、金文、简帛、碑刻等古文字材料,经常出现漏认错认、望文生义、生编硬造的问题,原因主要在于数据、知识、模型三方面。 古文字样本总量少、分布不均衡。甲骨文、金文等古文字因文体局限,文本总量远少于现代汉语文本和传世古汉语文本,很多古文字至今未能破译,可用于训练的标注样本稀缺。大模型学习依靠海量实例,样本不足就容易出现猜测代替实证。同时,大量未释读字尚无标准答案。相当一部分古文字的释读至今在学界没有统一结论,多家说法并存,没有唯一标准答案。大模型倾向输出一个确定的结果,会随机采信某一家,甚至混合多家观点生成“新说法”,并非严谨学术结论,实际属于幻觉编造。 不同于普通古汉语理解,古文字文本理解的第一步是辨析古文字形体,需要观察比对笔画、偏旁,考察形体演变源流。纯文本大语言模型本身不擅长视觉字形分析;多模态模型也容易混淆形近古文字,文字形体的细微差异往往被模型忽略。古文字释读、文本理解高度依靠考古、语言、历史等相关学科知识的综合运用。一片甲骨的含义,要结合出土坑位、同版卜辞以及同时期其他器物、语词和历史背景综合判断,不是单靠文字本身。大模型缺少这种多学科知识、多模态数据的整合运用,只从文字语义做推断,很容易曲解古文字字词、文本的原意。 大模型的核心目标是生成流畅合理的文字,而不是考据求真。遇到信息不足时,会补全出逻辑通顺、看似合理,但不符合事实的答案。 如何解决上述难题?复旦大学“十五五”新文科建设重点方向作出前瞻布局,由出土文献与古文字研究中心牵头建设“中国古典学重建与中西古典学互鉴”重点方向,参与建设“AI与人文社会科学双向赋能”“语言学研究与数智赋能”两个重点方向。贯穿这些方向的一个主线任务,就是利用数智赋能进一步加深古文字学与古典学、语言学的交叉融合,为大模型在古文字字形识别和文本理解方面提供数据、知识和新机制。具体做法包括: 在国家标准、中华字库工程标准的基础上编制出土文献整理出版规范标准,对出土文献与古文字释文注释的体例加以规范,包括古文字隶定方式、符号使用等,提供规范的古文字数据基础。 复旦大学、上海科学智能研究院与上海创智学院联合研发早期中华文明多模态大模型,出土文献与古文字研究中心提供古文字数据支持,并整合十余年整理的古文字字图切分、标注数据研发专用算法和工具。2026年,上海科学智能研究院与复旦大学联合主办的第四届“世界科学智能大赛”首设“古文字识别”赛道,参赛团队也为古文字识别提出了多种算法方案。 出土文献与古文字原始资料、研究文献中包含或隐含的各类别、各层次的关系,目前尚无法利用大模型解析,只有靠领域专家通过文献精读来挖掘提取实体、关系和属性,做出高质量的知识图谱,在此基础上才可能进行知识整合和深度关联。 为落实复旦新文科建设重塑研究范式的要求,发挥开放平台模式优势,在数据采集整理、文献类聚、知识挖掘、知识关联等各个环节推动数智赋能和协作众包,切实将专家工作从低水平、重复性工作中解放出来。 上世纪八十年代,汉字曾面临无法进入信息时代的危机。在数智时代,作为汉字源头的古文字也同样面临危机。只有领域专家与AI专家通力协作构建高质量的古文字数据集和知识图谱、研发专用解析识别算法、搭建协作平台,才能实现古文字学与AI的双向赋能。我们希望AI引领推动古文字学研究范式向科学智能转型,加快构建基于出土文献与古文字的古典学、语言学自主知识体系,在中华优秀传统文化传承发展以及世界文明交流互鉴中贡献“复旦智慧”。 中国社会科学院民族学与人类学研究所 孙伯君 西夏(1038—1227年)遗存文献主要发现于河西故地,最大宗的出土于内蒙古额济纳旗的黑水城遗址,现分藏于圣彼得堡俄罗斯科学院东方文献研究所和英国国家图书馆。俄藏黑水城文献概有9000多件,英藏有7000个编号的残片。国内西夏文献主要藏于中国国家图书馆,概有佛经124卷。 西夏文献是铸牢中华民族共同体意识的重要资源。西夏文献不仅代表了中原儒家文化与典章制度对少数民族的广泛影响,也代表了少数民族对中华文脉的高度认同。西夏文是记录汉藏语系语言的四种古代文字之一,西夏文献是研究古代藏缅语的重要语料,也是研究汉字音的绝佳材料。 但是,要完整了解西夏文献,仅靠人力无法完成。比如,俄藏西夏文献中大部头的《大般若经》600卷还没有解读。同时,存世西夏文献中没有大型汉文与西夏文对照的解释性辞典,其字词用法和语法规律完全依靠存世西夏文文献与汉文、藏文原文的对照加以研究,建立逐字标注和整句翻译的数据库非常必要。 西夏文献中既有未传世的汉文本,又有汉文本已经佚失的西夏文译本。深入研究这些文献,可以厘清汉文缺载之史实。其中,北宋荆公新学代表性人物陈祥道所撰《论语全解》,是荆公新学唯一完整流存于世的《论语》注疏,若使之发挥作用,需要构建《论语全解》的知识图谱。 因此,西夏文字文献的数字化,是关系到提高文献识读能力,深入开展西夏文献的智能化研究的重要一环。这项工作可从以下几个方面着力开展:文献的比对与残片的缀合,西夏文的自动识别,西夏文献的逐字标注和整句翻译,西夏文献研究知识图谱的构建,现代藏缅语与西夏语语料库整合,西夏文献中汉语西北方音语料库的建设。 原标题:《穿越时光,让AI读懂古文字!华夏文明密码解读开启传承与创新的新篇章》 特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。 Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services. 智东西 2026-09-09 15:36:25 通信世界 2026-09-09 15:30:23 经纬戎韬 2026-09-08 00:20:35 飘过的知识 2026-09-06 10:51:10 最爱历史 2026-09-09 14:40:02 影视情报室 2026-09-07 08:04:47 艾爽看剧 2026-09-08 10:08:01 青春爱写字 2026-09-08 09:01:36 雪阳影视 2026-09-08 17:21:46 蒋南强读历史 2026-09-07 07:25:21 私享艺术 2026-09-09 14:53:22 蒋丰看日本 2026-09-09 12:58:09 朴素知道 2026-09-06 01:59:55 末蓝星星 2026-09-08 22:27:11 新华社 2026-09-08 15:18:24 参考消息 2026-09-08 21:47:08 悄悄把英语磨成随身技能 2026-09-09 10:15:40 小王趣味社 2026-09-05 06:56:09 海外网 2026-09-07 14:31:19 易学顾问黄志斌 2026-09-04 22:36:28 上观新闻 2026-09-07 06:07:53 唯美风景线 2026-09-08 03:46:15 硬核老高 2026-09-09 00:35:13 古代经典 2026-09-09 14:56:47 爱创剪辑 2026-09-09 08:57:10 中国经营报 2026-09-09 06:57:31 刘兴亮 2026-09-06 18:34:33 新加坡留学助手 2026-09-08 11:10:28 环球网资讯 2026-09-08 17:13:05 齐鲁壹点 2026-09-08 13:34:54 语文亦国学 2026-09-09 09:50:03 澎湃新闻 2026-09-09 11:26:10 星沙时报 2026-09-09 12:33:23 每日经济新闻 2026-09-09 15:43:19 半岛都市报 2026-09-09 07:35:10 在下易某很细 2026-09-08 02:52:52 一休剧社 2026-09-08 14:32:52 环球网资讯 2026-09-09 15:58:07 掌闻视讯 2026-09-09 13:57:26 财联社 2026-09-09 15:36:29