少样本跨域古文字识别|项目展示
第四届世界科学智能大赛·古文字识别赛道参赛项目
最终成绩:F1 0.680599(约 0.6806),排名第 22
本页面用于公开展示项目背景、研究思路与阶段性成果。为遵守竞赛规则、数据许可与知识产权要求,仓库不公开训练数据、模型权重、完整 Docker 镜像及可直接复现提交结果的内部参数。
项目简介
古文字材料在载体形态、拓片质量、字形变异和图像风格方面存在显著差异。少样本跨域古文字识别的核心困难,不只是识别单个字符,还包括:
- 拓片、器物照片等不同图像域之间的分布差异;
- 古文字字形异体多、类内差异大、类间形态相近;
- 部分字符样本极少,长尾类别与未登录字识别困难;
- 图像破损、噪声、粘连和低对比度会同时影响检测与识别;
- 检测召回率、识别准确率与最终端到端 F1 需要联合平衡。
本项目尝试把古文字学知识与计算机视觉方法结合起来,在有限标注条件下提高跨域识别的稳定性。
公开方法思路
1. 两阶段识别框架
将任务拆分为字符区域检测与字符类别识别两个阶段,分别处理复杂版面定位和细粒度字形判别,再围绕端到端指标统一调节阈值与错误传播。
2. 跨域与少样本增强
针对拓片、器物照片及不同采集条件之间的差异,使用多尺度训练、图像退化模拟、字体与形态扰动等增强方式,提升模型面对模糊、残损和低频字形时的鲁棒性。
3. 多模型互补
组合具有不同视觉归纳偏好的识别模型,通过集成决策降低单一模型对特定图像风格的偏差,重点改善长尾字符和形近字的判别。
4. 长尾类别与未登录字处理
扩展候选字符空间,并对低频类别进行针对性训练与校准,使系统能够保留对生僻古文字的输出能力,而不是将其强制归入常见字。
5. 测试时增强与上下文校正
对候选字符区域进行多尺度、多边距推理,并结合局部上下文和置信度进行保守校正,在精确率与召回率之间取得更合适的平衡。
比赛结果
| 指标 | 结果 |
|---|---|
| 最终 F1 | 0.680599 |
| 公布精度 | 0.800584 |
| 公布召回率 | 0.591891 |
| 最终排名 | 第 22 名 |
这一结果说明,多模型互补、跨域增强以及对长尾字符的专门处理能够改善端到端表现;同时,字符检测召回仍是后续提升的重点。
研究者简介
王逸飞(Hugging Face: @Raphael2099)
主要研究早期中国、出土文献与古文字识别,重点关注甲骨文、金文和简帛材料。研究工作尝试将传统古文字学与数字人文方法结合,涉及计算机视觉与 OCR、文本相似度、历史地理和 QGIS 空间分析等方向。
相关兴趣包括:
- 甲骨文、金文及简帛文字的图像识别与数字化;
- 早期中国文献、孔子书写与文本相似度分析;
- 秦统一问题及战国疆域重建;
- 基于谭其骧公元前 350 年历史地图的战国七国面积重建;
- 人工智能在古文字学、历史学与考古材料研究中的应用。
项目定位与开放范围
本仓库是成果展示页,不是可直接部署的模型仓库。完整竞赛镜像、模型权重与复现材料已单独归档,不在此公开。若有合规的学术合作或成果核验需求,可通过 Hugging Face 账号联系。
English Summary
This project was developed for the Few-shot Cross-domain Ancient Script Recognition track of the 4th World Science Intelligence Competition. It achieved an F1 score of 0.680599 (0.6806) and ranked 22nd.
The system follows a two-stage detection-and-recognition pipeline and explores cross-domain augmentation, complementary model ensembling, long-tail and out-of-vocabulary character handling, test-time augmentation, and context-aware confidence calibration. The broader research goal is to connect Chinese paleography and excavated-text studies with computer vision, OCR, text similarity, and historical GIS.
说明: 自动识别结果不能替代古文字学释读与人工核验。本项目仅用于学术研究和技术交流。