少样本跨域古文字识别|项目展示

第四届世界科学智能大赛·古文字识别赛道参赛项目
最终成绩:F1 0.680599(约 0.6806),排名第 22

本页面用于公开展示项目背景、研究思路与阶段性成果。为遵守竞赛规则、数据许可与知识产权要求,仓库不公开训练数据、模型权重、完整 Docker 镜像及可直接复现提交结果的内部参数。

项目简介

古文字材料在载体形态、拓片质量、字形变异和图像风格方面存在显著差异。少样本跨域古文字识别的核心困难,不只是识别单个字符,还包括:

  • 拓片、器物照片等不同图像域之间的分布差异;
  • 古文字字形异体多、类内差异大、类间形态相近;
  • 部分字符样本极少,长尾类别与未登录字识别困难;
  • 图像破损、噪声、粘连和低对比度会同时影响检测与识别;
  • 检测召回率、识别准确率与最终端到端 F1 需要联合平衡。

本项目尝试把古文字学知识与计算机视觉方法结合起来,在有限标注条件下提高跨域识别的稳定性。

公开方法思路

1. 两阶段识别框架

将任务拆分为字符区域检测与字符类别识别两个阶段,分别处理复杂版面定位和细粒度字形判别,再围绕端到端指标统一调节阈值与错误传播。

2. 跨域与少样本增强

针对拓片、器物照片及不同采集条件之间的差异,使用多尺度训练、图像退化模拟、字体与形态扰动等增强方式,提升模型面对模糊、残损和低频字形时的鲁棒性。

3. 多模型互补

组合具有不同视觉归纳偏好的识别模型,通过集成决策降低单一模型对特定图像风格的偏差,重点改善长尾字符和形近字的判别。

4. 长尾类别与未登录字处理

扩展候选字符空间,并对低频类别进行针对性训练与校准,使系统能够保留对生僻古文字的输出能力,而不是将其强制归入常见字。

5. 测试时增强与上下文校正

对候选字符区域进行多尺度、多边距推理,并结合局部上下文和置信度进行保守校正,在精确率与召回率之间取得更合适的平衡。

比赛结果

指标 结果
最终 F1 0.680599
公布精度 0.800584
公布召回率 0.591891
最终排名 第 22 名

这一结果说明,多模型互补、跨域增强以及对长尾字符的专门处理能够改善端到端表现;同时,字符检测召回仍是后续提升的重点。

研究者简介

王逸飞(Hugging Face: @Raphael2099

主要研究早期中国、出土文献与古文字识别,重点关注甲骨文、金文和简帛材料。研究工作尝试将传统古文字学与数字人文方法结合,涉及计算机视觉与 OCR、文本相似度、历史地理和 QGIS 空间分析等方向。

相关兴趣包括:

  • 甲骨文、金文及简帛文字的图像识别与数字化;
  • 早期中国文献、孔子书写与文本相似度分析;
  • 秦统一问题及战国疆域重建;
  • 基于谭其骧公元前 350 年历史地图的战国七国面积重建;
  • 人工智能在古文字学、历史学与考古材料研究中的应用。

项目定位与开放范围

本仓库是成果展示页,不是可直接部署的模型仓库。完整竞赛镜像、模型权重与复现材料已单独归档,不在此公开。若有合规的学术合作或成果核验需求,可通过 Hugging Face 账号联系。

English Summary

This project was developed for the Few-shot Cross-domain Ancient Script Recognition track of the 4th World Science Intelligence Competition. It achieved an F1 score of 0.680599 (0.6806) and ranked 22nd.

The system follows a two-stage detection-and-recognition pipeline and explores cross-domain augmentation, complementary model ensembling, long-tail and out-of-vocabulary character handling, test-time augmentation, and context-aware confidence calibration. The broader research goal is to connect Chinese paleography and excavated-text studies with computer vision, OCR, text similarity, and historical GIS.


说明: 自动识别结果不能替代古文字学释读与人工核验。本项目仅用于学术研究和技术交流。

Downloads last month

-

Downloads are not tracked for this model. How to track
Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support