识典古籍是北京大学-字节跳动数字人文开放实验室所开发和运营的一个中国古籍数字化平台,于2022年10月11日上线。平台目前收录了两千餘部中国古籍,按内容主题分为经部、史部、子部、集部、道教部和佛教部六个类别,提供免费阅读、注解查询和全文检索等功能。
背景
对古籍进行数字化是一项很常见的行动,目前世界上已有不少古籍数字化项目,用于收录版权过期、进入公有领域的作品,如美国的古腾堡计划创建于1971年、日本的青空文库创建于1997年、维基媒体基金会旗下的维基文库创建于2003年等等。而针对中国古籍,也有国学大师网、中國哲學書電子化計劃等平台,一些图书馆以及研究部门亦有对部分中国古籍进行数字化,不过或许没有完全对公众免费开放。有些公司也有进行中国古籍数字化的计划,不过由于技术、版权等原因而搁置或终止。
据统计,中国现存约20万种中国古籍,合计约5000万册,其中有图片扫描的约8万种,有文本数字化的只有约4万种,此外还有约1000万册古籍亟需修复。将古籍扫描成图片固然可以保存和保护古籍,但仅仅是图片版本的扫描并不能进行全文检索,不便于研究、阅读和传播,因此将图片转成文本,以文本的形式实现完全数字化才能起到最大的作用。中国一直在陆续进行中国古籍的修复、整理、保存与出版工作,其中就包括对中国古籍进行数字化,让古籍文本不依赖于纸质介质,更好地保存下来,但由于参与人数少,古籍数量众多,导致进展较为缓慢,仍然有很多古籍没有实现完全数字化。
开发过程
2022年3月17日,北京大学数字人文研究中心与字节跳动公益部门联合成立了北京大学-字节跳动开放实验室,开发识典古籍,进行中国古籍的数字化。字节跳动方面的开发人员有不少本身就对古籍就有浓厚的兴趣,有个别产品经理研究生时期修读的专业还是古典文献。
古籍的数字化分三个步骤,第一是使用电子扫描仪将古籍原本扫描成电子图片;第二是利用光学字符识别技术将图片版中的文字转化成文本,并在此基础上进行校对;第三是将文本进行整理,使其更加容易阅读。
平台的检索功能可以搜索书籍标题,也可以全文搜索,并可以进行作者、书籍、分类和朝代的筛选。平台提供了收藏夹功能,注册并登录帐号后可以使用。平台的阅读界面也针对智能手机、平板电脑等移动设备做了适配
参考资料
外部链接
*
评论 (0)