——小菜“大胖老师政策文件上说‘互联网中华文明’要激活文化遗产怎么六年过去了我回老家县图书馆发现阿姨还在用Excel手动敲书目”——大胖老师“因为政策是‘云’落地是‘泥’。云飘在天上很好看可泥里的脚印得有人一脚一脚踩出来。”——小菜“那咱们是踩泥的人”——大胖老师“不咱们是给踩泥的人送雨鞋的。”一、2016年的那阵春风吹到了哪里2016年5月国务院办公厅印发《关于促进“互联网中华文明”三年行动计划》明确提出要“运用物联网、云计算、大数据、人工智能等现代信息技术推动中华优秀传统文化创造性转化和创新性发展”。消息传出文化圈一片振奋。大胖老师当时正在北京开会亲眼看见一位老馆长激动得摘下眼镜擦了好几次“太好了国家终于重视了我们馆那批宋版书有救了”同年12月国家文物局等五部委联合发布《“互联网中华文明”三年行动计划》细化目标到2019年要“初步构建文物信息资源开放共享体系”“重点突破文物知识挖掘和展示传播关键技术”。注意这个时间节点——2019年。大胖老师说到这儿停顿了一下问小菜“今年是几几年”“2026年。”“那距离目标年份过去几年了”小菜掰手指数“7年。”大胖老师端起保温杯轻轻吹了吹气“7年。一个孩子从出生到上小学的时间。而某些县图书馆的古籍7年前是什么样7年后还是什么样——除了更旧了一点灰更厚了一层。”二、走访实录六个图书馆六种无奈为了搞清楚“互联网中华文明”到底在基层卡在了哪里大胖老师2019年到2024年间利用假期陆续走访了六个不同省份的县级图书馆。他管这叫“田野调查”小菜管这叫“公费旅游”。不过听完他的记录小菜再也不觉得是旅游了。第一个中部某县馆——设备在吃灰这家图书馆2018年用专项经费买了一台高拍仪和一套商业OCR软件总共花了八万多。大胖老师去的时候高拍仪上盖着防尘布旁边电脑的显示器落了一层灰。馆长解释“软件要联网认证我们的网速太慢老是验证失败。后来厂商技术支持到期了续费太贵就搁那儿了。”那套软件总共只处理了不到五十页古籍。每页成本折合一千六百元馆长算了这笔账后再也没好意思提数字化的事。第二个西部某县馆——人在等退休这家图书馆的管理员是一位五十八岁的老大姐一个人管着整个古籍书库。她告诉大胖老师“数字化我听说过但没人教。上面发过一个操作手册我看了几页看不懂。后来县里说等招到年轻人再说可年轻人谁愿意来图书馆工资两千多还不如去奶茶店。所以我就每天扫扫地等退休。”她管理的古籍有三千多册全部沉睡在铁皮柜里连扫描都没做。书倒是不脏因为根本没人翻。第三个东南某县馆——扫描了但等于没扫这家条件稍好2017年完成了全部古籍的扫描生成了满满两个硬盘的图像文件。大胖老师很高兴问能不能检索里面的文字。馆员一脸茫然“检索那得先打字上去吧我们没打过只是扫描了图片。”两个硬盘几万张图片没有文件名索引没有目录没有OCR。想看只能手动翻图。馆员补了一句“其实跟看原书差不多还更费眼睛。”第四个东北某县馆——数据上过云又被拉下来了这家馆曾经用过一家云OCR服务免费额度用完后觉得效果不错咬牙充了两千块钱。结果2022年县里搞网络安全检查发现他们把未公开的地方文献传到了商业云上涉嫌违规。馆长吓得连夜整改把所有数据撤回本地。从此定下规矩数据不许出馆。OCR工作再次停摆。两千块钱打了水漂还惹了一身骚。第五个西南某县馆——年轻人自己搭了一套这是唯一让大胖老师眼前一亮的。馆里有个计算机专业考进来的小伙子实在看不下去古籍继续沉睡用开源工具自己搭了一套简单的OCR流程。能跑但准确率不高遇到竖排繁体就崩。他给大胖老师看代码里面各种临时补丁和硬编码规则注释写着“这段我自己都看不懂了但不敢动动了就全崩。”大胖老师感动得差点把保温杯送给他。他看到了年轻一代的主动作为也看到了孤军奋战的无力。第六个华中某县馆——等“上面”的统一平台这家馆的态度最典型“我们不自己搞等省里统一部署。万一自己弄了以后跟省里的系统不兼容还得返工。”大胖老师问省里有时间表吗答“听说在论证还没批。”这一等从2018年等到2024年论证还没结束。古籍在柜子里等得都快成文物了系统还在PPT里。六个馆走下来大胖老师总结出了基层古籍数字化的“六宗罪”设备吃灰、人员断层、扫描无用、云上冒险、自建困难、等等无期。每一项单拎出来都不是绝症但搅和在一起就成了一个死结。“互联网中华文明”的春风吹过了省城吹过了地市到了县一级风力已经衰减到连一张纸都吹不起来。三、政策的“最后一公里”为什么这么难打通回到学校小菜替大胖老师整理调研笔记忍不住问“老师政策明明很好为什么到下面就变味了”大胖老师叹了口气画了一张图“你看从国家文件到一本书被读者搜到中间要经过几层”他一层一层写国家发布政策省里分解任务市里转发文件县里申请经费经费批复可能跨年采购设备/软件安装部署培训人员实际操作数据上传/服务读者“每一层都可能掉链子。经费批复卡在第5层人员培训卡在第8层实际操作卡在第9层。你算算从第1层到第10层顺利的话两三年不顺利的话就跟你看到的一样——七年过去还在第4层转悠。”小菜惊叹“这不就是玩传话游戏吗第一个人说‘古籍数字化’传到最后变成‘把书放好别弄丢’。”大胖老师点头“比喻恰当。更关键的是每一层的人痛点不一样。国家关心的是文化传承、文物安全省里关心的是考核指标、项目进度县里关心的是‘有没有钱’‘有没有人’‘出了事谁负责’。这些痛点在逻辑上是连贯的但在执行上是割裂的。中间缺一个‘翻译官’能把高大上的政策翻译成县图书馆阿姨也能操作的具体步骤。”他顿了顿加重语气“这就是‘文渊慧典’想当的角色——不是又一个政策不是又一个标准而是一个直接可用的工具。把第1层到第10层之间的技术障碍全部压扁变成‘下载、安装、上传、下载’四步。因为你不能指望一个连命令行都没见过的馆员去理解什么叫‘卷积神经网络’或‘CTC解码’。她只需要知道拖进去吐出来就完了。”四、手动抄写VS机器识别算一笔时间账为了让小菜更直观地感受“手动抄”有多离谱大胖老师拉出一组数据对比。假设一个县馆藏古籍1000册每册平均50页总计5万页。一个熟练的打字员一分钟能录入50个字。一页古籍平均500字录入一页需要10分钟。5万页就是50万分钟约等于8333小时。按每天工作8小时算需要1041天差不多三年。这三年里打字员不能生病、不能请假、不能辞职还得保证认识所有繁体异体字——这要求故宫博物院的专家都不敢说自己全认识。而用“文渊慧典”一页识别7秒5万页总共约350000秒折合不到97个小时。按一天跑10小时算不到十天。而且不用人盯着电脑自己在那儿吭哧吭哧转。馆员只需要泡杯茶隔一段时间看看进度条。时间差是八百多倍。小菜惊呼“这哪是效率提升这是把‘手工作坊’变成了‘工业流水线’。”大胖老师补充“还不止。打字员还有出错率繁体字和异体字经常打不出来得造字或贴图。我们模型虽然也有错误但准确率在90%以上剩下的10%还能通过后处理和人工校对来解决。而且模型输出的文字天然可搜索、可复制这是手动抄写永远无法企及的。你说这么简单的账为什么全国大部分县馆还在手动抄不是因为不想用技术而是因为技术没有送到他们手边。”五、一个“不正经”的案例如何用一部手机搞定社区家谱为了说明“傻瓜化”到底能做到什么程度大胖老师讲了一个最近的实验。2025年寒假小菜回老家过年。大胖老师给他布置了一个任务“你那个街道办不是有很多老住户吗搞一套家谱数字化试点就用你的手机和咱们的系统。”小菜觉得不可思议但照办了。他找街道办借了一套1980年代手抄的《王氏族谱》厚厚三本全是蝇头小楷竖排还是用圆珠笔写的字迹有些已经洇开。他用手机一页一页拍照虽然比不上专业扫描仪但300万像素也算清晰。拍完后他把照片打包发回实验室的台式机旧电脑i5处理器8G内存用“文渊慧典”跑了一晚上。第二天早上他收到一个压缩包里面是双层PDF和TXT文本。他找街道办主任演示在电脑上打开PDF画面是原汁原味的手抄族谱但用鼠标一划就能选中文字复制、搜索。主任当场搜自己的名字“王建国”系统瞬间定位到第87页显示“建国生于一九五六年三月初八……”主任眼睛一瞪“哎哟我的娘还真是我这上面连我小名都记着呢叫‘狗剩’。”满屋子哄堂大笑。这个实验的意义在于它不需要专业扫描仪不需要高配电脑不需要专业培训。一部手机采集图像一台普通电脑处理数据一个街道办主任就能操作。从采集到出结果不到24小时。“互联网中华文明”在这个街道办公室里不再是墙上的标语而是实实在在能搜到自己名字的软件。大胖老师说“这就是我们想要的可复制模式。县图书馆的条件怎么也比街道办强吧他们至少有一台正经的扫描仪。只要把软件送到把流程跑通那成千上万册的家谱、方志、契约就能像爆米花一样噼里啪啦地变成可检索的数据。”六、政策的雨终于要下到田里2024年到2026年情况正在悄然变化。大胖老师留意到几件事一是国家古籍保护中心在连续几年的培训中开始加入OCR实操课程二是部分省份如浙江、广东率先将古籍OCR工具纳入公共数字文化服务采购名录三是开源社区的关注度明显上升“文渊慧典”在GitHub上的Star数突破了5000其中不少用户就是市县图书馆的技术人员。“这说明什么”大胖老师自问自答“说明需求一直在只是以前没有合适的供给。当供给端出现了一个便宜、好用、不挑设备的方案时基层的活力就被激发出来了。政策是雨但雨要落到田里得先有沟渠。我们做的就是这个沟渠——把政策文件的善意变成一行行可执行的代码一张张可下载的PDF。”他最后告诫小菜“千万不要觉得这是个小项目。它本质上是‘数字中国’在文化领域的毛细血管工程。大动脉有国家队在修毛细血管没人修末梢就会坏死。我们就是那支修毛细血管的工程队。”七、后记别让“互联网”变成“互联网-”文章快写完时小菜查到一个数据截至2025年底全国已完成古籍数字化的比例仍不到总量的15%。这意味着还有超过2500万册古籍在等待被“看见”。如果按照过去十年的平均速度要完成全部数字化大约还需要五十年。而五十年后那些纸质脆弱的古籍还能撑得住吗小菜在笔记本上写了一行字作为这一章的结语“‘互联网中华文明’不是一句口号而是一道算术题。我们的工作就是让等号右边不再是一个遥遥无期的日期而是一个可以预期的明天。”窗外大胖老师的保温杯又空了。他站起身准备去茶水间续水。路过小菜工位时瞥见屏幕上正好是2026年7月25日的日历。他忽然笑了“今天刚好是‘互联网中华文明’政策发布十周年倒计时。等到十周年那天我们能不能说一句幸不辱命”小菜没回答但键盘敲得更响了。本文为注水技术版您看看即可不必当真写此文字就是图一乐-
《大话文渊慧典》:外一篇-“互联网+中华文明”喊了六年,县图书馆的扫描件还在手动抄?
——小菜“大胖老师政策文件上说‘互联网中华文明’要激活文化遗产怎么六年过去了我回老家县图书馆发现阿姨还在用Excel手动敲书目”——大胖老师“因为政策是‘云’落地是‘泥’。云飘在天上很好看可泥里的脚印得有人一脚一脚踩出来。”——小菜“那咱们是踩泥的人”——大胖老师“不咱们是给踩泥的人送雨鞋的。”一、2016年的那阵春风吹到了哪里2016年5月国务院办公厅印发《关于促进“互联网中华文明”三年行动计划》明确提出要“运用物联网、云计算、大数据、人工智能等现代信息技术推动中华优秀传统文化创造性转化和创新性发展”。消息传出文化圈一片振奋。大胖老师当时正在北京开会亲眼看见一位老馆长激动得摘下眼镜擦了好几次“太好了国家终于重视了我们馆那批宋版书有救了”同年12月国家文物局等五部委联合发布《“互联网中华文明”三年行动计划》细化目标到2019年要“初步构建文物信息资源开放共享体系”“重点突破文物知识挖掘和展示传播关键技术”。注意这个时间节点——2019年。大胖老师说到这儿停顿了一下问小菜“今年是几几年”“2026年。”“那距离目标年份过去几年了”小菜掰手指数“7年。”大胖老师端起保温杯轻轻吹了吹气“7年。一个孩子从出生到上小学的时间。而某些县图书馆的古籍7年前是什么样7年后还是什么样——除了更旧了一点灰更厚了一层。”二、走访实录六个图书馆六种无奈为了搞清楚“互联网中华文明”到底在基层卡在了哪里大胖老师2019年到2024年间利用假期陆续走访了六个不同省份的县级图书馆。他管这叫“田野调查”小菜管这叫“公费旅游”。不过听完他的记录小菜再也不觉得是旅游了。第一个中部某县馆——设备在吃灰这家图书馆2018年用专项经费买了一台高拍仪和一套商业OCR软件总共花了八万多。大胖老师去的时候高拍仪上盖着防尘布旁边电脑的显示器落了一层灰。馆长解释“软件要联网认证我们的网速太慢老是验证失败。后来厂商技术支持到期了续费太贵就搁那儿了。”那套软件总共只处理了不到五十页古籍。每页成本折合一千六百元馆长算了这笔账后再也没好意思提数字化的事。第二个西部某县馆——人在等退休这家图书馆的管理员是一位五十八岁的老大姐一个人管着整个古籍书库。她告诉大胖老师“数字化我听说过但没人教。上面发过一个操作手册我看了几页看不懂。后来县里说等招到年轻人再说可年轻人谁愿意来图书馆工资两千多还不如去奶茶店。所以我就每天扫扫地等退休。”她管理的古籍有三千多册全部沉睡在铁皮柜里连扫描都没做。书倒是不脏因为根本没人翻。第三个东南某县馆——扫描了但等于没扫这家条件稍好2017年完成了全部古籍的扫描生成了满满两个硬盘的图像文件。大胖老师很高兴问能不能检索里面的文字。馆员一脸茫然“检索那得先打字上去吧我们没打过只是扫描了图片。”两个硬盘几万张图片没有文件名索引没有目录没有OCR。想看只能手动翻图。馆员补了一句“其实跟看原书差不多还更费眼睛。”第四个东北某县馆——数据上过云又被拉下来了这家馆曾经用过一家云OCR服务免费额度用完后觉得效果不错咬牙充了两千块钱。结果2022年县里搞网络安全检查发现他们把未公开的地方文献传到了商业云上涉嫌违规。馆长吓得连夜整改把所有数据撤回本地。从此定下规矩数据不许出馆。OCR工作再次停摆。两千块钱打了水漂还惹了一身骚。第五个西南某县馆——年轻人自己搭了一套这是唯一让大胖老师眼前一亮的。馆里有个计算机专业考进来的小伙子实在看不下去古籍继续沉睡用开源工具自己搭了一套简单的OCR流程。能跑但准确率不高遇到竖排繁体就崩。他给大胖老师看代码里面各种临时补丁和硬编码规则注释写着“这段我自己都看不懂了但不敢动动了就全崩。”大胖老师感动得差点把保温杯送给他。他看到了年轻一代的主动作为也看到了孤军奋战的无力。第六个华中某县馆——等“上面”的统一平台这家馆的态度最典型“我们不自己搞等省里统一部署。万一自己弄了以后跟省里的系统不兼容还得返工。”大胖老师问省里有时间表吗答“听说在论证还没批。”这一等从2018年等到2024年论证还没结束。古籍在柜子里等得都快成文物了系统还在PPT里。六个馆走下来大胖老师总结出了基层古籍数字化的“六宗罪”设备吃灰、人员断层、扫描无用、云上冒险、自建困难、等等无期。每一项单拎出来都不是绝症但搅和在一起就成了一个死结。“互联网中华文明”的春风吹过了省城吹过了地市到了县一级风力已经衰减到连一张纸都吹不起来。三、政策的“最后一公里”为什么这么难打通回到学校小菜替大胖老师整理调研笔记忍不住问“老师政策明明很好为什么到下面就变味了”大胖老师叹了口气画了一张图“你看从国家文件到一本书被读者搜到中间要经过几层”他一层一层写国家发布政策省里分解任务市里转发文件县里申请经费经费批复可能跨年采购设备/软件安装部署培训人员实际操作数据上传/服务读者“每一层都可能掉链子。经费批复卡在第5层人员培训卡在第8层实际操作卡在第9层。你算算从第1层到第10层顺利的话两三年不顺利的话就跟你看到的一样——七年过去还在第4层转悠。”小菜惊叹“这不就是玩传话游戏吗第一个人说‘古籍数字化’传到最后变成‘把书放好别弄丢’。”大胖老师点头“比喻恰当。更关键的是每一层的人痛点不一样。国家关心的是文化传承、文物安全省里关心的是考核指标、项目进度县里关心的是‘有没有钱’‘有没有人’‘出了事谁负责’。这些痛点在逻辑上是连贯的但在执行上是割裂的。中间缺一个‘翻译官’能把高大上的政策翻译成县图书馆阿姨也能操作的具体步骤。”他顿了顿加重语气“这就是‘文渊慧典’想当的角色——不是又一个政策不是又一个标准而是一个直接可用的工具。把第1层到第10层之间的技术障碍全部压扁变成‘下载、安装、上传、下载’四步。因为你不能指望一个连命令行都没见过的馆员去理解什么叫‘卷积神经网络’或‘CTC解码’。她只需要知道拖进去吐出来就完了。”四、手动抄写VS机器识别算一笔时间账为了让小菜更直观地感受“手动抄”有多离谱大胖老师拉出一组数据对比。假设一个县馆藏古籍1000册每册平均50页总计5万页。一个熟练的打字员一分钟能录入50个字。一页古籍平均500字录入一页需要10分钟。5万页就是50万分钟约等于8333小时。按每天工作8小时算需要1041天差不多三年。这三年里打字员不能生病、不能请假、不能辞职还得保证认识所有繁体异体字——这要求故宫博物院的专家都不敢说自己全认识。而用“文渊慧典”一页识别7秒5万页总共约350000秒折合不到97个小时。按一天跑10小时算不到十天。而且不用人盯着电脑自己在那儿吭哧吭哧转。馆员只需要泡杯茶隔一段时间看看进度条。时间差是八百多倍。小菜惊呼“这哪是效率提升这是把‘手工作坊’变成了‘工业流水线’。”大胖老师补充“还不止。打字员还有出错率繁体字和异体字经常打不出来得造字或贴图。我们模型虽然也有错误但准确率在90%以上剩下的10%还能通过后处理和人工校对来解决。而且模型输出的文字天然可搜索、可复制这是手动抄写永远无法企及的。你说这么简单的账为什么全国大部分县馆还在手动抄不是因为不想用技术而是因为技术没有送到他们手边。”五、一个“不正经”的案例如何用一部手机搞定社区家谱为了说明“傻瓜化”到底能做到什么程度大胖老师讲了一个最近的实验。2025年寒假小菜回老家过年。大胖老师给他布置了一个任务“你那个街道办不是有很多老住户吗搞一套家谱数字化试点就用你的手机和咱们的系统。”小菜觉得不可思议但照办了。他找街道办借了一套1980年代手抄的《王氏族谱》厚厚三本全是蝇头小楷竖排还是用圆珠笔写的字迹有些已经洇开。他用手机一页一页拍照虽然比不上专业扫描仪但300万像素也算清晰。拍完后他把照片打包发回实验室的台式机旧电脑i5处理器8G内存用“文渊慧典”跑了一晚上。第二天早上他收到一个压缩包里面是双层PDF和TXT文本。他找街道办主任演示在电脑上打开PDF画面是原汁原味的手抄族谱但用鼠标一划就能选中文字复制、搜索。主任当场搜自己的名字“王建国”系统瞬间定位到第87页显示“建国生于一九五六年三月初八……”主任眼睛一瞪“哎哟我的娘还真是我这上面连我小名都记着呢叫‘狗剩’。”满屋子哄堂大笑。这个实验的意义在于它不需要专业扫描仪不需要高配电脑不需要专业培训。一部手机采集图像一台普通电脑处理数据一个街道办主任就能操作。从采集到出结果不到24小时。“互联网中华文明”在这个街道办公室里不再是墙上的标语而是实实在在能搜到自己名字的软件。大胖老师说“这就是我们想要的可复制模式。县图书馆的条件怎么也比街道办强吧他们至少有一台正经的扫描仪。只要把软件送到把流程跑通那成千上万册的家谱、方志、契约就能像爆米花一样噼里啪啦地变成可检索的数据。”六、政策的雨终于要下到田里2024年到2026年情况正在悄然变化。大胖老师留意到几件事一是国家古籍保护中心在连续几年的培训中开始加入OCR实操课程二是部分省份如浙江、广东率先将古籍OCR工具纳入公共数字文化服务采购名录三是开源社区的关注度明显上升“文渊慧典”在GitHub上的Star数突破了5000其中不少用户就是市县图书馆的技术人员。“这说明什么”大胖老师自问自答“说明需求一直在只是以前没有合适的供给。当供给端出现了一个便宜、好用、不挑设备的方案时基层的活力就被激发出来了。政策是雨但雨要落到田里得先有沟渠。我们做的就是这个沟渠——把政策文件的善意变成一行行可执行的代码一张张可下载的PDF。”他最后告诫小菜“千万不要觉得这是个小项目。它本质上是‘数字中国’在文化领域的毛细血管工程。大动脉有国家队在修毛细血管没人修末梢就会坏死。我们就是那支修毛细血管的工程队。”七、后记别让“互联网”变成“互联网-”文章快写完时小菜查到一个数据截至2025年底全国已完成古籍数字化的比例仍不到总量的15%。这意味着还有超过2500万册古籍在等待被“看见”。如果按照过去十年的平均速度要完成全部数字化大约还需要五十年。而五十年后那些纸质脆弱的古籍还能撑得住吗小菜在笔记本上写了一行字作为这一章的结语“‘互联网中华文明’不是一句口号而是一道算术题。我们的工作就是让等号右边不再是一个遥遥无期的日期而是一个可以预期的明天。”窗外大胖老师的保温杯又空了。他站起身准备去茶水间续水。路过小菜工位时瞥见屏幕上正好是2026年7月25日的日历。他忽然笑了“今天刚好是‘互联网中华文明’政策发布十周年倒计时。等到十周年那天我们能不能说一句幸不辱命”小菜没回答但键盘敲得更响了。本文为注水技术版您看看即可不必当真写此文字就是图一乐-