笔记检索
把散在不同格式里的读书笔记汇总成一份本地全文索引,重点解决中文分词和结果排序。目前检索延迟已经从 800 毫秒压到 90 毫秒左右,还能再挤。
把日常里零散的念头做成能反复验证的小实验,再把结果安静地留在这里。不追热点,不做更新承诺——写的时候认真写,停的时候就停。
我在一家做基础设施的团队写后端。工作之外的时间基本分给三件事:把想法做成能跑起来的小东西、把读过的书整理成能检索的笔记、把踩过的坑写清楚留档。这三件事都算不上成果,但连起来是一条线,回头看得见自己是怎么走过来的。
名字取作「个人测试」,是因为我确实把很多时间花在测试上——测一个想法值不值得继续,测一个工具能不能长期用下去,测一套笔记结构能不能撑住三年。答案常常是否定的,而否定本身也是记录。
这里不放进度表,也不排更新计划。手上有什么就写什么,写完就搁着,过一阵回来再看,多半会推翻一半。这大概就是它存在的意义。
把散在不同格式里的读书笔记汇总成一份本地全文索引,重点解决中文分词和结果排序。目前检索延迟已经从 800 毫秒压到 90 毫秒左右,还能再挤。
处理重复的文本整理与格式转换,尽量做到零依赖、单文件、装上就能用。比起功能多,我更在意它三年后还能不能直接跑起来。
把多年积累的照片按时间与地点重新整理,去掉重复帧,做一份能长期保存的备份。整理的过程比结果有意思得多。
主要靠预建倒排表加一层结果缓存,顺带把查询里的全表扫描换成了索引命中。改动不大,效果比预期好。
原来的三地两副本太重,改成一份本地加一份异地,恢复演练完整跑通了一次。演练里暴露的两个坑都已经补上。
把散落的十几个脚本收进一个命令行入口,参数统一,帮助信息重写。以前要翻笔记找用法,现在敲一下就知道。
先解决格式统一,再谈检索。这一步比想象中慢,但把源头理顺之后,后面所有事都轻了。
有事写信给我,写清来意和背景,我看到会回。技术讨论、笔记交流、工具报错都欢迎——尤其是那些「你这个地方写错了」的邮件,通常最有价值。
回信不一定快,但基本不会漏。