这个系列写到这里,该聊点未来的事情了。
前三篇文章分别是:FreeInk 的全栈解析、硬件路线与软件路线的对比、各个项目的技术栈全景。这一篇我不打算再拉清单了——我想聊聊我看到的几个信号,以及它们可能会怎么改变我们读书这件事。
先说一个暴论:今天的电子书阅读器,在上手体验上,还没有超越十年前初代 Kindle Paperwhite 的水平。 无论是开源还是商业,市面上的阅读器本质上还是在做同一件事——把电子墨水屏换成分辨率更高的、加了前光、调了刷新率——但你在阅读器上能做的事情,和 2012 年没有本质区别。
翻页。标注。查词典。调字体。
就这些。
但这几年出现了一些有意思的信号,让我觉得这个局面可能快要被打破了。
信号一:500KB 的离线语音合成
七月初有个项目在 HN 上拿了 204 票:moonshine-micro。一个语音识别 + TTS 模型,整个打包不到 500KB,能在很一般的硬件上离线运行。
500KB 什么概念?一张网页里随便一张图片就比它大。而它能在 ESP32 级别的芯片上,把一段文字转成语音读出来。
这个信号对电子书阅读器的意义太大了。
现在的阅读器「听书」功能,要么依赖云端 API(需要联网、有延迟、涉及隐私和成本问题),要么是预录好的有声书(需要额外购买、不是每本书都有)。离线 TTS 把这两个问题一并解决了——如果你在 FreeInk 的 Sticky 上(PDM 麦克风 + 扬声器硬件已就位)跑一个 500KB 的 TTS 模型,你随时可以把正在看的书变成有声书,不联网、不花钱、不依赖任何第三方。
你可能会说 TTS 质量不够好。确实,500KB 的模型和云端十亿参数级别的 TTS 比,自然度和表现力差距明显。但想想十年前的 TTS 和现在的差距——这个方向进步很快。等离线模型到了 2MB 就能达到可接受的水平时,阅读器带听书功能就会变成标配,而不是锦上添花。
FreeInk 的 Sticky 设备带 PDM 麦克风这件事也很有意思。硬件已经有了,缺的只是固件层面的 TTS 集成。我猜再过一两个版本,FreeInk 的官方示例里就会出现 TTS 相关的代码。
信号二:彩色墨水屏终于到了「能用的阶段」
这是我亲眼看过实物之后得出的结论。
M5 PaperColor 的 Spectra 6 六色屏,虽然完整刷新需要 15 秒,但 FreeInk 团队做的 340ms 中断刷新方案,让快速翻页变得可以接受。色彩偏暖偏淡,但已经能区分章节标题的颜色、高亮的底色、以及插图的大致色彩。
这个”能用了”是很重要的节点。
回想一下电子墨水屏的历史:2007 年 Kindle 初代发布时,屏幕是灰阶的、刷新率慢、残影严重。当时很多人说「这玩意儿永远替代不了纸质书」。但后来的迭代解决了残影问题(动态波形)、亮度问题(前光)、分辨率问题(300PPI)。每一次进步都在拓宽它的适用边界。
彩色墨水屏正在走同样的路。第一代彩色屏(E Ink Triton)颜色寡淡、刷新极慢。到 Spectra 6,颜色更饱和了。到 FreeInk 用中断刷新的技巧强行解决了刷新速度问题——虽然不够完美,但至少让人看到了「彩色墨水屏做阅读器不是不可能」的可能。
彩色能干什么?教科书里的图表、漫画、摄影集、代码高亮、笔记的颜色标注。这些都是黑白屏做不到的。如果彩色屏的成本继续下降,阅读器从「读书工具」变成「读任何文档的工具」,这个市场空间会大得多。
信号三:交互式内容需要交互式阅读器
Hacker News 上有个项目叫 Immersive Math(交互式线性代数教科书),157 票。读者的评价是「这才是电子书该有的样子」。你可以旋转 3D 图形、滑动滑块调整参数、实时看到数学公式的变化。这是纸和 PDF 做不到的事。
同一天,另一个项目 Justif(Knuth-Plass 断行算法的 Web 实现,90 票)在尝试把 TeX 级别的排版质量带到浏览器里。虽然是两个不同方向的项目,但它们暗示了同一个趋势:人们开始对「电子书 ≈ 静态排版」这件事感到不满足了。
交互式内容对阅读器提出的要求是:阅读器不能只是一个翻页器,它还需要是一个可交互的平面。 这对硬件路线的阅读器是个挑战——电子墨水屏的刷新率做不到流畅的 3D 交互。但对软件路线的阅读器(尤其是 Web 方案的 unobox)来说,交互式内容反而是天然的优势:你能在浏览器里做的事,在浏览器阅读器里都能做。
信号四:端侧 AI 让阅读器长出「大脑」
我上个月写过一篇关于端侧模型的文章。Bonsai 27B 能在手机上跑、Gemma 4 26B 能在一颗 13 年前的 Xeon 上以 5 tok/s 运行。这些信号都在指向同一个方向:AI 推理正在从云端下沉到边缘设备。
这对阅读器意味着什么?
一件事:阅读器不再只是显示文字,它可以理解文字。
想一想这个场景:你在读一本英文技术书,遇到一个不懂的概念,在句子上点一下——不是查词典,而是让阅读器用你自己的语言解释给你听。这个翻译是离线的,理解是在本地完成的,没有数据外泄。
或者这个场景:你读到一本 400 页的书,想快速了解它的结构。阅读器自动生成整书的摘要和关键论点。离线完成,不依赖任何云端 API。
或者这个:你读到一半忘了前面的某个角色——你问阅读器「那个戴眼镜的工程师在第几章出现过?」阅读器搜索了本地缓存的内容,给你答案。
这些事情,现在的浏览器 + AI 已经能做到了。但离线、在阅读器上原生集成、用微小的模型跑——还差一步。但我看这一步不远。两三年内,离线 AI 会变成高阶阅读器的标准配置。
回到开源生态
上面聊了四个信号,技术层面都很有前景。但它们有一个共同的约束条件:谁来把这一切集成到一个产品里?
商业公司的答案是:我们来,但我们做出来的东西是封闭的。Kindle 不会有离线 TTS,因为它要卖 Audible。Kobo 不会做交互式内容,因为排版引擎是闭源的。
开源的答案是:大家一起做。KOReader 的插件系统已经有人在做 AI 摘要的实验了。FreeInk 的硬件设计文件是开放的,任何硬件厂商都能参考它来生产自己的阅读器。
我觉得未来两三年可能会是这样的图景:
- FreeInk 作为电子墨水屏的「参考平台」,硬件厂商用它来设计新品,社区贡献固件功能——TTS、AI 摘要、更好的中文排版
- unobox 这样的纯前端方案吃掉「随手读书」这个场景——浏览器打开即读,通过 Service Worker 实现离线缓存,通过 WebLLM(浏览器端的 LLM)实现离线 AI
- KOReader 继续在旧硬件上发光发热——那些被淘汰的 Kindle/Kobo 跑着最新的开源社区固件,反而能用上这些新功能
- 交互式内容在桌面端阅读器上先落地——Readest 和 Foliate 的渲染能力最适合做这件事
没有人能单枪匹马把所有事情都做了。但开源生态的美妙之处就在于,不需要一个人做所有事。你做 TTS 集成,我做 AI 翻译,他做排版增强——最终这些碎片拼在一起,就是一个比任何商业产品都完整的阅读体验。
最后说几句
写这个系列的过程中,我最大的感受不是「开源阅读器多厉害」,而是「原来有这么多人和我一样,在乎读书这件事怎么做得更好」。
FreeInk 团队花那么多时间去调一个 SSD1677 驱动的波形参数,不是为了卖设备。KOReader 的维护者十年如一日地更新代码,也不是为了赚钱。unobox 做纯前端阅读器,更不是因为浏览器渲染 EPUB 是最优解。
都是因为在乎。
在乎的方式不一样:有人选择改进硬件,有人选择打磨软件,有人选择把门槛降到最低。但终点是一样的——让你翻开一本书的时候,能暂时忘掉周围的一切。
也许这才是阅读器最重要的功能。不管它是用什么技术栈写的。
📚 回到系列开篇 →
评论