两周前,我从未在自己的机器上运行过人工智能模型。我构建的每一个项目都是通过密钥调用云端应用程序接口。后来,我在 超威半导体“推进人工智能 2026”峰会 的氛围编程实验室里,目睹了一个模型在笔记本电脑上回答问题,没有任何数据流出房间,这让我心动不已。
我有一个习惯。当某件事让我兴奋时,我会在尚未准备好时就着手去追求。这次就是这样。我故意选择了一个超出我能力范围的项目,然后花了一周时间,拒绝放弃它。
因此,在展示任何数据之前,核心要点是:数据本身并非重点,好吧,某种程度上它们确实是重点。重点在于,我不断遇到障碍,却仍然坚持前行。其余部分只是关于如何做到的过程。
我选择了一个本不该启动的项目。
这个想法是模型考古学。选取一个 2019 年的模型和一个 2025 年的模型,在同一台笔记本电脑上运行它们,并衡量六年时间究竟带来了哪些变化。我将其命名为“二次挤压”。挤压一颗旧柠檬,再挤压一颗新柠檬,看看汁液是否相同。
旧柠檬:GPT-2 XL,2019 年发布,拥有 15 亿参数。新柠檬:Qwen3-0.6B,2025 年发布,规模不到前者的一半。两者均通过 Lemonade(超威半导体的本地人工智能服务器)在本地运行。此前我从未安装过此类软件。但我还是开始了。
安装过程与我作对,但我坚持了下来。
过程并不顺利。但我总是乐于接受挑战!命令并非文档中暗示的那个。第一次运行时,它不在我的系统路径中。图形处理器后端尝试下载文件,但因文件被锁定而卡住,这种情况发生了两次。我的 Python 版本对于评估工具来说太新了,因此我为这个项目单独搭建了一个第二个 Python 环境。
这些都不光鲜亮丽。但解决这些问题正是乐趣所在!每遇到一堵墙,都面临同样的小抉择:关闭标签页,还是阅读错误信息并再尝试一种方法。我不断选择再尝试一种方法。最终,一个微小的 2025 年模型在我的笔记本电脑上向我打招呼,我可能发出了一声欢呼:“太好了!”
我的第一个真正计划遇到了障碍,于是我移开了障碍。
最初的计划是测试准确性。GPT-2 有一个著名的 2019 年基准测试,我想看看旧的说法是否站得住脚。该测试需要模型提供特定类型的概率数据,但 Lemonade 并未以标准工具期望的方式返回这些数据。此路不通。
过去的我会将此解读为我并不适合做这件事的证据。但 Claude 和现在的我选择了阅读文档,准确找出缺失的内容,干净利落地复现了问题,并在 Lemonade 的代码仓库中提交了一个问题报告,以便下一个人遇到的是路标而不是墙壁。我的第一次开源贡献,完全源于某件事无法正常工作。
随后,我将问题更改为工具能够回答的问题。不是关于有多聪明,而是关于速度有多快,以及它是否能遵循指令。好奇心相同,只是换了一扇门。
我自己的基准测试揭穿了我的谎言,而我接受了它。
这是我最引以为豪的部分,它始于一个错误。
我的第一次速度测试显示,GPT-2 的速度为每秒 0.31 个词元。与新模型的 90 相比,差距为 297 倍。巨大。我多么希望这是真的。
在发布之前,Claude 编写了一个小脚本,让任何人都可以通过一条命令重新运行所有数据。我运行了它。GPT-2 的结果返回为 8.5,而非 0.31。我的第一个数据是垃圾数据,是在后端仍在下载且模型刚从磁盘加载(冷启动)时测量的。真正的差距约为 11 倍,而非 297 倍。
我本可以保留 297 倍这个数字。没人会去核查。但我保留了 11 倍,并写下了第一个数据为何失真,因为无法复现的数据不是结果,而是谣言。我为了保持诚实而构建的工具,最终揭穿了我。那一刻仿佛浓缩了整个月的经历。
并且
免责声明:本文内容来自互联网,该文观点不代表本站观点。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容,请到页面底部单击反馈,一经查实,本站将立刻删除。