开发者用自家WhatsApp群聊在M1 Pro上训练2B小模型,真人赢下80%对局
有位开发者把自家WhatsApp群聊记录拿来微调,做出一个20亿参数的小模型。整个训练和运行,都在一台M1 Pro芯片笔记本上完成。
他想试试2B小模型能不能模仿六人群聊。项目花了他几个月。性能评估用了另一个LLM当裁判,整套流程和结果都公开在GitHub上的cookbook里。
效果有趣,但不够好。模型学到了群聊的俚语、反应习惯和说话节奏,生成的文本跟真人消息很像,却做不到连贯、一致的群组模拟。有些连贯性,但谈不上深度理解,也不掌握聊天者的个人信息,除了名字和几个明显的事实。
最好的版本,在真人vs模型测试里,真人赢下80%对局。理想值要低于50%,才谈得上真假难分。
他把可复现的本地pipeline、聊天UI、人类对照评估方法、测试结果和实验PDF一起放进了cookbook。私人聊天数据和微调后的权重没有对外发布。他觉得用自己的数据训练这个模型会很好玩,前提是先征得群聊里每个人的同意。
有个提醒:所有测试都是土耳其语做的。没有其他语言的测试结果,这套流程能不能复刻到英语之外,还没有答案。
项目还没完成。有些架构和训练数据格式没测,截至2026年9月,更强的2B模型也还没发布。