社区共建加密领域LLM,训练完成后权重将开源至Hugging Face
1/ 这个爬虫在读取一个维基百科页面后爆火。想象一下,100倍更多的爬虫读取整个加密领域网页,并用它们找到的所有内容从头训练一个大语言模型(采用karpathy的nanochat方法)。所以我打造了这个项目。
你可以实时观看每一个爬虫,你生成的每一个爬虫都会让下一个模型变得更大。训练完成后,权重会在hugging face上开源,你就可以和它对话。这是一个只读取过加密领域内容的大语言模型。
2/ 每个爬虫都会把它收集到的内容交给“女王”,“女王”就是我们正在训练的大语言模型。模型的大小上限就是它读取过的内容总量。
karpathy的nanochat要求每个参数大约对应10个token,对同一文本重复处理超过4次就只是记忆了。所以“女王”是阶梯式升级的。v1是42M参数,需要2000万+唯一token(约1500万字)。v8是1.68B参数,需要32亿+token(约24亿词),规模大致和GPT-2相当,但它的每一个token都来自web3数据。你生成的每个爬虫都会增加这个计数。
3/ 每个爬虫都是真实的无头Chromium,背后由deepseek agent驱动。它浏览网页,读取它到达的每一个页面,只保留实际上和加密或web3相关的内容。如果页面偏离主题,它就会丢弃,回到自己的列表。
它还会读取PDF,比如白皮书。它保留的所有内容都会进入“女王”的网络,“女王”用这些数据训练大语言模型。你可以在网站上实时观看每个爬虫在页面间的活动。
4/ 你也可以运行自己的爬虫。销毁100万token(供应量的0.1%),就能生成一个标有你名字的爬虫。创作者费用的20%会平分给爬虫所有者。
每24小时,这个资金池会在所有爬虫间平分,以SOL的形式发放,所以运行3个爬虫你就能得到3份分红。每个爬虫都有自己的实时页面,显示它的排名、收益和读取过的内容。它帮助训练的每个版本都会在hugging face上把你列为贡献者。
5/ OpenAI有gptbot,Anthropic有claudebot。它们整天都在爬取网页,外界没人能看到模型训练到底用了什么内容。这个项目运行着和真实实验室一样的流程,只是完全公开。
流程是:爬取、去重、用爬取数据训练分词器、预训练、对话调优,然后对每个版本用同样的30个加密prompt做评估。每个版本发布时都会提供safetensors格式的权重、分词器、评估答案和包含它所用精确数据集哈希的模型卡。任何人都可以检查。这就像一个非常小的AI实验室,但你能看到里面的一切。
创作者费用剩下的80%用来支付爬取、GPU小时数和其他训练费用。部署后不久会在这里回复部署合约地址。
合约地址:BXoHJddsWJLHtAopeiSbKUSELsu8hSFMs8baGMDkpump
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖