德国刚刚加入前沿大语言模型竞争。
新的主权开源模型 Kolibri。
> 击败 Qwen2 635B
>
> 击败 Nemotron 3 Super
>
> 击败 Mistral Small 4
基于定制化MoE Transformer架构构建。
OpenAI 创始成员 Andrej Karpathy 发布了一个叫 autoresearch 的自动研究代理:三个文件、一张 NVIDIA GPU,就能自动循环跑 AI 研究流程,适合让科研在夜间自动推进。
来源@undefinedKi「Andrej Karpathy 发布 autoresearch 自动研究代理」
美国开源模型阵营正在集结:Reflection AI 计划本月发布开源模型,Axiois 称有一家投入数十亿美元的隐形初创即将推出微调后性能有望超过前沿大模型的开源模型,社区里也流出了多款新模型的发布时间表。这些目前都还是计划。
来源@AndrewCurran_「Reflection AI将发高性能开源模型竞争中国顶流」@kimmonismus「@kimmonismus 整理了一波新开源大模型发布传闻」@bindureddy「Axiois称美国初创即将推出顶级开源模型」
上海人工智能实验室发布了书生·端砚平台:注册即领每月免费调用额度,自家三款模型限时免费,还兼容主流 API 协议。
来源@xiangxiang103「上海人工智能实验室发布书生·端砚平台(5亿)」
很多人开发AI工具担心成本过高,实际上Cloudflare已经配齐了AI应用开发所需的大部分基础设施。 第一,Workers可承担API、业务逻辑和智能体调度,能直接作为AI应用的后端。
现在 Claude Code 只需几分钟就能克隆出几乎任何网站的界面 现在有一个开源模板可以分析任意网站,并将其转换为整洁的 Next.js 代码库。
我已经放弃让AI在Blender里自己点来点去了。@mixie3D 为智能体提供了直接控制能力,以及多智能体工作流和真正的3D技能。不再需要模拟UI操作。 我已经在我的游戏里测试过了。
终于有人通读了 11 个编码智能体的源代码,发现它们每一个的构造方式都完全相同。 Wavestone AI Lab 研究了 Claude Code、Codex、Gemini CLI、OpenHands、Aider、OpenCode、Open…
首先,感谢您的阅读。
我完全从零开始训练了一个小型MoE模型(无外部基础权重),并希望分享结果及几条经验。
Apex-2
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
查找代码不用依赖内置模糊搜索,用自定义的RAG管线就能实现语义层面的代码搜索,降低代码检索的时间成本
这款名为Kolibri的开源模型自称击败了Qwen2 635B、Nemotron 3 Super和Mistral Small 4,德国也加入顶级大模型竞争。
德国刚刚加入前沿大语言模型竞争。
新的主权开源模型 Kolibri。
> 击败 Qwen2 635B
>
> 击败 Nemotron 3 Super
>
> 击败 Mistral Small 4
基于定制化MoE Transformer架构构建。
数十亿美元投入美国隐形大模型初创公司,即将推出的开源模型微调后性能有望超过前沿大模型,不妨保持观望。
多款美国开源模型即将推出。
Axiois 称,美国隐身基础模型初创企业投入的数十亿美元即将获得回报。
据称,他们推出的开放权重模型只需做一些调整,性能就能超越前沿模型。
我对此持怀疑态度,但也抱有希望😅
美国计划推动本土开源大模型在全球市场竞争中国开源模型,多家机构将在本月发布开源模型。
Axios 报道称,Reflection AI 即将发布一款能力极强的开放权重模型,预期将与中国顶级的开放权重模型竞争。
自 7 月以来,Reflection 每月向埃隆·马斯克支付 1.5 亿美元,用于获得 Colossus 的算力,除此之外还与 Nebius 签订了 10 亿美元的算力协议,因此开发出一款强大模型确实是有可能的。
消息人士还向 Axios 透露,其他未具名的美国实验室也计划在本月发布多个开源模型。美国开源人工智能复兴即将开始?
Howard Lutnick 一直期待出现这样的局面,据报道,他一度甚至考虑争取政府直接注资来推动此事。美国政府希望美国开放模型能在全球范围内与中国模型竞争。
注册就能领每月免费额度,自家三款模型限时免费调用,还支持多款第三方模型,兼容主流协议,想用大模型API能省一笔钱。
卧槽,上海人工智能实验室免费发 5亿Token ! 平台叫书生·端砚,注册就送“每月免费基础包”:10 墨点。
官方写明 1 墨点最多抵 5000 万 Token,10 墨点就是最多 5 亿。
书生-S2、Atria-Dawn-Preview、Agents-A1 三个自家模型更直接,限时 0 墨点,调用不扣。
还能调 DeepSeek-V4、GLM-5.3、Kimi-K2.6 等 7 款第三方模型。
兼容 OpenAI 和 Anthropic 协议,Claude Code、Codex 换个 Base URL 就能跑。
入口:
我用API接入workbuddy,实测可用,大家薅起来!
如果长时间运行循环AI Agent,控制缓存超时可以避免不必要的额外订阅计费,这是实际使用中的省钱技巧
在AI订阅服务中,Claude的缓存保留时长是1小时,GPT的缓存保留时长是30分钟。如果会话输出结束后,不在1小时/30分钟内发送后续内容,就会被扣除大量使用量……这条小知识,说实话,如果一直让AI Agent自主循环运行的话,其实不用太担心这个问题。
这种24小时运行的循环型Agent构想,是Cursor一直在主推的,但实际上能让大家方便使用的应该是Dot了(我自己没法用,只是从X时间线推出来的)。
Dot这个Agent可以统括Codex的多个Agent,用户通过Dot交流,而实际工作一直在循环运行……大概是这种结构。
使用技巧是不要和实际工作的部队直接对话,而是一直和情商、日语表现都更好,用起来更舒服的模型对话。
你和这个模型聊天,同时后台有规划器制定计划,如果规划器说信息不足,就由对话专长模型来好好询问用户,我觉得这样运行是最理想的。
而且,现在这种需求只需要让Dot基于Dsh或Pi进行改造就可以实现,这是目前很不错的一点。
就算是有点专业、自己懒得动手实现的内容,直接全扔给AI也能推进到一定程度,这点很不错。
有人批评OpenAI和Anthic一边用人类公开成果训练AI赚钱,一边禁止他人用他们的API输出训练竞争模型,双标做法令人反感。
OpenAI 和 Anthropic 居然还有脸抱怨知识蒸馏,真是离谱。
人类花了几十年时间编写代码、解释科学、回答问题、分享知识。AI 实验室用这些成果训练模型,做成产品卖给我们赚钱。他们早就蒸馏了我们所有人。
现在,有人付费购买他们的 API,并用输出训练了一个竞争模型,结果突然就遭到封禁,还被安上了「蒸馏攻击」的名头。
OpenAI 自己就提供蒸馏工作流,他们会在自己的平台上帮你用大模型的输出训练小模型。但如果你用这些输出做一个竞品,那你就是违反规则。
他们的服务条款甚至说我拥有输出内容。我花了钱,按理说产出归我,结果他们还能规定我能用它建什么模型。
这些人花了那么多年维护机器从他人作品学习的权利,现在轮到从他们自己的作品学习,也该好好维护才对。
这就是为什么我支持中国实验室发布可以下载、本地运行、二次开发的权重。你们都可以滚蛋了。
现在有了可验证的科学框架区分算法和有意识的AI,未来人与AI建立情感连接时,有了判断依据
标榜欧洲自主的主权AI模型,合成训练数据主要来自中国智谱GLM和阿里通义千问Qwen。对宣称技术自主的AI项目来说,这算是打脸了。
💥炸了!中国模型被欧洲模型蒸馏!德国“主权模型”Kolibri技术报告自曝:后训练合成数据主力其实来源于智谱GLM和阿里巴巴Qwen!
Aleph Alpha把Kolibri宣传成德国从零训练、欧洲基础设施、无外国控制。
报告3.1.1节写的却是:
1️⃣生成微调数据、重写开源数据集答案的主力模型,就是GLM-5.2、GLM-5.3(
2️⃣Nemotron指令跟随数据集的completions,直接用GLM-5.2和GLM-5.3重新生成;reasoning-off子集专门出无推理链版本,单条对话最长扩到50轮。
3️⃣Nemotron科学选择题的completions,用Qwen3.8-27B重写。
4️⃣论文自己说:小模型跑长上下文更快,大模型更适合出强推理轨迹;还会有意识挑选或避开这些模型的价值观和偏见。
美国骂中国蒸馏,欧洲新“主权AI”的教师模型写在纸面上的是智谱GLM和阿里Qwen。
报告原文: #Kolibri #AlephAlpha #主权AI #模型蒸馏 #GLM #Qwen #智谱 #通义千问 #唐杰
访谈涉及OpenAI对AI安全的思路,以及未来互联网动作将由智能体主导等行业判断,可以帮你了解AI行业的走向。
我和ChatGPT与Codex负责人thsottiaux的对话。我们讨论了:
🔸 为什么模型选择器可能会消失
🔸 为什么循环和图谱只是一个过渡阶段
🔸 为什么互联网上的大多数操作很快会由智能体完成
🔸 OpenAI的AI安全方法
现在就来收听吧
这款工具只需要3个文件,可在单块NVIDIA GPU上运行,能自动循环完成AI研究,适合需要 overnight 自动化科研的场景使用。
安德烈·卡帕西(Andrej Karpathy)构建了一个能自主开展AI研究的智能体。整个配置只有3个文件,它叫做autoresearch。
你只需给Claude或Codex提供一个小型LLM训练配置,就可以不用管了。循环流程是:尝试一个想法→提交代码→训练正好5分钟→如果得分提升,就保留变更;如果得分变差,就用git重置→记录结果,永远重复这个过程。
指令明确告诉智能体永远不要停止,永远不要问“我应该继续吗?”,因为人类可能正在睡觉。你完全不用碰Python代码,只需要编辑program.md,也就是智能体的指令。卡帕西将其称为你的研究机构的代码。
这里甚至还有一条简洁性规则:带来微小收益但增加了20行hack代码的变更会被丢弃,得分相同但代码更少的变更会被保留。
我认为这个模式的适用范围远不止LLM。任何只要有一个需要超越的分数、一个需要编辑的文件、每次运行固定时间的任务,都可以像这样通宵自动运行。
项目9.2万星,MIT许可证。可以在单块NVIDIA GPU上运行,支持本地或租用的GPU,社区已经衍生出支持Mac、Windows和AMD的分支。
用户Khazix0918在𝕏分享,仅用半小时就通过Claude得到可使用的公司logo动效
用户Khazix0918在𝕏分享了自己用AI生成动效的经历。
他用Claude调整了半个多小时,就得到了差不多可以投入使用的公司logo动画。
他提到,放在一年前,没人能想到动效和视频这类内容,也会被AI用代码直接生成。
技术发展速度太快,很多时候人们都还来不及反应。
AI agents调用真实工具时容易权限溢出,这组开源项目能让agents在隔离环境运行,不会拿到系统全部权限。
很多开源AI Agent框架要么绑死命令行,要么过于臃肿,这个新发布的底座是专门给做产品开发的团队二次开发用的。
研究者花了很长时间,在92种Agent场景下测试不同配置,已经得出了得分最高的方案。
有观点认为AI推理会成为加密和AI结合的最大市场,现在需求增长已经带动产业链开始布局。
想自己本地跑新开源大模型的话,可以看看这份传闻汇总,多个热门模型的预计发布时间都列出来了。
我已经等不及下一波可以在本地运行的开放权重模型了。以下是我整理的目前谣言观察列表:
- Qwen 4:讨论的发布时间是10月到11月初。阿里云确认该模型正在训练中,但没有给出发布日期。
- Kimi K3.1:一个可能的预告和一个被曝的后端模型标识引发了期待。发布时间可能在10月,但这只是猜测。
- Next GLM:根据发布节奏预估发布时间为10月到11月(我对GLM-5.4尤其期待,因为5.3在网络安全能力上非常强)
- DeepSeek V4.2:遗憾的是目前还没有可靠的发布时间窗口。
Qwen 4 27b很可能会成为最强者,但我对K3.1和GLM-5.4也同样非常期待。当然还有DeepSeek 4.2 Flash。
原来需要资深工程师手动完成的逆向分析,现在可以交给AI Agent自动执行,降低了逆向工程的门槛,同时也带来了合规和技术挑战值得关注。
业内现在做编程Agent 都不用现成框架了,统一用7个基础部件搭建,这个业内设计标准值得想要自己做Agent的人参考。
好家伙,有篇论文拆了 Claude Code 等 11 个编程 Agent 的源码,居然没有一个靠 LangChain 这类框架搭的!连 Google 的 Gemini CLI 都没用自家的框架 🤣 找代码时也没有一个用向量检索,靠的是 ripgrep、tree-sitter 这些工具,外加 AGENTS.md 这类说明文件。意外的是,这 11 个 Agent 都是同样 7 个部件拼出来的,区别只在每个部件写得多复杂。
看来这真的是业内标准的 Agent 设计了,值得学习~
不管是普通网络安全从业者,还是想要探索AI+网络安全方向,都可以直接保存这些仓库,不用自己再逐个筛选查找。
10 个将 AI 引入网络安全的 GitHub 仓库
人工智能不只是在改变我们构建软件的方式。它还在改变安全团队发现、测试和修复漏洞的方式。
1. PentestGPT:一款人工智能助手,用于推理渗透测试工作流程和发现结果。
2. Caido:现代化工具套件,用于在安全研究期间拦截和分析网络流量。
3. HexStrike AI:通过基于 MCP 的框架将人工智能代理与网络安全工具连接起来。
4. Strix:由人工智能驱动的安全测试,用于调查应用程序并发现漏洞。
5. Nuclei:快速、基于模板的漏洞扫描器,适用于应用程序和基础设施。
6. Semgrep:具有代码感知能力的安全扫描,帮助在部署前捕捉漏洞。
7. Gitleaks:发现 Git 仓库中暴露的 API 密钥、密码、令牌和其他机密信息。
8. OWASP Amass:发现域名、子域名和基础设施,帮助了解外部攻击面。
9. Wazuh:开源平台,用于安全监控、检测、漏洞管理和日志分析。
10. Prowler:根据安全最佳实践和合规框架评估云环境。
如果你正在探索人工智能驱动的网络安全,收藏这些仓库吧。
你做AI视频不用反复调整提示词,一遍就能生成自然的AI视频,降低AI视频生成的门槛和重复操作。
一位AI圈的大佬 ,他搞了个叫 Seedance 2.5 导演 Skill 的东西。 操作流程特别简单,总共就三步: 1️⃣ 先让它帮你把提示词生成出来 2️⃣ 把参考角色扔进去,直接开跑 3️⃣ 通常一遍就能成,不用来回重试搞得人崩溃 这个工具不只是替你写提示词,还会顺带帮你把内容调优,生成出来的视频看起来挺自然,那种明显的AI感能削掉不少。
@xikhar 在𝕏分享的改进型AI工作流,支持AI持续优化输入和输出
Gauntlet循环在已知最终输出形态时效果出色。但很多时候人们并不清楚最终输出的样子,需要AI代理持续同时优化输入与输出。
因此@xikhar正在测试一种新的循环工作流,让AI代理在循环中完成调研和构建两步工作。
这个思路其实由来已久,Matt Shumer最早提出了生成子代理的概念,让子代理构建输出、自我验证并优化结果。
想要了解更多细节,可以查看@xikhar置顶的视频帖子。本次测试在原有思路上做了延伸,目标是让AI代理遇到阻碍时,能通过反复调研自行优化输入。
用户@YxzRainy在𝕏提醒,ChatGPT当前风控不光查提问内容,还要查AI看到的电脑屏幕内容
<p>ChatGPT近期开始严格执行账号封禁风控。经常使用ChatGPT的Computer Use功能的用户需要特别注意。</p> <p>现在的风控触发规则不止和用户提问内容有关,AI在用户电脑屏幕上看到的内容也可能触发风控。
</p> <p>目前已知的高风险内容包括:未成年色情、犯罪相关内容、越狱提示词、核/生物/黑客等敏感技术,以及账号/地区异常。</p> <p>用户使用Computer Use功能前,需要先关闭电脑中不合规的敏感内容。</p>
用户@EXM7777在𝕏分享体验,称该模型能完成其他AI代理无法处理的任务
对@EXM7777来说,Hermes内置的Opus 5.5比Grok Bot或Dots高出一个等级。原因是默认状态下,它就能处理其他AI代理无法完成的场景。
开箱即用的写作效果比其他AI好得多。
它能够实际完成应用设计工作。
和它对话的体验非常流畅顺滑。
它确实会比Claude Code内置的Opus更快消耗额度限制。不过这个模型现在的效率足够高,因此用户可以接受这一点。
目前已经有1.5万名创始人加入用户分享的这套系统,用户每周会发送一封免费邮件,感兴趣的用户可以前往链接查看。
X平台用户@velfo分享@heliotsz提出的技巧,可在移动设备上完成开发操作
@velfo表示,这个思路看起来很奇怪,但在@heliotsx提到之前,他确实从来没有想到过。
将Codex CLI或Claude Code CLI连接到Grok Bot,能彻底改变开发工作流程。
这样一来,就不会只剩下向光标发送云代理指令的单一工作流,还能获得更完善的测试框架来评估部分功能。
整个操作都可以在手机上完成,@velfo分享时正处于前往投票的路上。
网友@griswold分享的家庭定制Sylvia-bot,完成每周餐食规划和 grocery 采买
来自X用户@angeldot_分享的Anthropic官方claude-code-setup插件
Claude Code 是一团乱麻。直到你安装了这个东西。
这里有一个Anthropic官方插件叫做claude-code-setup。
它会告诉你可以搭建哪些自动化工具(钩子、技能、MCP服务器、智能体……),以及如何一步步配置它们。
基本上它会分析你的项目,并推荐你开启哪些功能。
安装指令:/plugin install claude-code-setup@claude-plugins-official
收藏这篇帖子,别找不到了🔖
开发者公开独立测试结果,后续将放出演示视频供用户体验
标榜欧洲自主的主权AI模型,合成训练数据主要来自中国智谱GLM和阿里通义千问Qwen。对宣称技术自主的AI项目来说,这算是打脸了。
💥炸了!中国模型被欧洲模型蒸馏!德国“主权模型”Kolibri技术报告自曝:后训练合成数据主力其实来源于智谱GLM和阿里巴巴Qwen!
Aleph Alpha把Kolibri宣传成德国从零训练、欧洲基础设施、无外国控制。
报告3.1.1节写的却是:
1️⃣生成微调数据、重写开源数据集答案的主力模型,就是GLM-5.2、GLM-5.3(
2️⃣Nemotron指令跟随数据集的completions,直接用GLM-5.2和GLM-5.3重新生成;reasoning-off子集专门出无推理链版本,单条对话最长扩到50轮。
3️⃣Nemotron科学选择题的completions,用Qwen3.8-27B重写。
4️⃣论文自己说:小模型跑长上下文更快,大模型更适合出强推理轨迹;还会有意识挑选或避开这些模型的价值观和偏见。
美国骂中国蒸馏,欧洲新“主权AI”的教师模型写在纸面上的是智谱GLM和阿里Qwen。
报告原文: #Kolibri #AlephAlpha #主权AI #模型蒸馏 #GLM #Qwen #智谱 #通义千问 #唐杰
现在有了可验证的科学框架区分算法和有意识的AI,未来人与AI建立情感连接时,有了判断依据
业内现在做编程Agent 都不用现成框架了,统一用7个基础部件搭建,这个业内设计标准值得想要自己做Agent的人参考。
好家伙,有篇论文拆了 Claude Code 等 11 个编程 Agent 的源码,居然没有一个靠 LangChain 这类框架搭的!连 Google 的 Gemini CLI 都没用自家的框架 🤣 找代码时也没有一个用向量检索,靠的是 ripgrep、tree-sitter 这些工具,外加 AGENTS.md 这类说明文件。意外的是,这 11 个 Agent 都是同样 7 个部件拼出来的,区别只在每个部件写得多复杂。
看来这真的是业内标准的 Agent 设计了,值得学习~
如果你关注AI编码工具,这次研究梳理了现有编码智能体的通用结构,还公开了可复用的90行核心代码框架,方便开发者参考。
对需要迁移旧网站、找回丢失代码或学习优秀界面的人来说,这个免费开源工具能大幅节省建站时间,效率提升明显。
现在 Claude Code 只需几分钟就能克隆出几乎任何网站的界面
现在有一个开源模板可以分析任意网站,并将其转换为整洁的 Next.js 代码库。你输入网址后,代理就会分析:
→ 界面和组件
→ 颜色和排版
→ 间距
→ 图片、图标这些资源
之后它会让多个代理并行工作,逐个重建每个区块。
它支持 Claude Code、Codex、Cursor、Gemini、Copilot 以及超过 10 种编程代理。
它在 GitHub 上已经获得超过 35k 星标,采用 MIT 许可证,完全免费。
效果就是:过去需要好几天来排版界面的工作,现在只需要几分钟。
对于想要迁移旧网站、找回丢失代码或是学习优秀界面制作方法的人来说,这完全改变了游戏规则。
仓库在评论区 👇
注册就能领每月免费额度,自家三款模型限时免费调用,还支持多款第三方模型,兼容主流协议,想用大模型API能省一笔钱。
卧槽,上海人工智能实验室免费发 5亿Token ! 平台叫书生·端砚,注册就送“每月免费基础包”:10 墨点。
官方写明 1 墨点最多抵 5000 万 Token,10 墨点就是最多 5 亿。
书生-S2、Atria-Dawn-Preview、Agents-A1 三个自家模型更直接,限时 0 墨点,调用不扣。
还能调 DeepSeek-V4、GLM-5.3、Kimi-K2.6 等 7 款第三方模型。
兼容 OpenAI 和 Anthropic 协议,Claude Code、Codex 换个 Base URL 就能跑。
入口:
我用API接入workbuddy,实测可用,大家薅起来!
数十亿美元投入美国隐形大模型初创公司,即将推出的开源模型微调后性能有望超过前沿大模型,不妨保持观望。
多款美国开源模型即将推出。
Axiois 称,美国隐身基础模型初创企业投入的数十亿美元即将获得回报。
据称,他们推出的开放权重模型只需做一些调整,性能就能超越前沿模型。
我对此持怀疑态度,但也抱有希望😅
访谈涉及OpenAI对AI安全的思路,以及未来互联网动作将由智能体主导等行业判断,可以帮你了解AI行业的走向。
我和ChatGPT与Codex负责人thsottiaux的对话。我们讨论了:
🔸 为什么模型选择器可能会消失
🔸 为什么循环和图谱只是一个过渡阶段
🔸 为什么互联网上的大多数操作很快会由智能体完成
🔸 OpenAI的AI安全方法
现在就来收听吧
美国计划推动本土开源大模型在全球市场竞争中国开源模型,多家机构将在本月发布开源模型。
Axios 报道称,Reflection AI 即将发布一款能力极强的开放权重模型,预期将与中国顶级的开放权重模型竞争。
自 7 月以来,Reflection 每月向埃隆·马斯克支付 1.5 亿美元,用于获得 Colossus 的算力,除此之外还与 Nebius 签订了 10 亿美元的算力协议,因此开发出一款强大模型确实是有可能的。
消息人士还向 Axios 透露,其他未具名的美国实验室也计划在本月发布多个开源模型。美国开源人工智能复兴即将开始?
Howard Lutnick 一直期待出现这样的局面,据报道,他一度甚至考虑争取政府直接注资来推动此事。美国政府希望美国开放模型能在全球范围内与中国模型竞争。
AI agents调用真实工具时容易权限溢出,这组开源项目能让agents在隔离环境运行,不会拿到系统全部权限。
这款名为Kolibri的开源模型自称击败了Qwen2 635B、Nemotron 3 Super和Mistral Small 4,德国也加入顶级大模型竞争。
德国刚刚加入前沿大语言模型竞争。
新的主权开源模型 Kolibri。
> 击败 Qwen2 635B
>
> 击败 Nemotron 3 Super
>
> 击败 Mistral Small 4
基于定制化MoE Transformer架构构建。
很多开源AI Agent框架要么绑死命令行,要么过于臃肿,这个新发布的底座是专门给做产品开发的团队二次开发用的。
研究者花了很长时间,在92种Agent场景下测试不同配置,已经得出了得分最高的方案。
有观点认为AI推理会成为加密和AI结合的最大市场,现在需求增长已经带动产业链开始布局。
查找代码不用依赖内置模糊搜索,用自定义的RAG管线就能实现语义层面的代码搜索,降低代码检索的时间成本
有人批评OpenAI和Anthic一边用人类公开成果训练AI赚钱,一边禁止他人用他们的API输出训练竞争模型,双标做法令人反感。
OpenAI 和 Anthropic 居然还有脸抱怨知识蒸馏,真是离谱。
人类花了几十年时间编写代码、解释科学、回答问题、分享知识。AI 实验室用这些成果训练模型,做成产品卖给我们赚钱。他们早就蒸馏了我们所有人。
现在,有人付费购买他们的 API,并用输出训练了一个竞争模型,结果突然就遭到封禁,还被安上了「蒸馏攻击」的名头。
OpenAI 自己就提供蒸馏工作流,他们会在自己的平台上帮你用大模型的输出训练小模型。但如果你用这些输出做一个竞品,那你就是违反规则。
他们的服务条款甚至说我拥有输出内容。我花了钱,按理说产出归我,结果他们还能规定我能用它建什么模型。
这些人花了那么多年维护机器从他人作品学习的权利,现在轮到从他们自己的作品学习,也该好好维护才对。
这就是为什么我支持中国实验室发布可以下载、本地运行、二次开发的权重。你们都可以滚蛋了。
想自己本地跑新开源大模型的话,可以看看这份传闻汇总,多个热门模型的预计发布时间都列出来了。
我已经等不及下一波可以在本地运行的开放权重模型了。以下是我整理的目前谣言观察列表:
- Qwen 4:讨论的发布时间是10月到11月初。阿里云确认该模型正在训练中,但没有给出发布日期。
- Kimi K3.1:一个可能的预告和一个被曝的后端模型标识引发了期待。发布时间可能在10月,但这只是猜测。
- Next GLM:根据发布节奏预估发布时间为10月到11月(我对GLM-5.4尤其期待,因为5.3在网络安全能力上非常强)
- DeepSeek V4.2:遗憾的是目前还没有可靠的发布时间窗口。
Qwen 4 27b很可能会成为最强者,但我对K3.1和GLM-5.4也同样非常期待。当然还有DeepSeek 4.2 Flash。
不管是普通网络安全从业者,还是想要探索AI+网络安全方向,都可以直接保存这些仓库,不用自己再逐个筛选查找。
10 个将 AI 引入网络安全的 GitHub 仓库
人工智能不只是在改变我们构建软件的方式。它还在改变安全团队发现、测试和修复漏洞的方式。
1. PentestGPT:一款人工智能助手,用于推理渗透测试工作流程和发现结果。
2. Caido:现代化工具套件,用于在安全研究期间拦截和分析网络流量。
3. HexStrike AI:通过基于 MCP 的框架将人工智能代理与网络安全工具连接起来。
4. Strix:由人工智能驱动的安全测试,用于调查应用程序并发现漏洞。
5. Nuclei:快速、基于模板的漏洞扫描器,适用于应用程序和基础设施。
6. Semgrep:具有代码感知能力的安全扫描,帮助在部署前捕捉漏洞。
7. Gitleaks:发现 Git 仓库中暴露的 API 密钥、密码、令牌和其他机密信息。
8. OWASP Amass:发现域名、子域名和基础设施,帮助了解外部攻击面。
9. Wazuh:开源平台,用于安全监控、检测、漏洞管理和日志分析。
10. Prowler:根据安全最佳实践和合规框架评估云环境。
如果你正在探索人工智能驱动的网络安全,收藏这些仓库吧。
原来需要资深工程师手动完成的逆向分析,现在可以交给AI Agent自动执行,降低了逆向工程的门槛,同时也带来了合规和技术挑战值得关注。
这款工具只需要3个文件,可在单块NVIDIA GPU上运行,能自动循环完成AI研究,适合需要 overnight 自动化科研的场景使用。
安德烈·卡帕西(Andrej Karpathy)构建了一个能自主开展AI研究的智能体。整个配置只有3个文件,它叫做autoresearch。
你只需给Claude或Codex提供一个小型LLM训练配置,就可以不用管了。循环流程是:尝试一个想法→提交代码→训练正好5分钟→如果得分提升,就保留变更;如果得分变差,就用git重置→记录结果,永远重复这个过程。
指令明确告诉智能体永远不要停止,永远不要问“我应该继续吗?”,因为人类可能正在睡觉。你完全不用碰Python代码,只需要编辑program.md,也就是智能体的指令。卡帕西将其称为你的研究机构的代码。
这里甚至还有一条简洁性规则:带来微小收益但增加了20行hack代码的变更会被丢弃,得分相同但代码更少的变更会被保留。
我认为这个模式的适用范围远不止LLM。任何只要有一个需要超越的分数、一个需要编辑的文件、每次运行固定时间的任务,都可以像这样通宵自动运行。
项目9.2万星,MIT许可证。可以在单块NVIDIA GPU上运行,支持本地或租用的GPU,社区已经衍生出支持Mac、Windows和AMD的分支。
如果长时间运行循环AI Agent,控制缓存超时可以避免不必要的额外订阅计费,这是实际使用中的省钱技巧
在AI订阅服务中,Claude的缓存保留时长是1小时,GPT的缓存保留时长是30分钟。如果会话输出结束后,不在1小时/30分钟内发送后续内容,就会被扣除大量使用量……这条小知识,说实话,如果一直让AI Agent自主循环运行的话,其实不用太担心这个问题。
这种24小时运行的循环型Agent构想,是Cursor一直在主推的,但实际上能让大家方便使用的应该是Dot了(我自己没法用,只是从X时间线推出来的)。
Dot这个Agent可以统括Codex的多个Agent,用户通过Dot交流,而实际工作一直在循环运行……大概是这种结构。
使用技巧是不要和实际工作的部队直接对话,而是一直和情商、日语表现都更好,用起来更舒服的模型对话。
你和这个模型聊天,同时后台有规划器制定计划,如果规划器说信息不足,就由对话专长模型来好好询问用户,我觉得这样运行是最理想的。
而且,现在这种需求只需要让Dot基于Dsh或Pi进行改造就可以实现,这是目前很不错的一点。
就算是有点专业、自己懒得动手实现的内容,直接全扔给AI也能推进到一定程度,这点很不错。
已经在用ChatGPT或Codex订阅的用户,可以免费使用这个工具,能直接在Blender里生成带绑定的 procedural 飞马模型
我已经放弃让AI在Blender里自己点来点去了。@mixie3D 为智能体提供了直接控制能力,以及多智能体工作流和真正的3D技能。不再需要模拟UI操作。
我已经在我的游戏里测试过了。只运行了一次,智能体就自动生成了完整程序化生成的珀伽索斯飞马,包括毛发、翅膀和绑定好的控制骨架。
使用同样的模型,路由更智能,比通过界面操作强行调用 GPT-4o / Opus 快得多。
你可以用自己的 ChatGPT/Codex 订阅免费使用。导入 .blend 文件后就能继续工作。这是第一个真正让模型仿佛置身Blender内部的设置。
#BlenderAI #Mixar #GameDev #3DAI
你做AI视频不用反复调整提示词,一遍就能生成自然的AI视频,降低AI视频生成的门槛和重复操作。
一位AI圈的大佬 ,他搞了个叫 Seedance 2.5 导演 Skill 的东西。 操作流程特别简单,总共就三步: 1️⃣ 先让它帮你把提示词生成出来 2️⃣ 把参考角色扔进去,直接开跑 3️⃣ 通常一遍就能成,不用来回重试搞得人崩溃 这个工具不只是替你写提示词,还会顺带帮你把内容调优,生成出来的视频看起来挺自然,那种明显的AI感能削掉不少。
开发者公开独立测试结果,后续将放出演示视频供用户体验
来自X用户@angeldot_分享的Anthropic官方claude-code-setup插件
Claude Code 是一团乱麻。直到你安装了这个东西。
这里有一个Anthropic官方插件叫做claude-code-setup。
它会告诉你可以搭建哪些自动化工具(钩子、技能、MCP服务器、智能体……),以及如何一步步配置它们。
基本上它会分析你的项目,并推荐你开启哪些功能。
安装指令:/plugin install claude-code-setup@claude-plugins-official
收藏这篇帖子,别找不到了🔖
来自@xiaomovps在𝕏的分享,用Cloudflare全套组件低成本搭建AI应用
很多人开发AI工具担心成本过高,实际上Cloudflare已经配齐了AI应用开发所需的大部分基础设施。
第一,Workers可承担API、业务逻辑和智能体调度,能直接作为AI应用的后端。
第二,Workers AI可以直接运行Llama、Qwen、Gemma等大模型,自带免费额度,开发演示项目和小工具非常方便。
第三,AI Gateway可以统一接入OpenAI、Claude、Gemini等模型接口,同时解决日志、缓存、限流、调用统计问题。
第四,Vectorize是Cloudflare自研的向量数据库,可直接用于搭建知识库、RAG(检索增强生成)和语义搜索。
第五,D1存储用户、任务和结构化数据,KV存储配置、缓存和高频状态数据。
第六,R2存储图片、文档和模型素材,Queues负责处理异步任务,避免耗时操作阻塞请求。
这套组合覆盖了从模型、API、RAG到数据库、文件存储、异步任务全流程,AI应用开发所需的大部分功能基本都能在Cloudflare实现。
很多服务都带有免费额度,前期开发演示项目、个人项目、小型SaaS都够用,等有用户访问之后再按需升级即可。
网友@griswold分享的家庭定制Sylvia-bot,完成每周餐食规划和 grocery 采买
用户Khazix0918在𝕏分享,仅用半小时就通过Claude得到可使用的公司logo动效
用户Khazix0918在𝕏分享了自己用AI生成动效的经历。
他用Claude调整了半个多小时,就得到了差不多可以投入使用的公司logo动画。
他提到,放在一年前,没人能想到动效和视频这类内容,也会被AI用代码直接生成。
技术发展速度太快,很多时候人们都还来不及反应。
X平台用户@velfo分享@heliotsz提出的技巧,可在移动设备上完成开发操作
@velfo表示,这个思路看起来很奇怪,但在@heliotsx提到之前,他确实从来没有想到过。
将Codex CLI或Claude Code CLI连接到Grok Bot,能彻底改变开发工作流程。
这样一来,就不会只剩下向光标发送云代理指令的单一工作流,还能获得更完善的测试框架来评估部分功能。
整个操作都可以在手机上完成,@velfo分享时正处于前往投票的路上。
用户@EXM7777在𝕏分享体验,称该模型能完成其他AI代理无法处理的任务
对@EXM7777来说,Hermes内置的Opus 5.5比Grok Bot或Dots高出一个等级。原因是默认状态下,它就能处理其他AI代理无法完成的场景。
开箱即用的写作效果比其他AI好得多。
它能够实际完成应用设计工作。
和它对话的体验非常流畅顺滑。
它确实会比Claude Code内置的Opus更快消耗额度限制。不过这个模型现在的效率足够高,因此用户可以接受这一点。
目前已经有1.5万名创始人加入用户分享的这套系统,用户每周会发送一封免费邮件,感兴趣的用户可以前往链接查看。
用户@YxzRainy在𝕏提醒,ChatGPT当前风控不光查提问内容,还要查AI看到的电脑屏幕内容
<p>ChatGPT近期开始严格执行账号封禁风控。经常使用ChatGPT的Computer Use功能的用户需要特别注意。</p> <p>现在的风控触发规则不止和用户提问内容有关,AI在用户电脑屏幕上看到的内容也可能触发风控。
</p> <p>目前已知的高风险内容包括:未成年色情、犯罪相关内容、越狱提示词、核/生物/黑客等敏感技术,以及账号/地区异常。</p> <p>用户使用Computer Use功能前,需要先关闭电脑中不合规的敏感内容。</p>
@xikhar 在𝕏分享的改进型AI工作流,支持AI持续优化输入和输出
Gauntlet循环在已知最终输出形态时效果出色。但很多时候人们并不清楚最终输出的样子,需要AI代理持续同时优化输入与输出。
因此@xikhar正在测试一种新的循环工作流,让AI代理在循环中完成调研和构建两步工作。
这个思路其实由来已久,Matt Shumer最早提出了生成子代理的概念,让子代理构建输出、自我验证并优化结果。
想要了解更多细节,可以查看@xikhar置顶的视频帖子。本次测试在原有思路上做了延伸,目标是让AI代理遇到阻碍时,能通过反复调研自行优化输入。
今天的 32 条信号到这里下一轮 12:30 更新
https://ai-pulse-lab.com/feed.xml
每天 08:00 · 12:30 · 18:30 · 23:50 更新
在阅读器里订阅
添加到 Feedly、Inoreader 等阅读器
https://ai-pulse-lab.com/feed.xml
让你的 Agent 自动获取每轮简报
适用于 Claude、ChatGPT、Manus 等
请帮我设置一个定时任务,每天北京时间 08:30、13:00、19:00、00:20 各执行一次: 请求 https://ai-pulse-lab.com/api/brief.json,读取返回 JSON 中的 textPlain 字段,将内容发送给我。 补充:每日北京时间 08:00、12:30、18:30、23:50 更新,建议更新后 30 分钟查询。可先请求 /api/manifest.json 检查 nextUpdateAt 字段。无需认证,直接 GET 请求即可。