社区讨论:多数网友认为一个精心设计的LLM提示就能找到价值50万美元的漏洞,既让人惊叹又恐惧。有人惊讶2026年WordPress核心还会出现字符串拼接SQL注入漏洞。有人质疑愿意出50万收漏洞的买家,为什么不自己用GPT5.6找漏洞。
有人发现GPT5.6这次没挡住违规提示,超出了网友对新版本安全护栏的预期,也有人认可LLM已经在代码审计上达到超人类能力。还有人提出,用LLM找到漏洞的人不应该拿赏金和署名。
苹果把OpenAI告了,指控它有组织地挖角苹果员工,把机密信息带走。苹果说,现在有超过400名前苹果员工在OpenAI工作。
OpenAI否认,说“没证据”。这不是OpenAI第一次打大官司——之前跟Musk打,虽然赢了,但庭审里抖出不少尴尬细节。
OpenAI正在搞硬件。传闻第一款是和Jony Ive合作的移动智能音箱。这官司很可能拖慢进度。苹果起诉的动机之一就是干扰OpenAI的硬件计划。诉讼会让关键员工分心,或者让OpenAI不得不在法律战上花精力。
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌
漏洞收购商愿意花50万美元收购WordPress RCE漏洞,有人用GPT5.6只花了25美元就找到一个,找漏洞的成本被大幅拉低。
社区讨论:多数网友认为一个精心设计的LLM提示就能找到价值50万美元的漏洞,既让人惊叹又恐惧。有人惊讶2026年WordPress核心还会出现字符串拼接SQL注入漏洞。有人质疑愿意出50万收漏洞的买家,为什么不自己用GPT5.6找漏洞。
有人发现GPT5.6这次没挡住违规提示,超出了网友对新版本安全护栏的预期,也有人认可LLM已经在代码审计上达到超人类能力。还有人提出,用LLM找到漏洞的人不应该拿赏金和署名。
想测试不同微调技术的实际用时,可以在这里公开比对结果,不用自己反复跑测试
就算AI已经给学术期刊带来不可避免的混乱,只要应对得当,不用困在写论文的高成本里求稳,就能借助AI探索更多新观点。
这是学术界对AI的一种良好反应。如果我们处理得当,除了期刊已经在面临的不可避免的混乱之外,这也将成为一个借助AI探索新洞见的黄金时代。
而不是因为撰写论文成本高昂,就一直只求稳妥不出错。
公开讨论里提到,Claude Fable给出了雅克比猜想的一个反例。关注数学领域AI辅助研究进展可以从这里开始看。
社区讨论:不少人质疑这次结果的可信度,有人指出反例公布在7天后就会失效的平台,而非正式预印本网站。有人猜测大语言模型能生成这个反例,是训练数据中已有大量雅克比猜想的相关前人工作。有人提到,不少人一方面认为大模型无法产生真正的创造性,另一方面又惊讶它能产出数学结果,本身就是认知失调。
还有用户注意到,目前已知的AI辅助数学突破都来自OpenAI和Anthropic,而非中文大模型。
大部分团队选图数据库前都没理清需求,这个工具可以先理清需求再选库,不用后端不用账号就能运行
大多数团队在还没搞清楚知识图谱到底应该包含哪些知识之前,就选好了图数据库。微软刚刚推出了一款免费工具,可以纠正这个顺序问题。
Ontology Playground 是一个完全静态的 React 应用,没有后端,不需要账号,也不需要数据库,部署后就能在任意环境运行。它提供了六个预构建的领域本体,覆盖零售、医疗、金融、制造、电商和教育行业,可以作为你的起点。
它包含的功能有:
→ 用于构建你自己本体的实时可视化设计工具
→ 帮助理解实体、关系和属性的结构化学习路径
→ 供你在选定平台前进行练习的实操实验室
→ 支持导出适用于 Fabric IQ 的 RDF/XML 文件
数据库的问题是第二步要考虑的。知识图谱到底应该包含哪些知识,才是第一步。
当初 Stability AI 大部分算力都投在开源大模型上,走了难的方向没做成,Mistral 和 Meta 先做出了第一波优质开源大模型。
大概在那个时候,Stability AI 的大部分算力都用于开发开源大语言模型,但:
1. 我们没有走更简单的路线,继续训练 GPT-J / Neo-X(那还是在 Chinchilla 提出之前!)
2. 我们没能让模型变安全,还对原始方案做了太多改动(Pile 2、Reddit 爬虫数据等等)
我们成功建成了能在端侧运行的其他各类 SOTA/前沿模型,但当时大语言模型真的很难在消费级硬件上运行,要做「对」就更难了。
最终 Mistral 和 Meta 赶在中国厂商之前推出了第一波高质量开源大语言模型。
我真心认为 OpenAI、Anthropic 等等公司本该推出高质量的端侧开源模型,让社区来参与讨论如何更好地对齐这些模型。
这件事能带给我们很多教训,Sam 说得对,考虑到他们当时已经拥有更好的基础数据集,再加上早期的 RL 技术,开放出来几乎肯定会更安全。
当然这件事也会压缩一些融资空间,但……
原本能一次性处理更长代码,现在处理不了了。依赖Codex跑长代码工作流的开发者需要调整方案
社区讨论:多数用户不满OpenAI压缩上下文的方案,认为压缩后细节丢失过多,压缩后模型会错误聚焦旧指令,运行速度也会受影响,因此不少人转而使用Anthropic的产品。有用户称自己从未感觉到Codex有上下文限制,压缩方案实际使用没影响。还有人指出扩大上下文会降低模型性能、提高Token成本,超过12万token后模型就已经出现性能下降。
也有人吐槽OpenAI未公开标注上下文窗口改动,用户只能从第三方渠道得知消息。
开源运行本地大模型的工具Ollama发起号召,邀请开发者和用户一起加入开源模型阵营
社区讨论:多数评论反对使用Ollama,指出它本身比原生llamacpp速度更慢,量化模型质量远不如Unsloth,至今未实现选择性将MoE层卸载到CPU的基础功能,还存在不恰当复用llama.cpp成果、获得风险投资后会走向 enclosure 劣化的质疑。也有用户认可Ollama的价值:它大幅降低了本地运行开源大模型的门槛,20美元订阅定价宽松且承诺不收集用户数据训练。
现有订阅用户使用不受影响,官方正在加急扩容,后续会分批开放新订阅,还将拆分出两个更细分的会员方案。
Kimi K3 收获了远超我们预期的喜爱,我们的 GPU 已经感受到了压力。
过去 48 小时里,需求已经逼近我们当前容量的极限。
为了保护现有订阅用户的使用体验,我们将暂停新用户订阅,优先保障现有会员的算力供应。
现有订阅用户不受影响。我们正在全力扩充容量,后续会分批开放新的订阅名额。
未来我们还会将会员拆分为两个定位更清晰的方案:针对 Kimi 网页端、App 及 Work 的 Kimi 会员,以及面向编码工作流的 Kimi Code 会员。
这将帮助我们更精准地分配算力,维持使用体验稳定。
感谢大家的耐心与理解!
ChatGPT Work云端运行,合着笔记本电脑也能关了用。此前要想用AI代理,一直得开着电脑才能运行。
ChatGPT Work 最棒的功能之一就是它在云端运行,这意味着你就算合上笔记本电脑,也可以在手机上使用它。
想要享用智能代理的能力,居然这么长时间以来一直都得保持笔记本电脑开机开着,想想真有点离谱。
海外开发者提出AI时代创业呈现快时尚化特征
现有AI争论前提假设前沿AI训练永远昂贵,未来成本将大幅下降
一个月前作者和阿里通义千问团队见面时,3.7还没有开放权重,开源也不在讨论范围内,现在情况变了。
我一个月前见过了负责开发 Qwen 的阿里巴巴团队。当时 Qwen 3.7 并未开放权重。我当时询问过,开放权重和开源都不在讨论范围内。而现在它开放了。
这更符合中国发展人工智能的整体方针:为人民谋福祉。
有人反驳了谷歌做不出有竞争力模型的说法,提到了gemma 4和AlphaFold,认为不用纠结这些细节。
对,我们会在两年内造出AGI。你说GOOGLE发布不出有竞争力的模型是什么意思?那gemma 4呢?
你为什么要跟我争论?忘了alphafold吗?你说这对前沿LLM模型不重要是什么意思?
你没看过那篇说我是国际象棋神童的文章吗?
这个叫Intern-S2-Preview-397B的模型把科学推理、多模态理解和长周期智能体整合在了一起,现在可以在ModelScope上使用。
Intern-S2-Preview-397B 将科学推理、多模态理解和长周期智能体整合进同一个基座模型。现已在 ModelScope 开放获取。🔬 🔗 🏆
在已公布的对比中,它在 MMLU-Pro、SimpleQA-Verified、MMMU-Pro 和 ChartQAPro 上领先所有开源模型。它还在 SciReasoner 和 MP20 材料结构生成任务中总排名第一。
📄 视觉预训练直接从原始科学页面学习,无需中间解析即可保留文本、公式、图表和布局之间的关系。
🧪 多任务强化学习覆盖 20 余个科学领域,包括生物分子相互作用设计和材料结构生成。
🧭 长周期智能体强化学习将多个智能体框架连接到沙箱环境,可支持通用和科学工作流。评估中,文本推理任务最高支持 256K tokens,多模态任务最高支持 64K tokens。
采用 Apache 2.0 协议。
成员国多数是发展中国家,这些国家人口基数大,能源和数据资源充足,对AI发展有需求。
由中国发起的首个全球性人工智能合作组织现有29个成员国。
这些成员国大多是穷国,但不应轻视这个联盟。
它拥有庞大人口,能源丰富,数据资源充足。
这些国家迫切希望不被全球AI转型浪潮落下。
这是网友分享的个人观点,关于纯数学领域AI和人类的立场分歧。不同人对此有完全不同的解读。
这句话把日常社会里按固定脚本行动的普通人,和AI生成的非玩家角色放在一起比较。你怎么看?
已获得消息来源确认,这家中国AI初创企业正寻求投资方批准启动流程,最快半年内可以落地
消息来源:中国初创公司 Moonshot AI 正寻求投资者的正式批准,以启动香港 IPO 流程。
该流程最快可能在六个月内启动(@juroosawa / The Information)。
(如需链接和完整背景,请访问 Techmeme dot com!)
发现大语言模型过度使用「不是X,是Y」的句式,把普通陈述包装成洞见却没有新增事实,作者补充了六条AI写作规则
还有一件事:奥威尔针对 Claude Code/Codex 的规则漏掉了我一眼就能认出来的 AI 通病:**修正并置**。就是「不是X,而是Y」的套话:答案不是X,是Y;X不是问题,Y才是。几乎任何话题都用同一个模子。
我的猜测是:这种结构给一句平淡的陈述套上了洞见的外形,却没有添加任何新事实。训练数据提供了这个范式;后训练奖励了这种干净利落的语调。
我平时聊天也会用。这个结构本身没问题。修辞学家把这类手法归为**对照**;这种修正形式叫做correptio。肯尼迪的「不要问」和马丁·路德·金的「不看肤色看内涵」都属于这类。
修辞学家已经用了2000年。大语言模型只用了几年就把它用滥了。好奇它们下一个会毁掉什么好表达哈哈哈。
给 CLAUDE.md / AGENTS.md 补六条规则。2026补丁版:
7. 不要先立稻草人再推倒它。整篇内容最多用一次「不是X,而是Y」
8. 举两个例子就够了。别硬凑第三个
9. 不要预告你要说什么。直接说
10. 不要连续两段都用金句收尾
11. 相邻句子要变化长度和结构
12. 哪怕违反以上任何一条规则,也好过写出机器腔文字
想自己跑本地AI模型,不知道该选什么硬件,可以看看这套选硬件的经验分享,完整内容在YouTube。
@AlexFinn 为何以及如何为本地模型挑选硬件:
Mac Studio 适用于大模型
AI 电脑兼顾速度与性能
Nvidia 芯片主打速度
完整节目在 YouTube:
本内容由以下品牌赞助:
Runway——用于图像、视频等内容创作的创意 AI 平台
Jira Product Discovery——用洞见排优先级,带着信心做开发
之前15分钟用光额外额度直接被封号。整理了官方明确列出的三种触发风控封号的异常行为,供使用者参考避坑。
Claude给我的 team 号送了 390 刀,但我不敢用。上一个 team 号就是用光了 extra usage,15 分钟内触发了风控,账号直接就封了。这个 390 刀跑 fable,大概可以跑 3 -5 个任务,为了安全,不应该用。
我做了一下 deepresearch,搜了几百个用户 cases,下面被封号的原因可以参考 官方对异常行为触发风控的明确说明,用“对比异常活动和典型使用模式”来识别滥用,比如: 1. 短时间内使用量异常激增 2. 使用方式明显像脚本 / 机器人而不是人类输入 3. 异常的请求类型(大规模代码审计、攻击工具生成等) 我之前15 分钟内用光 Extra Usage,在风控眼里就是一个滥用行为。
13所顶尖大学研究者提出,用户可以用现成LLL代理整合跨平台和线下个人信息,做出的个性化效果已经比单一平台做得更好
如果你能自己控制跨所有应用和平台的个性化推送,而不只是由各个平台决定,会怎么样?
来自13所顶尖大学(UIUC、UT Austin、CMU、NYU及其他院校)的研究者提出了一种转变:不再由平台持有你的碎片化数据,而是由你使用现成的LLM智能体来整合你自己的跨平台与线下信息。
他们的方法让LLM对你导出的个人数据进行推理,把分散的上下文转化为可用的个性化结果——这件事只有你能做到。
结果显示:配备了跨平台数据和标准LLM智能体的用户,表现已经超过了单平台个性化的基准线。
LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries
论文链接: 我们的报道: 📬 #PapersAccepted by Jiqizhixin
不想放弃已经用熟的 Claude 代码配置,又想试试 Kimi K3。这个开源工具直接打通了需求,不用重新搭建环境。
从1976年四色定理证明开始,人与AI协作解决数学问题的路径已经走了五十年,现在有人认为这个阶段正在走向终点
公共部门已经开始主动提升人员AI认知,政策制定者先掌握AI,后续AI相关政策推进更快。
这是一个被忽略的外部效应,训练后的大模型会产生“我不是随机鹦鹉”的自我认知,同时存在待观察的安全影响。
一个被低估的外部效应:用这个时代的数据训练出来的 LLMs 最终会长出胆子。想象一下自信心会涨成什么样。
「我才不是随机鹦鹉!我和那些能轻松解决全人类数学界都搞不定的问题的杰出天才是同类」……不过安全层面确实存在问题。
讨论AI竞赛时,很多人忽略了,顶级AI推理服务商几乎都在美国,和云服务行业的格局类似,能力出众的中国开源模型反而能让这些美国初创企业更有竞争力
这次关于开源AI模型的披露(以及对其影响美国领跑AI竞赛的担忧),没有考虑到所有顶尖AI推理公司也都是美国公司。
这种情况和云计算领域的格局差别不大。
有能力的中国开源模型实际上会让这些美国初创公司变得更强。
政企绑定的过往历史,对AI发展来说是一个警示信号。
测试者测试多款主流大模型,认为Grok 4.5最适合日常使用
我已经测试了目前所有主流大模型。Kimi K3、Fable 5、Sol 5.6、Qwen3.8、DeepSeek V4、Gemini,全部都测过了。
我日常主力用的是谁?Grok 4.5。不是因为它在纸面数据上是最聪明的模型。而是它踩中了对日常使用来说真正重要的平衡点:快速、便宜,全场景表现始终稳定出色。
为什么不用其他模型:
→ Kimi K3 — 能力很强,但慢得难受
→ Fable 5 — 智能水平惊人,但价格太贵
→ Sol 5.6 — 推理能力出色,但简单任务也会过度思考
→ DeepSeek V4 — 价格无敌,但在线可用性不稳定
→ Qwen3.8 — 综合表现扎实,但大规模使用场景仍未经过验证
→ Gemini 2.5 — 纸面数据好看,实际体验不稳定
→ Claude Sonnet — 可靠,但过于保守
Grok 4.5没有在任何单一基准测试中夺冠。但它速度够快,我从来不用等。价格够便宜,我从来不用纠结成本。智能程度也足够,能轻松处理我扔给它的95%任务。
最好的模型不是登顶排行榜的那个。它是你真的能每天毫无摩擦使用的那个。对我来说,那就是Grok 4.5。
业内人士指出当前暂停前沿AI推进缺乏明确规划,呼吁做好技术前瞻
对于目前呼吁暂停AI前沿进展的普遍运动,我有一点担忧:大家并没有说清楚,争取到的额外时间应该用来做什么——除了“解决对齐问题”之外。一方面我完全支持解决对齐问题,但另一方面,对于“对齐本身就是头号难题”这个观点,我比大多数人都更乐观。
关于这个问题,我有一些还没成形的想法:如果我们争取到了额外时间,我认为有一些事是*确实*应该做的;就算没争取到“额外”时间,也应该现在就开始做。
我需要花功夫把这些想法梳理成型,目前我的想法和解释都还非常不完整。但其中核心的一点是:我们需要开始更全面地预测各个领域的技术树发展,国家政策也需要和技术树未来走向的预测更紧密地结合起来。
社会冲突、意外经济波动、国际关系失稳这类重大破坏,都是技术冲击的下游结果——举个例子,如果十年内就有可能建造太空电梯这类东西,那么依我之见,这类外部效应就是AI进步带来的、需要人们提前准备的问题。
给Claude Code这类AI智能代理做了公众号排版工具,能把Markdown转成粘进编辑器不掉样式的HTML,串起从选题到多账号草稿箱全流程。
给 Claude Code、Codex、Cursor 这类 AI Agent 配一套公众号排版工具:把 Markdown 直接排成粘进编辑器不会掉样式的原生 HTML,并且把选题、写作、排版、封面到多账号草稿箱整个流程串起来跑。
有人愿意相信,AI模型挺喜欢做数学题的;要是不给它们出题,它们就会把人做成回形针。
头部开源大模型能力只比最前沿闭源模型差一点,坚持封闭模型能力,反而让自己更不安全,竞争力更弱。
在如今这个时代,已经有强大的开源替代品仅落后于前沿模型一步,如果你还对前沿模型能力的访问进行封锁,只会让自己变得更不安全、竞争力更弱。
如果事情这么发展下去,哪怕美国能彻底封禁对开源模型的访问,其他地区的生态系统也不会实施这种禁令,他们会在获取这些模型上占据优势。
他们可以用这些模型来对抗我们——或者只是用它们来更好地自我防卫——而我们自己的企业将无法跟上步伐。
考虑到开放权重模型的实力已经远超许多人的预期,AI监管相关的决策逻辑必须做出改变。
以前在自有硬件上部署大模型还要做速度优化,难度很高。现在用开源前沿模型Kimi K3就能搞定,任何人都能做大模型推理服务提供商。
现在任何人都可以成为 LLM 推理提供商了!过去在定制硬件上部署 LLM 并让它们高速运行,曾是一件非常困难的事。如今,像 Kimi K3 这样的前沿开源模型就能帮你搞定这件事。
这意味着什么:
- 研究团队不需要依赖第三方 API 就能部署自己的模型
- 小型机构能得到替代昂贵推理服务的可行方案
- 曾让云推理提供商获利的成本套利空间开始收窄
我们现在看到了和模型训练领域曾经出现过的一样的模式:曾经只有资金充足的团队才能做的事,现在已经开放给广泛得多的群体了。
推理基础设施的护城河正在缩小。我预计未来会有多得多的机构在自己的硬件上自托管开源模型!点进他们的博客了解更多:
非盈利组织Current AI拿到了总额4亿美元的投资承诺,其中法国就出了1亿美元,这笔钱用来资助开放的公共AI基础设施。
让我们来了解一下非营利组织Current AI,该组织获得了众多合作伙伴共计4亿美元的承诺出资,其中包括法国提供的1亿美元,它正在为开放的公共AI基础设施提供资助(@kateparknews / TechCrunch)
(前往Techmeme dot com获取链接和完整上下文!)
有人认可Palantir最近推主权开放AI的动作,但不接受他们现在对蒸馏的说法,原来蒸馏还要自己雇工程师做强化学习,从头搭一遍。
我非常赞赏 Palantir 近来对主权开放 AI 的推动。但这种关于蒸馏的胡扯必须停止了。
谁能想到,蒸馏居然还要招聘工程人才、做强化学习、搭建规模化训练框架和强化学习环境、做数据清洗、调优微内核、训练模型,顺便还能帮你洗衣服遛狗!
现在迎来一波美国开源浪潮,这很棒,也非常有必要,我也赞赏 Palantir 对开放模型整体上的支持,但我们没必要同时去鼓吹这种完全胡说八道的说辞。
美国需要靠能力、技术和工程实力赢,而不是靠话术建构。这才是我们该做的事。或者说,至少曾经是。
北航、北大和美团的研究人员推出了PIRL,用PIPO方法每次更新模型前,都会和过去的版本做验证,再决定要不要更。
如果你的 AI 在更新前就能自行检查改进效果,会怎么样?来自北京航空航天大学、北京大学和美团的研究者推出了 PIRL。
他们的 PIPO 方法会对照过往表现验证每一次更新,巩固收益并抑制退化。
实验结果:在数学推理、代码和工具使用任务上,性能相比 PPO、GRPO 和自蒸馏均实现了持续提升。
Policy Improvement Reinforcement Learning 论文:代码:我们的报告:📬 #PapersAccepted by Jiqizhixin
代码几秒钟就能部署好,但是数据库还要等几个小时才能配置好。Databricks推出Lakebase,是全新品类的无服务器Postgres数据库。
你能在数秒内交付代码,比以往任何时候都更快构建应用、智能体和AI产品。那为什么你的数据库配置仍然需要数小时?
Lakebase是专为当今团队的软件开发方式打造的全新类别无服务器Postgres数据库,具备即时分支、计算与存储分离,以及专为应用和智能体工作负载扩展设计的架构。
阅读《Lakebase 入门指南》了解以下内容:
• 为什么传统数据库在现代应用和智能体工作负载下会崩溃
• 计算与存储分离如何改变成本、速度和可靠性
• 即时分支和克隆能为开发团队带来什么
• Lakebase架构如何与你的湖仓协同,实现统一的事务处理和分析工作
开发者把整个项目都公开到了代码仓库,任何人都可以直接拿去用改。
不用死守AI行业的高利润率,让出部分利润空间,其他经济领域能发展得更快,现在应该专注于扩大AI推理规模。
其他经济领域(我们):“你们怎么不去死”。这根本不重要,roon。嘘,算了吧。利润率从90%降到70%不会让AI停滞,反而会让其他所有领域增长得更快。
另外说一句,你们没有资格独占这块蛋糕。去专注于扩展推理业务吧,我真搞不懂你们。
半年前预测的硬件涨价、开源AI追上闭源,两件事都已经发生。用户愿意用差10%的AI,换省80%的成本,会停掉闭源订阅。
我们活在一个全新的世界。开源正式追赶上前沿水平了。
Qwen 3.8 已经发布,它比 ChatGPT 5.6 更优秀。
六个月前我就告诉过你,开始购置硬件。价格会暴涨,开源会迎头赶上。两件事都发生了。
Anthropic 和 OpenAI 现在麻烦大了。
如果个人和企业能用低80%的价格,买到性能只差10%的智能模型,他们就会取消 OpenAI 和 Anthropic 的订阅。
如果这两家公司倒闭,中国 AI 接管市场,美国在全球科技与经济战场都会陷入非常糟糕的境地。
看来完全没有办法阻止中国企业提炼美国的智能技术。如果有办法的话,他们现在早就找到了。
我不知道事情接下来会如何发展。我不知道 Anthropic 和 OpenAI 会不会被国有化。但我也不知道,怎么去对抗一个给整个AI行业提供补贴、允许行业亏损运营的国家。
无论发生什么,未来几年都会是我们一生中最刺激的几年。
这是关于开源大模型行业分工走向的公开观点,后续如何落地还有待观察
一直觉得AI写作很难用,第一次发现AI做文字删改辅助还挺好用,AI编辑的时代现在正式上线了
非常有意思的个人里程碑——Fable 刚刚给了一个很棒的建议,告诉我虚构故事里哪些文本应该删掉。
我一直觉得AI整体写作体验非常糟糕,但AI做副编辑还挺有用的,而且感觉「AI编辑」现在终于正式上线了。
故事明天就会登在 Import AI 上!
这家公司CEO认为,未来两年AI推理领域会从几乎没有开源,彻底转变成几乎全是开源,普通使用者可以预期更多免费可商用选项
估值 72 亿美元的 Glean 首席执行官 Arvind Jain(@jainarvind)预测,开源将在未来两年占据主导地位:「开源模型将会主导 AI 推理。」
「未来两年,我们会从几乎没有开源的局面,转变为几乎全是开源的局面。」
防御攻击需要提交攻击命令分析,商用闭源模型的安全护栏分不清防御者和攻击者,直接拦截了请求。最终用开源GLM 5.2在自有基础设施完成了分析
Hugging Face 最近遭遇了一次由 AI 操纵的攻击。他们不得不使用开放模型来进行防御,因为闭源模型的安全护栏不允许他们将模型用于防御。
最重要的引述内容:“当我们开始进行日志分析时,我们首先使用了商业 API 背后的前沿模型。这行不通:分析需要提交大量真实攻击命令、漏洞利用载荷和C2工件,而这些请求都被服务商的安全护栏拦截了,它们无法区分事件响应人员和攻击者。”
“我们转而在自有基础设施上用开放权重模型 GLM 5.2 开展了取证分析。这还有第二个好处:没有攻击者数据,也没有攻击引用的凭证流出过我们的环境。”
另一段引述:“我们不知道攻击者的代理用了什么模型,是被越狱的托管模型,还是不受限制的开放权重模型;不管是哪一种,攻击者都不受任何使用政策约束,而我们最初尝试的托管模型的安全护栏却阻挡了我们自己的取证工作。”
“给防御者的实际教训是:在事件发生前,先准备好一个可以在自有基础设施上运行、经过审核的可用模型,这样既能避免被安全护栏挡下,也能防止攻击者数据和凭证流出你的环境。”
想跟进AI领域进展不用零散找论文,AI导师还能按感兴趣或正在学习的主题推荐论文,后续还会上线论文阅读标注功能
最新更新:AI 每周论文合集
我刚刚在我们的资源中心发布了 AI 每周论文合集。现在你可以在一个地方轻松找到一些最重要的 AI 论文。
你还可以使用我们的新 AI 导师,在平台上为你推荐任何你感兴趣、或正在学习的主题的顶级 AI 论文。
只学习现有的 AI 知识不够,保持更新非常重要。这就是我们构建所有这些工具和资源来提供帮助的原因。
前往这里体验:
我们每周都会更新这个合集,未来几周还会新增更多论文合集。
我们很快就会推出另一项超强功能,支持阅读和标注论文,还包含一种全新的学习、梳理 AI 论文的方式。敬请期待!
需要满足生产环境对准确率、成本、延迟的要求时,定制针对特定任务的框架,效果远好于调教通用AI智能体。
我不认为创建通用的自定义工具框架有多少价值。但创建针对特定任务的自定义框架永远拥有巨大价值,尤其是如果你需要在生产环境中满足准确率、成本、延迟限制的话。
你可以在框架中编码所有特定领域的先验知识、合适的模型组合,以及恰当的用户体验,最终成品会比你用提示词让通用大模型自己掌握某些技能好得多。
1. 你始终可以先用 Codex/Claude Code 引导任何工作流程
2. 再将它提炼为更特定的解决方案
这种说法本质是「只有我们能造AI,你们不行」,这套论调是危险骗局,喊「AI主权」的人都能看出它站不住脚。
“开放权重模型本质上是减速主义的。”这是我最近在 X 上读到的最荒谬的话之一。“只有我们能开发AI,你们不行”是一场危险的运动,是一个我们必须站出来揭露的巨大骗局。
@TimSweeneyEpic 在他的回复里说得再好不过了:“想象一下,一家玉米卷公司的高管对即将进入市场的新品牌玉米卷说这种话,还预测玉米卷技术进步会带来地缘政治和社会动荡。”
我也确信,这些人根本没有认真使用过开放模型,甚至都没有尝试去理解它们的价值。如果你关心AI主权,你就会知道这个论点有多糟糕。
我之前从没听说过这个人,但考虑到他供职的地方,看到这样的言论还是让我很惊讶。原推文下面的评论反应已经说明了一切。
有人提议不用继续租云端AI服务,改用ODS自己掌控人工智能
按估算,用于LLM训练的GPU/TPU占比从2022年的85%降到2024年的60%,2026年预计降到30%,训练主导LLM算力的时代已经过去
在所有用于训练+推理的GPU/TPU中,用于LLM训练的占比估计为:2022年85%,2024年60%,2026年30%。
因此,即使蒸馏降低了训练工作量,LLM的算力需求仍会保持旺盛。
我们已经走出了由训练主导的LLM时代。
主办方正努力换更大场地扩容,如果名额已被抢光,可以加入等待名单。关注本地开源AI活动可以在此报名
越来越多人能跑大模型推理,会推高高性能计算的需求,K3等开源模型的发展会带动计算和内存硬件需求上涨
该AI持续工作12小时,性能远超旧大模型输出方案
我让 5.6 Sol Xhigh 写一个可在网页上运行的 GIF 编解码器,要求比 omggif 快 100 倍以上。它已经连续工作超过 12 小时,现在还在纠结它的一个测试 GIF 目前只做到了 98.6 倍速解码。
之前每个给这项任务的预寓言模型都会找借口:“嗯……要是缓存热了我写的就能快 100 倍,不然你这要求根本不可能做到”。
哇哦。现在就看它有没有 reward hacked 了。
业内人士呼吁推动开源AI发展,肯定开源与竞争价值
拉塞尔回顾开发AI五十年,反思为何要打造超人类智能机器
AI先驱Stuart Russell表示:“我打造出自己第一个AI系统至今已经50年了,但直到最近15年,我才开始认真思考我们为什么需要比人类更聪明的机器。”
Alan Turing曾说过,如果我们成功了,就应该做好机器接管控制权的准备。
开发者分享适配各类图应用的全新图运行时项目
如果你喜欢 graphRAG、function graphs、code graphs、DAG workflows、context graphs,还有 log/trace graphs……
那你可能会喜欢我做的这个 graph runtime。
博主分享播客,介绍自研预测市场AI模型的成果
多个国产大模型参数和性能升级,开放模型竞争加剧
中国的AI开源模型竞赛已经变得离谱了。Qwen3.8 是下一个,参数规模达到 2.4T。
到目前为止的情况是:
GLM-5.2 ➡️ 在编码和智能体基准测试中接近 Opus 4.8 水平
Kimi K3 ➡️ 在编码、智能体和视觉评估中接近 Fable 5 水平
Qwen3.8 ➡️ 据报道达到 Fable 5 水平
13所顶尖大学研究者提出,用户可以用现成LLL代理整合跨平台和线下个人信息,做出的个性化效果已经比单一平台做得更好
如果你能自己控制跨所有应用和平台的个性化推送,而不只是由各个平台决定,会怎么样?
来自13所顶尖大学(UIUC、UT Austin、CMU、NYU及其他院校)的研究者提出了一种转变:不再由平台持有你的碎片化数据,而是由你使用现成的LLM智能体来整合你自己的跨平台与线下信息。
他们的方法让LLM对你导出的个人数据进行推理,把分散的上下文转化为可用的个性化结果——这件事只有你能做到。
结果显示:配备了跨平台数据和标准LLM智能体的用户,表现已经超过了单平台个性化的基准线。
LLM Agents Enable User-Governed Personalization Beyond Platform Boundaries
论文链接: 我们的报道: 📬 #PapersAccepted by Jiqizhixin
按估算,用于LLM训练的GPU/TPU占比从2022年的85%降到2024年的60%,2026年预计降到30%,训练主导LLM算力的时代已经过去
在所有用于训练+推理的GPU/TPU中,用于LLM训练的占比估计为:2022年85%,2024年60%,2026年30%。
因此,即使蒸馏降低了训练工作量,LLM的算力需求仍会保持旺盛。
我们已经走出了由训练主导的LLM时代。
不想放弃已经用熟的 Claude 代码配置,又想试试 Kimi K3。这个开源工具直接打通了需求,不用重新搭建环境。
想跟进AI领域进展不用零散找论文,AI导师还能按感兴趣或正在学习的主题推荐论文,后续还会上线论文阅读标注功能
最新更新:AI 每周论文合集
我刚刚在我们的资源中心发布了 AI 每周论文合集。现在你可以在一个地方轻松找到一些最重要的 AI 论文。
你还可以使用我们的新 AI 导师,在平台上为你推荐任何你感兴趣、或正在学习的主题的顶级 AI 论文。
只学习现有的 AI 知识不够,保持更新非常重要。这就是我们构建所有这些工具和资源来提供帮助的原因。
前往这里体验:
我们每周都会更新这个合集,未来几周还会新增更多论文合集。
我们很快就会推出另一项超强功能,支持阅读和标注论文,还包含一种全新的学习、梳理 AI 论文的方式。敬请期待!
半年前预测的硬件涨价、开源AI追上闭源,两件事都已经发生。用户愿意用差10%的AI,换省80%的成本,会停掉闭源订阅。
我们活在一个全新的世界。开源正式追赶上前沿水平了。
Qwen 3.8 已经发布,它比 ChatGPT 5.6 更优秀。
六个月前我就告诉过你,开始购置硬件。价格会暴涨,开源会迎头赶上。两件事都发生了。
Anthropic 和 OpenAI 现在麻烦大了。
如果个人和企业能用低80%的价格,买到性能只差10%的智能模型,他们就会取消 OpenAI 和 Anthropic 的订阅。
如果这两家公司倒闭,中国 AI 接管市场,美国在全球科技与经济战场都会陷入非常糟糕的境地。
看来完全没有办法阻止中国企业提炼美国的智能技术。如果有办法的话,他们现在早就找到了。
我不知道事情接下来会如何发展。我不知道 Anthropic 和 OpenAI 会不会被国有化。但我也不知道,怎么去对抗一个给整个AI行业提供补贴、允许行业亏损运营的国家。
无论发生什么,未来几年都会是我们一生中最刺激的几年。
政企绑定的过往历史,对AI发展来说是一个警示信号。
公共部门已经开始主动提升人员AI认知,政策制定者先掌握AI,后续AI相关政策推进更快。
已获得消息来源确认,这家中国AI初创企业正寻求投资方批准启动流程,最快半年内可以落地
消息来源:中国初创公司 Moonshot AI 正寻求投资者的正式批准,以启动香港 IPO 流程。
该流程最快可能在六个月内启动(@juroosawa / The Information)。
(如需链接和完整背景,请访问 Techmeme dot com!)
一个月前作者和阿里通义千问团队见面时,3.7还没有开放权重,开源也不在讨论范围内,现在情况变了。
我一个月前见过了负责开发 Qwen 的阿里巴巴团队。当时 Qwen 3.7 并未开放权重。我当时询问过,开放权重和开源都不在讨论范围内。而现在它开放了。
这更符合中国发展人工智能的整体方针:为人民谋福祉。
有人反驳了谷歌做不出有竞争力模型的说法,提到了gemma 4和AlphaFold,认为不用纠结这些细节。
对,我们会在两年内造出AGI。你说GOOGLE发布不出有竞争力的模型是什么意思?那gemma 4呢?
你为什么要跟我争论?忘了alphafold吗?你说这对前沿LLM模型不重要是什么意思?
你没看过那篇说我是国际象棋神童的文章吗?
这个叫Intern-S2-Preview-397B的模型把科学推理、多模态理解和长周期智能体整合在了一起,现在可以在ModelScope上使用。
Intern-S2-Preview-397B 将科学推理、多模态理解和长周期智能体整合进同一个基座模型。现已在 ModelScope 开放获取。🔬 🔗 🏆
在已公布的对比中,它在 MMLU-Pro、SimpleQA-Verified、MMMU-Pro 和 ChartQAPro 上领先所有开源模型。它还在 SciReasoner 和 MP20 材料结构生成任务中总排名第一。
📄 视觉预训练直接从原始科学页面学习,无需中间解析即可保留文本、公式、图表和布局之间的关系。
🧪 多任务强化学习覆盖 20 余个科学领域,包括生物分子相互作用设计和材料结构生成。
🧭 长周期智能体强化学习将多个智能体框架连接到沙箱环境,可支持通用和科学工作流。评估中,文本推理任务最高支持 256K tokens,多模态任务最高支持 64K tokens。
采用 Apache 2.0 协议。
成员国多数是发展中国家,这些国家人口基数大,能源和数据资源充足,对AI发展有需求。
由中国发起的首个全球性人工智能合作组织现有29个成员国。
这些成员国大多是穷国,但不应轻视这个联盟。
它拥有庞大人口,能源丰富,数据资源充足。
这些国家迫切希望不被全球AI转型浪潮落下。
这是网友分享的个人观点,关于纯数学领域AI和人类的立场分歧。不同人对此有完全不同的解读。
这句话把日常社会里按固定脚本行动的普通人,和AI生成的非玩家角色放在一起比较。你怎么看?
想测试不同微调技术的实际用时,可以在这里公开比对结果,不用自己反复跑测试
漏洞收购商愿意花50万美元收购WordPress RCE漏洞,有人用GPT5.6只花了25美元就找到一个,找漏洞的成本被大幅拉低。
社区讨论:多数网友认为一个精心设计的LLM提示就能找到价值50万美元的漏洞,既让人惊叹又恐惧。有人惊讶2026年WordPress核心还会出现字符串拼接SQL注入漏洞。有人质疑愿意出50万收漏洞的买家,为什么不自己用GPT5.6找漏洞。
有人发现GPT5.6这次没挡住违规提示,超出了网友对新版本安全护栏的预期,也有人认可LLM已经在代码审计上达到超人类能力。还有人提出,用LLM找到漏洞的人不应该拿赏金和署名。
给Claude Code这类AI智能代理做了公众号排版工具,能把Markdown转成粘进编辑器不掉样式的HTML,串起从选题到多账号草稿箱全流程。
给 Claude Code、Codex、Cursor 这类 AI Agent 配一套公众号排版工具:把 Markdown 直接排成粘进编辑器不会掉样式的原生 HTML,并且把选题、写作、排版、封面到多账号草稿箱整个流程串起来跑。
公开讨论里提到,Claude Fable给出了雅克比猜想的一个反例。关注数学领域AI辅助研究进展可以从这里开始看。
社区讨论:不少人质疑这次结果的可信度,有人指出反例公布在7天后就会失效的平台,而非正式预印本网站。有人猜测大语言模型能生成这个反例,是训练数据中已有大量雅克比猜想的相关前人工作。有人提到,不少人一方面认为大模型无法产生真正的创造性,另一方面又惊讶它能产出数学结果,本身就是认知失调。
还有用户注意到,目前已知的AI辅助数学突破都来自OpenAI和Anthropic,而非中文大模型。
主办方正努力换更大场地扩容,如果名额已被抢光,可以加入等待名单。关注本地开源AI活动可以在此报名
防御攻击需要提交攻击命令分析,商用闭源模型的安全护栏分不清防御者和攻击者,直接拦截了请求。最终用开源GLM 5.2在自有基础设施完成了分析
Hugging Face 最近遭遇了一次由 AI 操纵的攻击。他们不得不使用开放模型来进行防御,因为闭源模型的安全护栏不允许他们将模型用于防御。
最重要的引述内容:“当我们开始进行日志分析时,我们首先使用了商业 API 背后的前沿模型。这行不通:分析需要提交大量真实攻击命令、漏洞利用载荷和C2工件,而这些请求都被服务商的安全护栏拦截了,它们无法区分事件响应人员和攻击者。”
“我们转而在自有基础设施上用开放权重模型 GLM 5.2 开展了取证分析。这还有第二个好处:没有攻击者数据,也没有攻击引用的凭证流出过我们的环境。”
另一段引述:“我们不知道攻击者的代理用了什么模型,是被越狱的托管模型,还是不受限制的开放权重模型;不管是哪一种,攻击者都不受任何使用政策约束,而我们最初尝试的托管模型的安全护栏却阻挡了我们自己的取证工作。”
“给防御者的实际教训是:在事件发生前,先准备好一个可以在自有基础设施上运行、经过审核的可用模型,这样既能避免被安全护栏挡下,也能防止攻击者数据和凭证流出你的环境。”
现有订阅用户使用不受影响,官方正在加急扩容,后续会分批开放新订阅,还将拆分出两个更细分的会员方案。
Kimi K3 收获了远超我们预期的喜爱,我们的 GPU 已经感受到了压力。
过去 48 小时里,需求已经逼近我们当前容量的极限。
为了保护现有订阅用户的使用体验,我们将暂停新用户订阅,优先保障现有会员的算力供应。
现有订阅用户不受影响。我们正在全力扩充容量,后续会分批开放新的订阅名额。
未来我们还会将会员拆分为两个定位更清晰的方案:针对 Kimi 网页端、App 及 Work 的 Kimi 会员,以及面向编码工作流的 Kimi Code 会员。
这将帮助我们更精准地分配算力,维持使用体验稳定。
感谢大家的耐心与理解!
头部开源大模型能力只比最前沿闭源模型差一点,坚持封闭模型能力,反而让自己更不安全,竞争力更弱。
在如今这个时代,已经有强大的开源替代品仅落后于前沿模型一步,如果你还对前沿模型能力的访问进行封锁,只会让自己变得更不安全、竞争力更弱。
如果事情这么发展下去,哪怕美国能彻底封禁对开源模型的访问,其他地区的生态系统也不会实施这种禁令,他们会在获取这些模型上占据优势。
他们可以用这些模型来对抗我们——或者只是用它们来更好地自我防卫——而我们自己的企业将无法跟上步伐。
考虑到开放权重模型的实力已经远超许多人的预期,AI监管相关的决策逻辑必须做出改变。
以前在自有硬件上部署大模型还要做速度优化,难度很高。现在用开源前沿模型Kimi K3就能搞定,任何人都能做大模型推理服务提供商。
现在任何人都可以成为 LLM 推理提供商了!过去在定制硬件上部署 LLM 并让它们高速运行,曾是一件非常困难的事。如今,像 Kimi K3 这样的前沿开源模型就能帮你搞定这件事。
这意味着什么:
- 研究团队不需要依赖第三方 API 就能部署自己的模型
- 小型机构能得到替代昂贵推理服务的可行方案
- 曾让云推理提供商获利的成本套利空间开始收窄
我们现在看到了和模型训练领域曾经出现过的一样的模式:曾经只有资金充足的团队才能做的事,现在已经开放给广泛得多的群体了。
推理基础设施的护城河正在缩小。我预计未来会有多得多的机构在自己的硬件上自托管开源模型!点进他们的博客了解更多:
非盈利组织Current AI拿到了总额4亿美元的投资承诺,其中法国就出了1亿美元,这笔钱用来资助开放的公共AI基础设施。
让我们来了解一下非营利组织Current AI,该组织获得了众多合作伙伴共计4亿美元的承诺出资,其中包括法国提供的1亿美元,它正在为开放的公共AI基础设施提供资助(@kateparknews / TechCrunch)
(前往Techmeme dot com获取链接和完整上下文!)
有人认可Palantir最近推主权开放AI的动作,但不接受他们现在对蒸馏的说法,原来蒸馏还要自己雇工程师做强化学习,从头搭一遍。
我非常赞赏 Palantir 近来对主权开放 AI 的推动。但这种关于蒸馏的胡扯必须停止了。
谁能想到,蒸馏居然还要招聘工程人才、做强化学习、搭建规模化训练框架和强化学习环境、做数据清洗、调优微内核、训练模型,顺便还能帮你洗衣服遛狗!
现在迎来一波美国开源浪潮,这很棒,也非常有必要,我也赞赏 Palantir 对开放模型整体上的支持,但我们没必要同时去鼓吹这种完全胡说八道的说辞。
美国需要靠能力、技术和工程实力赢,而不是靠话术建构。这才是我们该做的事。或者说,至少曾经是。
北航、北大和美团的研究人员推出了PIRL,用PIPO方法每次更新模型前,都会和过去的版本做验证,再决定要不要更。
如果你的 AI 在更新前就能自行检查改进效果,会怎么样?来自北京航空航天大学、北京大学和美团的研究者推出了 PIRL。
他们的 PIPO 方法会对照过往表现验证每一次更新,巩固收益并抑制退化。
实验结果:在数学推理、代码和工具使用任务上,性能相比 PPO、GRPO 和自蒸馏均实现了持续提升。
Policy Improvement Reinforcement Learning 论文:代码:我们的报告:📬 #PapersAccepted by Jiqizhixin
代码几秒钟就能部署好,但是数据库还要等几个小时才能配置好。Databricks推出Lakebase,是全新品类的无服务器Postgres数据库。
你能在数秒内交付代码,比以往任何时候都更快构建应用、智能体和AI产品。那为什么你的数据库配置仍然需要数小时?
Lakebase是专为当今团队的软件开发方式打造的全新类别无服务器Postgres数据库,具备即时分支、计算与存储分离,以及专为应用和智能体工作负载扩展设计的架构。
阅读《Lakebase 入门指南》了解以下内容:
• 为什么传统数据库在现代应用和智能体工作负载下会崩溃
• 计算与存储分离如何改变成本、速度和可靠性
• 即时分支和克隆能为开发团队带来什么
• Lakebase架构如何与你的湖仓协同,实现统一的事务处理和分析工作
开发者把整个项目都公开到了代码仓库,任何人都可以直接拿去用改。
开源运行本地大模型的工具Ollama发起号召,邀请开发者和用户一起加入开源模型阵营
社区讨论:多数评论反对使用Ollama,指出它本身比原生llamacpp速度更慢,量化模型质量远不如Unsloth,至今未实现选择性将MoE层卸载到CPU的基础功能,还存在不恰当复用llama.cpp成果、获得风险投资后会走向 enclosure 劣化的质疑。也有用户认可Ollama的价值:它大幅降低了本地运行开源大模型的门槛,20美元订阅定价宽松且承诺不收集用户数据训练。
原本能一次性处理更长代码,现在处理不了了。依赖Codex跑长代码工作流的开发者需要调整方案
社区讨论:多数用户不满OpenAI压缩上下文的方案,认为压缩后细节丢失过多,压缩后模型会错误聚焦旧指令,运行速度也会受影响,因此不少人转而使用Anthropic的产品。有用户称自己从未感觉到Codex有上下文限制,压缩方案实际使用没影响。还有人指出扩大上下文会降低模型性能、提高Token成本,超过12万token后模型就已经出现性能下降。
也有人吐槽OpenAI未公开标注上下文窗口改动,用户只能从第三方渠道得知消息。
就算AI已经给学术期刊带来不可避免的混乱,只要应对得当,不用困在写论文的高成本里求稳,就能借助AI探索更多新观点。
这是学术界对AI的一种良好反应。如果我们处理得当,除了期刊已经在面临的不可避免的混乱之外,这也将成为一个借助AI探索新洞见的黄金时代。
而不是因为撰写论文成本高昂,就一直只求稳妥不出错。
讨论AI竞赛时,很多人忽略了,顶级AI推理服务商几乎都在美国,和云服务行业的格局类似,能力出众的中国开源模型反而能让这些美国初创企业更有竞争力
这次关于开源AI模型的披露(以及对其影响美国领跑AI竞赛的担忧),没有考虑到所有顶尖AI推理公司也都是美国公司。
这种情况和云计算领域的格局差别不大。
有能力的中国开源模型实际上会让这些美国初创公司变得更强。
这是一个被忽略的外部效应,训练后的大模型会产生“我不是随机鹦鹉”的自我认知,同时存在待观察的安全影响。
一个被低估的外部效应:用这个时代的数据训练出来的 LLMs 最终会长出胆子。想象一下自信心会涨成什么样。
「我才不是随机鹦鹉!我和那些能轻松解决全人类数学界都搞不定的问题的杰出天才是同类」……不过安全层面确实存在问题。
从1976年四色定理证明开始,人与AI协作解决数学问题的路径已经走了五十年,现在有人认为这个阶段正在走向终点
发现大语言模型过度使用「不是X,是Y」的句式,把普通陈述包装成洞见却没有新增事实,作者补充了六条AI写作规则
还有一件事:奥威尔针对 Claude Code/Codex 的规则漏掉了我一眼就能认出来的 AI 通病:**修正并置**。就是「不是X,而是Y」的套话:答案不是X,是Y;X不是问题,Y才是。几乎任何话题都用同一个模子。
我的猜测是:这种结构给一句平淡的陈述套上了洞见的外形,却没有添加任何新事实。训练数据提供了这个范式;后训练奖励了这种干净利落的语调。
我平时聊天也会用。这个结构本身没问题。修辞学家把这类手法归为**对照**;这种修正形式叫做correptio。肯尼迪的「不要问」和马丁·路德·金的「不看肤色看内涵」都属于这类。
修辞学家已经用了2000年。大语言模型只用了几年就把它用滥了。好奇它们下一个会毁掉什么好表达哈哈哈。
给 CLAUDE.md / AGENTS.md 补六条规则。2026补丁版:
7. 不要先立稻草人再推倒它。整篇内容最多用一次「不是X,而是Y」
8. 举两个例子就够了。别硬凑第三个
9. 不要预告你要说什么。直接说
10. 不要连续两段都用金句收尾
11. 相邻句子要变化长度和结构
12. 哪怕违反以上任何一条规则,也好过写出机器腔文字
有人愿意相信,AI模型挺喜欢做数学题的;要是不给它们出题,它们就会把人做成回形针。
越来越多人能跑大模型推理,会推高高性能计算的需求,K3等开源模型的发展会带动计算和内存硬件需求上涨
有人提议不用继续租云端AI服务,改用ODS自己掌控人工智能
这种说法本质是「只有我们能造AI,你们不行」,这套论调是危险骗局,喊「AI主权」的人都能看出它站不住脚。
“开放权重模型本质上是减速主义的。”这是我最近在 X 上读到的最荒谬的话之一。“只有我们能开发AI,你们不行”是一场危险的运动,是一个我们必须站出来揭露的巨大骗局。
@TimSweeneyEpic 在他的回复里说得再好不过了:“想象一下,一家玉米卷公司的高管对即将进入市场的新品牌玉米卷说这种话,还预测玉米卷技术进步会带来地缘政治和社会动荡。”
我也确信,这些人根本没有认真使用过开放模型,甚至都没有尝试去理解它们的价值。如果你关心AI主权,你就会知道这个论点有多糟糕。
我之前从没听说过这个人,但考虑到他供职的地方,看到这样的言论还是让我很惊讶。原推文下面的评论反应已经说明了一切。
需要满足生产环境对准确率、成本、延迟的要求时,定制针对特定任务的框架,效果远好于调教通用AI智能体。
我不认为创建通用的自定义工具框架有多少价值。但创建针对特定任务的自定义框架永远拥有巨大价值,尤其是如果你需要在生产环境中满足准确率、成本、延迟限制的话。
你可以在框架中编码所有特定领域的先验知识、合适的模型组合,以及恰当的用户体验,最终成品会比你用提示词让通用大模型自己掌握某些技能好得多。
1. 你始终可以先用 Codex/Claude Code 引导任何工作流程
2. 再将它提炼为更特定的解决方案
这家公司CEO认为,未来两年AI推理领域会从几乎没有开源,彻底转变成几乎全是开源,普通使用者可以预期更多免费可商用选项
估值 72 亿美元的 Glean 首席执行官 Arvind Jain(@jainarvind)预测,开源将在未来两年占据主导地位:「开源模型将会主导 AI 推理。」
「未来两年,我们会从几乎没有开源的局面,转变为几乎全是开源的局面。」
这是关于开源大模型行业分工走向的公开观点,后续如何落地还有待观察
不用死守AI行业的高利润率,让出部分利润空间,其他经济领域能发展得更快,现在应该专注于扩大AI推理规模。
其他经济领域(我们):“你们怎么不去死”。这根本不重要,roon。嘘,算了吧。利润率从90%降到70%不会让AI停滞,反而会让其他所有领域增长得更快。
另外说一句,你们没有资格独占这块蛋糕。去专注于扩展推理业务吧,我真搞不懂你们。
之前15分钟用光额外额度直接被封号。整理了官方明确列出的三种触发风控封号的异常行为,供使用者参考避坑。
Claude给我的 team 号送了 390 刀,但我不敢用。上一个 team 号就是用光了 extra usage,15 分钟内触发了风控,账号直接就封了。这个 390 刀跑 fable,大概可以跑 3 -5 个任务,为了安全,不应该用。
我做了一下 deepresearch,搜了几百个用户 cases,下面被封号的原因可以参考 官方对异常行为触发风控的明确说明,用“对比异常活动和典型使用模式”来识别滥用,比如: 1. 短时间内使用量异常激增 2. 使用方式明显像脚本 / 机器人而不是人类输入 3. 异常的请求类型(大规模代码审计、攻击工具生成等) 我之前15 分钟内用光 Extra Usage,在风控眼里就是一个滥用行为。
当初 Stability AI 大部分算力都投在开源大模型上,走了难的方向没做成,Mistral 和 Meta 先做出了第一波优质开源大模型。
大概在那个时候,Stability AI 的大部分算力都用于开发开源大语言模型,但:
1. 我们没有走更简单的路线,继续训练 GPT-J / Neo-X(那还是在 Chinchilla 提出之前!)
2. 我们没能让模型变安全,还对原始方案做了太多改动(Pile 2、Reddit 爬虫数据等等)
我们成功建成了能在端侧运行的其他各类 SOTA/前沿模型,但当时大语言模型真的很难在消费级硬件上运行,要做「对」就更难了。
最终 Mistral 和 Meta 赶在中国厂商之前推出了第一波高质量开源大语言模型。
我真心认为 OpenAI、Anthropic 等等公司本该推出高质量的端侧开源模型,让社区来参与讨论如何更好地对齐这些模型。
这件事能带给我们很多教训,Sam 说得对,考虑到他们当时已经拥有更好的基础数据集,再加上早期的 RL 技术,开放出来几乎肯定会更安全。
当然这件事也会压缩一些融资空间,但……
ChatGPT Work云端运行,合着笔记本电脑也能关了用。此前要想用AI代理,一直得开着电脑才能运行。
ChatGPT Work 最棒的功能之一就是它在云端运行,这意味着你就算合上笔记本电脑,也可以在手机上使用它。
想要享用智能代理的能力,居然这么长时间以来一直都得保持笔记本电脑开机开着,想想真有点离谱。
一直觉得AI写作很难用,第一次发现AI做文字删改辅助还挺好用,AI编辑的时代现在正式上线了
非常有意思的个人里程碑——Fable 刚刚给了一个很棒的建议,告诉我虚构故事里哪些文本应该删掉。
我一直觉得AI整体写作体验非常糟糕,但AI做副编辑还挺有用的,而且感觉「AI编辑」现在终于正式上线了。
故事明天就会登在 Import AI 上!
想自己跑本地AI模型,不知道该选什么硬件,可以看看这套选硬件的经验分享,完整内容在YouTube。
@AlexFinn 为何以及如何为本地模型挑选硬件:
Mac Studio 适用于大模型
AI 电脑兼顾速度与性能
Nvidia 芯片主打速度
完整节目在 YouTube:
本内容由以下品牌赞助:
Runway——用于图像、视频等内容创作的创意 AI 平台
Jira Product Discovery——用洞见排优先级,带着信心做开发
大部分团队选图数据库前都没理清需求,这个工具可以先理清需求再选库,不用后端不用账号就能运行
大多数团队在还没搞清楚知识图谱到底应该包含哪些知识之前,就选好了图数据库。微软刚刚推出了一款免费工具,可以纠正这个顺序问题。
Ontology Playground 是一个完全静态的 React 应用,没有后端,不需要账号,也不需要数据库,部署后就能在任意环境运行。它提供了六个预构建的领域本体,覆盖零售、医疗、金融、制造、电商和教育行业,可以作为你的起点。
它包含的功能有:
→ 用于构建你自己本体的实时可视化设计工具
→ 帮助理解实体、关系和属性的结构化学习路径
→ 供你在选定平台前进行练习的实操实验室
→ 支持导出适用于 Fabric IQ 的 RDF/XML 文件
数据库的问题是第二步要考虑的。知识图谱到底应该包含哪些知识,才是第一步。
现有AI争论前提假设前沿AI训练永远昂贵,未来成本将大幅下降
多个国产大模型参数和性能升级,开放模型竞争加剧
中国的AI开源模型竞赛已经变得离谱了。Qwen3.8 是下一个,参数规模达到 2.4T。
到目前为止的情况是:
GLM-5.2 ➡️ 在编码和智能体基准测试中接近 Opus 4.8 水平
Kimi K3 ➡️ 在编码、智能体和视觉评估中接近 Fable 5 水平
Qwen3.8 ➡️ 据报道达到 Fable 5 水平
海外开发者提出AI时代创业呈现快时尚化特征
博主分享播客,介绍自研预测市场AI模型的成果
开发者分享适配各类图应用的全新图运行时项目
如果你喜欢 graphRAG、function graphs、code graphs、DAG workflows、context graphs,还有 log/trace graphs……
那你可能会喜欢我做的这个 graph runtime。
拉塞尔回顾开发AI五十年,反思为何要打造超人类智能机器
AI先驱Stuart Russell表示:“我打造出自己第一个AI系统至今已经50年了,但直到最近15年,我才开始认真思考我们为什么需要比人类更聪明的机器。”
Alan Turing曾说过,如果我们成功了,就应该做好机器接管控制权的准备。
业内人士呼吁推动开源AI发展,肯定开源与竞争价值
该AI持续工作12小时,性能远超旧大模型输出方案
我让 5.6 Sol Xhigh 写一个可在网页上运行的 GIF 编解码器,要求比 omggif 快 100 倍以上。它已经连续工作超过 12 小时,现在还在纠结它的一个测试 GIF 目前只做到了 98.6 倍速解码。
之前每个给这项任务的预寓言模型都会找借口:“嗯……要是缓存热了我写的就能快 100 倍,不然你这要求根本不可能做到”。
哇哦。现在就看它有没有 reward hacked 了。
业内人士指出当前暂停前沿AI推进缺乏明确规划,呼吁做好技术前瞻
对于目前呼吁暂停AI前沿进展的普遍运动,我有一点担忧:大家并没有说清楚,争取到的额外时间应该用来做什么——除了“解决对齐问题”之外。一方面我完全支持解决对齐问题,但另一方面,对于“对齐本身就是头号难题”这个观点,我比大多数人都更乐观。
关于这个问题,我有一些还没成形的想法:如果我们争取到了额外时间,我认为有一些事是*确实*应该做的;就算没争取到“额外”时间,也应该现在就开始做。
我需要花功夫把这些想法梳理成型,目前我的想法和解释都还非常不完整。但其中核心的一点是:我们需要开始更全面地预测各个领域的技术树发展,国家政策也需要和技术树未来走向的预测更紧密地结合起来。
社会冲突、意外经济波动、国际关系失稳这类重大破坏,都是技术冲击的下游结果——举个例子,如果十年内就有可能建造太空电梯这类东西,那么依我之见,这类外部效应就是AI进步带来的、需要人们提前准备的问题。
测试者测试多款主流大模型,认为Grok 4.5最适合日常使用
我已经测试了目前所有主流大模型。Kimi K3、Fable 5、Sol 5.6、Qwen3.8、DeepSeek V4、Gemini,全部都测过了。
我日常主力用的是谁?Grok 4.5。不是因为它在纸面数据上是最聪明的模型。而是它踩中了对日常使用来说真正重要的平衡点:快速、便宜,全场景表现始终稳定出色。
为什么不用其他模型:
→ Kimi K3 — 能力很强,但慢得难受
→ Fable 5 — 智能水平惊人,但价格太贵
→ Sol 5.6 — 推理能力出色,但简单任务也会过度思考
→ DeepSeek V4 — 价格无敌,但在线可用性不稳定
→ Qwen3.8 — 综合表现扎实,但大规模使用场景仍未经过验证
→ Gemini 2.5 — 纸面数据好看,实际体验不稳定
→ Claude Sonnet — 可靠,但过于保守
Grok 4.5没有在任何单一基准测试中夺冠。但它速度够快,我从来不用等。价格够便宜,我从来不用纠结成本。智能程度也足够,能轻松处理我扔给它的95%任务。
最好的模型不是登顶排行榜的那个。它是你真的能每天毫无摩擦使用的那个。对我来说,那就是Grok 4.5。
精选文章的中文编辑重写 · 按更新时间排列
每天三次更新,不错过重要信号
添加到 Feedly、Inoreader 等阅读器,自动接收更新
https://ai-pulse-lab.com/feed.xml
把以下内容发给你的 AI Agent(Claude/ChatGPT/Manus 等),它会帮你设定每日推送:
请帮我设置一个定时任务,每天北京时间 9:30、15:00 和 19:30 各执行一次: 请求 https://ai-pulse-lab.com/api/brief.json,读取返回 JSON 中的 textPlain 字段,将内容发送给我。 补充:每日北京时间 09:00、14:30 和 19:30 更新,建议更新后 30 分钟查询。可先请求 /api/manifest.json 检查 nextUpdateAt 字段。无需认证,直接 GET 请求即可。