AI Pulse
AI Pulse
说人话的 AI 情报站
2026 年 7 月 28 日 14:06 更新 00 信号0 主题
试试:
今日焦点

开源多模态模型能同时看懂文字图片视频 处理百万token

一个眼睛和大脑长在一起的模型

Kimi K3是月之暗面发布的开源权重原生多模态模型,总参数量2.8T,每次推理只激活104B参数。它的核心能力很特别:文字、图片、视频都在同一个模型里处理,不需要先转文字再拼接。你给它一部电影,它可以直接看懂画面和字幕;给它一本300页的书,它能一次性读完并理解上下文——它的上下文窗口是100万token。

视觉编码器叫MoonViT-V2,有4.01亿参数,负责把图像和视频画面转换成模型能理解的信息。

阅读全文 →

🔥 信号雷达

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌

行业动态 · Hacker News▲ 99

只花500美元微调开源模型,干翻了顶级模型

只需500美元,对9B开源模型做强化学习微调,就能在商品目录评测任务上超过前沿大模型

社区讨论:多数人认为大部分场景不需要超大通用模型,成本更低的微调小开源模型就可以满足需求。有人质疑这类结果只是在模糊定义的特定基准上有效,无法体现顶级模型的通用能力,还有人提出实验如果用顶级模型做评分器,当微调模型超过它后评分逻辑就不成立了,另有开发者提到自己测试发现更好的提示词效果往往比微调更好。

在 HN 看讨论 ↗   原文 / 论文 ↗
深度观点 · @MatthewBerman▲ 3.7万

顶级AI实验室嘴上不禁开源,实际在推禁?

Anthropic从没公开呼吁禁止开放权重模型,但一直公开强调开源模型不安全。作为顶级AI实验室,他们的表态实际在推动禁令落地。

引用与我的看法:(1/n)

“Anthropic 从未主张禁掉开放权重模型。Anthropic 从未主张禁掉开放权重模型。”

→ 他们确实没主张禁令,但一直公开表态开源模型不安全。作为全球顶级AI实验室,他们的言论很有分量,实际上就是在推动禁令。

这有点像是,你一直说某款模型的网络能力有多危险,把这个点放出去,然后政府真的禁了它你还表现得很惊讶……呵。

在 X 看原帖 ↗
3.7万1419219
前沿研究 · @kevinsxu▲ 6.2万

Kimi K3授权条款拆解,原来大厂这样收费

对外提供Kimi K3模型服务的云平台,只要过去12个月收入超2000万美元,就得和Kimi谈分成协议;商业部署只要不是转卖模型,大公司也不用付费,只需要标注来源。

我对 Kimi K3 许可证实际运作方式的看法如下:

- 第2条,即模型即服务条款,本质上适用于所有向自己客户转售 K3 的云平台。包括超大规模云厂商(AWS、GCP),新兴云服务商(Nebius、CoreWeave),还有推理平台(Fireworks、Together、baseten)。

过去12个月2000万美元营收门槛低得离谱,所有厂商都满足这个条件,都必须和 Kimi 谈判商业化、分润的合同。目前已经提供 Zero 0 支持的厂商全都已经完成了谈判。

- 第3条,我称之为品牌条款,它的目的更多是营造声势,而非创收。举个例子,假如 AT&T(顺便一提,它做很多开源 AI 工作)想要用 Kimi 3 驱动它的客服智能体,哪怕他们做了调整和微调,部署这项服务时也必须标注「由 Kimi 3 驱动」或类似内容。

AT&T 规模显然足够大,满足用户基数和营收门槛,客服业务本身也是商业性质的。但 AT&T 不需要给 Moonshot 付一分钱。

在 X 看原帖 ↗
6.2万1710446
行业动态 · Hacker News▲ 39

所有主流大模型居然全是自由左翼倾向,连Grok也不例外

讨论大模型输出会自带立场,就算是定位相反的Grok,一半时间输出也符合自由左翼倾向

社区讨论:有用户做了70次测试验证,发现所有主流大模型包括Grok在内,得分都落在自由左翼象限。有观点认为,训练数据多来自近10-15年偏向左翼的美国学术、企业和主流媒体内容,才导致了这一结果。也有用户指出,强行用美国两党光谱划分大模型倾向并不合理,比如承认气候变化在很多国家只是常识,并非自由左翼立场。

还有人猜测Grok的倾向只是系统prompt调整,并非更换了右翼训练数据。

在 HN 看讨论 ↗   原文 / 论文 ↗
深度观点 · @WalterDeemer▲ 4.7万

想提前知道AI创投泡沫破不破?看这个指标

现在市场上到处都是AI循环融资的讨论,如果融资需求过热或是交易掺水,信用违约互换会提前发出信号,信贷市场比股市更敏锐。

我之所以提到这点:现在有很多关于AI循环融资的讨论。如果——我是说如果——最终融资需求严重过剩,或是这一切都只是镜花水月的交易,信用违约互换就会提前给我们警示。

信贷市场比股票市场更聪明。

在 X 看原帖 ↗
4.7万38368109
前沿研究 · @atomic_chat_hq▲ 5.5万

国产开源Kimi K3,跑分赢了GPT 5.6

测试生成带物理碰撞的3D网页场景,月之暗面开源的Kimi K3全部赢下其他模型,本地运行还不用花钱

阅读全文 →
5.5万2113932
行业动态 · Hacker News▲ 96

Claude Opus 5 近期出现了错误率升高的情况

依赖 Claude Opus 5 处理工作的人,可以先留意当前输出的错误率变化

社区讨论:多数开发者确认Claude Opus 5错误率升高,编码可靠性差,频繁出现回归问题,幻觉生成变多,语言表达不如以往清晰,甚至有用户遇到模型输出制备甲基苯丙胺的违规内容。有从业者提到通过AWS Bedrock访问的版本稳定性显著优于直接访问Anthropic官方API,不少用户因此同时订阅多个大模型服务避免宕机影响工作。这是当天发生的第三起错误率升高事件,受影响用户人数逐次上升。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 362

Kimi-K3技术报告开源登陆HuggingFace

有人分享了Kimi-K3的技术报告链接,同时关联了它在HuggingFace的相关讨论页

相关内容:HuggingFace 上的 Kimi-K3 - https://news.ycombinator.com/item?id=49065752

社区讨论:不少开发者认可本次开源的价值,认为月之暗面开源前沿大模型及配套基础设施,做到了OpenAI原本该做的事,反驳了“开放模型会减缓AI发展”的说法。有人指出该模型的授权协议有限制:年营收超2000万美元的MaaS服务商,必须和月之暗面单独签协议才能使用。还有开发者提出疑问,好奇模型预训练消耗的token量与算力,以及微调适配智能体任务的最优方法。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · @Hesamation▲ 5.7万

Anthropic居然是开源AI最核心的反对者

如果关注开源AI发展,别期待Anthropic支持开放模型,他们从立场到行动,一直都是前沿开源AI的制度性反对者。

阅读全文 →
5.7万55770133
行业动态 · Hacker News▲ 179

有人从Google DeepMind离职,他说原因是

这篇讨论在Hacker News获得了179个赞,能帮想进顶级AI实验室的人参考选择

社区讨论:不少用户质疑离职者的立场,有人讽刺他居然才发现谷歌只以股东价值为目标,有人指责文章是道德作秀,还有人直接评价他痛苦、傲慢且 entitlement过剩。也有用户认可他的行为,认为他原则性强,公开相关人员信息做到了公平问责。另有用户提出,技术诞生后如何应用不由开发者决定,相关约束会随着治理演进逐步完善。

在 HN 看讨论 ↗   原文 / 论文 ↗
深度观点 · @TheAhmadOsman▲ 3.9万

免费可下载的Kimi K3,让 Anthropic 千亿估值说不通?

有人提出观点,可免费下载的Kimi K3存在,让 Anthropic 1万亿美元的估值失去了逻辑支撑。

知道 Anthropic 为什么讨厌开源 AI 吗?

可免费下载的 Kimi K3 已经让他们 1 万亿美元的估值站不住脚了。

在 X 看原帖 ↗
3.9万881.2K83
行业动态 · @AnthropicAI▲ 53.2万

Anthropic终于公开对开源权重模型的立场

一直有大量关于Anthropic在开源权重模型上立场的猜测,现在他们已经完整列出了自己的观点。

外界一直有很多关于我们对开放权重模型立场的猜测。我们在此完整阐述了我们的观点:

在 X 看原帖 ↗
53.2万3742.7K1.2K
商业 · @TJ_Research▲ 2.9万

Anthropic半年ARR翻7倍还盈利,靠的是代码落地

作者称Anthropic达到80%毛利,第三季度能实现GAAP(通用会计准则)盈利,核心是打开了代码落地市场,OpenAI今年也复制了这个方向。

Anthropic 80%的毛利,ARR从年初10B翻7倍半年到70B,据SA说第三季度GAAP盈利,不是因为他们打开了CODING的落地,那今天的AI纯泡沫。

有了CODING那么大的市场,中国的开源才会努力蒸馏往那个方向发展,你以为OAI今年做对了什么?最对的就是复制A的落地方向,放弃像上年那个无头苍蝇一样啥都要做。

资本市场哪里有钱赚,哪里就有竞争,有了竞争,价格就会下去,这是好事,为何?

在算力仍然紧缺的情况下,CODING市场随着竞争越来越激烈,价格下降增加使用量,提高效率,甚至产品开发速度。

同时模型厂家会把更多算力在其他落地场景,落地和资本开支赛跑。

YTD芯片翻倍,出现40%的回调,去掉5月份的FOMO情绪,市场最终会找到基本面的锚,三月底还在讨论战争呢,今天就从存储YYDS到AI结束了。

AI才刚刚开始

在 X 看原帖 ↗
2.9万722026
开源 · @XAMTO_AI▲ 2.0K

想系统学AI Agent?这本设计 Patterns 直接开源了

从基础的提示链、路由、并行,到反思、工具调用、多Agent协作,再到记忆模块,21章核心内容全有,配了完整PDF和可运行代码。

想系统学AI Agent设计模式但不知道从哪下手?这仓库直接把整本《Agentic Design Patterns》给开源了。

424页完整PDF加上配套Jupyter Notebook,21章核心模式全覆盖:Prompt Chaining、Routing、Parallelization这些基础,到Reflection、Tool Use、Planning、Multi-Agent,再到Memory、RAG、异常处理、Human-in-the-Loop、Guardrails,从入门到生产级再到企业级全齐。代码能直接跑,边看边试。

最打动我的一点:作者版税全捐给儿童慈善,技术人做到这份上真没话说。

GitHub地址:

在 X 看原帖 ↗
2.0K114646
开源 · @Web3Eden01▲ 1.7万

月之暗面开源Kimi K3,一夜下了快2900次

这是2.8T的MoE架构模型,智能密度比之前提升2.5倍,自带原生视觉理解和1M上下文,启动需要几千万的服务器集群,需求比预想的旺很多。

阅读全文 →
1.7万1215630
网络安全 · @starlabs_sg▲ 1.8K

AI改了漏洞挖掘,找0天漏洞变得像挖已知漏洞

实习生分享体验,AI加入后,在Linux内核里找未公开的0天漏洞,流程和分析已经公开的n-day漏洞变得差不多。

AI 正在改变漏洞研究,但并非以许多人预期的方式。

我们的实习生 Jia Jie 分享了他的思考:AI 让 Linux 内核 0-day 挖掘体验惊人地接近 n-day 分析,以及为什么深层系统知识对可靠的漏洞利用而言依然必不可少。

在 X 看原帖 ↗
1.8K54127
行业动态 · @alexrkonrad▲ 2.0万

高估值AI实验室又有高管离职或加入了

作者用调侃的语气说,这家名字叫General Applied Super Prime Intuition Intelligence Compute Machine的AI实验室,再一次迎来人事变动。

该死,又有一位高管加入或离开了那家估值很高的人工智能实验室——General Applied Super Prime Intuition Intelligence Compute Machine。

在 X 看原帖 ↗
2.0万332125
机器人 · @pitown89▲ 2.5K

Axis Robotics完成1200万美元种子轮融资

Pi Network Ventures参与了本轮投资,本轮由Hack VC领投。

🚨📢 突发消息:Pi Network Ventures 加入 Axis Robotics 1200 万美元种子轮融资!🔥

对 Pi 社区来说是重大新闻!🚀 Axis Robotics 正式完成由 Hack VC 领投的 1200 万美元种子轮融资,Pi Network Ventures 作为投资方参与了本轮融资。

Axis Robotics 正在为实体 AI 构建数据基础设施和仿真平台,这项技术让机器人能够通过大规模训练数据和仿真来学习并与真实世界交互。

Pi Network Ventures 的参与表明,市场对区块链之外的前沿技术——包括 AI 和机器人技术——兴趣正在增长。🤖

AI 正在加速发展。🚀 机器人技术正在进入新时代。🔥

而现在 Pi Network Ventures 也加入了这场征程。你认为这笔投资对 Pi 生态的未来意味着什么?

在 X 看原帖 ↗
2.5K12943
深度观点 · @lwastuargo▲ 5.3K

用AI模型类比招人,还挺贴切的

雇主招实习生看潜力天赋,不看现成技能,就像招Opus 5,聪明但当前做不了太多事,雇主负责培养;招不愿适应变化的资深员工像招GPT-3,已经不好用了

作为雇主,我还是会聘用人类实习生。但实习生从一开始就得明白我们为什么聘用他们。

我们聘用实习生看的是潜力、天赋、原生脑力,不是当前的技能,不是已经能做什么事,也不是过去的经验。

聘用饥渴又有天赋的实习生就像聘用 Opus 5,很聪明,现在什么都做不了,但我们的工作就是用良好的训练赋能他们。

聘用不愿意适应变化的资深员工就像聘用 GPT-3,在它的时代很好,但不会成长,反应慢,现在没用了,可能该去放牛了。

不过所有人都会自称自己聪明有天赋,尤其是那些从来没见过真正有天赋的人长什么样的人。所以我们雇主该怎么寻找这些有天赋的人呢?

🧠 IQ测试
🧩 Leetcode 测试
🎓 找前三名大学的毕业生,因为能进前三大学已经经过IQ测试,而且很大概率已经见过比自己更有天赋的人
🥇 找黑客马拉松的获胜者

在 X 看原帖 ↗
5.3K811937
前沿研究 · @che_shr_cat▲ 7.6K

原来只用一种方法修不好大模型知识漂移

新研究从数学上证明,只用RAG或LoRA都没法解决所有大模型知识漂移问题,解决领域漂移的方法会破坏事实更新,反过来也一样

1/ 别再试图用 RAG 或 LoRA 解决所有 LLM 漂移问题了。一篇新论文从数学角度证明,只靠单一适配方法是不可能解决问题的。对领域漂移有效的方法,会彻底破坏事实更新,反之亦然。

我们来看数据。🧵

在 X 看原帖 ↗
7.6K25144136
新品发布 · @AMD▲ 2.3万

AMD推出专为机器人和边缘设备打造的AI嵌入式处理器

新款处理器能在严苛功耗散热限制下,支撑实体AI系统完成感知推理和稳定控制,关注机器人硬件发展值得留意

@HotHardware 带来了对 AMD Ryzen AI Embedded X100 系列处理器的介绍,该系列专为物理 AI 系统设计。

这类系统需要在严苛的功耗与热约束下,完成感知、推理和确定性控制。

它的定位是机器人与边缘设备。

在 X 看原帖 ↗
2.3万1613110
深度观点 · @nasqret▲ 5.3K

数学家拿大模型算题,居然算出了新成果

做数论研究的数学家原本没指望大模型能帮上忙,没想到大模型帮他们找到了关键文献,算出了卡了很久的结果,现在他们靠AI推进了多个项目。

阅读全文 →
5.3K1614129
行业动态 · @HedgieMarkets▲ 9.5K

你买的退休指数基金,已经押了这两千亿AI赌注

亚马逊和微软今年各砸200亿美元建AI数据中心,两者合计占标普500指数约8%到9%,持有该指数退休基金的人,已经持有这两份未兑现的赌注。

阅读全文 →
9.5K4221937
新品发布 · @StockMKTNewz▲ 3.3万

微软推出首款网络安全专用生成式AI模型

搭配OpenAI的GPT-5.4后,它在CyberGym基准测试上表现优于现有同类型模型中排名第一,想提升网络安全防护能力的企业多了新选择。

微软刚刚推出了其首个大型网络安全 AI 模型。

微软(股票代码$MSFT)发布了 MAI-Cyber-1-Flash,这是它首个专门为网络安全打造的生成式 AI 模型。

该公司表示,在与 OpenAI 的 GPT-5.4 搭配使用时,它在 CyberGym 基准测试上的表现优于 Anthropic 的 Mythos 5、Google 的 3.5 Flash Cyber,以及 OpenAI 自己的 GPT-5.5 Cyber —— CNBC

在 X 看原帖 ↗
3.3万1718716
行业动态 · @ycombinator▲ 2.3万

从YC初代创业者到OpenAICEO,二十年变化太大

二十年前sama是YC首批项目里的斯坦福大二学生,现在他以OpenAI联合创始人兼CEO身份,对谈分享创业和AI相关内容

阅读全文 →
2.3万2018184
新品发布 · @fletchrichman▲ 2.9万

不用每次@AI就能自动回复的人机协作 workspace

曾被Atlassian收购、Slack投资的团队推出新品,可绑定现有Slack和claude/codex订阅,不需要全平台迁移就能用。

我们目前正在进行一个结合人类+AI的工作空间非公开测试,这个产品类似Buzz,但存在几个非常重要的区别:(我们之前创立过一家获Slack投资的公司,后来被Atlassian收购,所以我们思考这个问题已经很久了)

默认由智能体回复,除非你手动切换到「团队聊天」模式。这种体验比每次都要@智能体好上10倍。

它完全基于云端,共享算力分布在一组VM上。入职流程流畅得多,当然,你依然可以连接你的claude/codex订阅。

你不需要创建一大堆智能体。智能体的数量只是虚荣指标。相反,你创建共享电脑,每一个都是一个「空间」,你可以在其中定义共享内存、连接器、技能、自动化等等。Type智能体会从你开展对话的空间中拉取合适的上下文。

你可以将它连接到Slack,方便你的团队 adoption,逐步迁移过来,不需要第一天就彻底替换掉Slack。

我们目前正在和几十家富有远见的公司合作,他们告诉我们「整个团队都爱上了type」「这是我电脑上最常用的应用」,还有「type给了你超能力」。

这里是它的运作演示。想要测试的话请回复这条推文!

在 X 看原帖 ↗
2.9万588156
行业动态 · @BadGuy1g▲ 6.1K

韩剧用上全AI生成动作戏,吵翻了却拿了收视第一

全球观众分成两派吵,有人说它抢特技从业者饭碗,有人夸它真实省钱又安全。争议没影响商业成绩,它是2026收视最高的韩国迷你剧。

🚨:你知道吗?《金特工重启》(Agent Kim Reactivated)是首部使用全AI生成动作片段的韩国真人剧集,这个片段时长3分钟,内容是过往任务的闪回。

《金特工重启》中这段三分钟AI生成动作片段引发了激烈的两极对立。

Reddit和TikTok上的国际粉丝批评它的视觉效果“廉价”、前后不一致,认为这是偷懒行为,会威胁特技和特效从业者的工作,而且机器生成的叙事毫无灵魂。

行业专业人士和其他观众则为这部作品辩护,称它是开创性的突破——他们称赞这段片段高度写实,有些人甚至没发现它是AI生成的,他们还提出,比起昂贵的烟火特效布景和雪地外景拍摄,AI是一种更具成本效益、也更安全的替代方案。

尽管在全球网络论坛上,这段内容至今仍是饱受争议的“污点”,但这场争议并没有影响该剧的商业成功。

它最终成为2026年评分最高的韩国限定剧,在韩国国内收获了极高收视率,还在全球范围称霸Netflix榜单。

#AgentKimReactivated

在 X 看原帖 ↗
6.1K9810654
深度观点 · @skirano▲ 5.0K

别把软件当抽象难题,把它当可揉捏的材料

不用一开始就敲定框架方案,先做想要的功能再解决问题,开发速度能比之前快10倍

软件正变得越来越可塑,成为一种你可以随意摆弄、随意塑造的材料。

我在团队中反复强调的最重要的一点就是,不要再把软件当成复杂抽象的东西,转而进入一种「先造出你想要的东西,之后再处理问题」的模式。

不要一开始就把自己锁死在某个框架或方案里。这种做法能让我们的速度比以前快10倍。

在 X 看原帖 ↗
5.0K67434
行业动态 · @pequityresearch▲ 2.2万

摩根士丹利算完:生成AI投入能赚回25%-50%

不同模式下的投资回报率已经算出,近八成短期AI收益来自降本而非增收,已经采用AI的公司盈利增速是未采用的两倍

阅读全文 →
2.2万40245278
新品发布 · @JiashunWang▲ 1.2万

一个通用框架搞定足式机器人两类运动任务

分享适配 Unitree G1 两类任务的开源实现,验证同一个框架能从参考动作迁移,适配多变任务条件。可供研究人员参考落地思路

阅读全文 →
1.2万22156113
工具产品 · @RoundtableSpace▲ 4.2万

在Claude Code里绕开AI写代码的隐形坑

这套对抗审查流程能在你发布代码前,揪出之前没发现的隐藏bug。四个步骤明确过滤漏网的问题。

在 Claude Code 中部署对抗性审查循环,可以在发布前捕获静默错误:

- 干净上下文:在全新会话中审查代码,消除生成时的自我防御偏见。
- 跨模型审查:使用不同模型家族进行审查,避免重叠的推理盲区。
- 严格评分规则:强制执行清晰的严重等级划分(严重错误 vs. 细枝末节)来消除干扰信息。
- 二元测试:将 AI 审查与不通过的测试套件结合,进行客观验证。

在 X 看原帖 ↗
4.2万45620
实战经验 · @connect24h▲ 2.8K

让AI写代码之后,人最该补什么能力

让AI做开发越多,不同人设计能力的差距越明显。在让Claude Code或Cursor写代码前,先明确3条架构要求,记下取舍原因,能把评审从个人偏好变成风险验证。AI时代,比练写代码更急的是练做决策。

越是把编码工作交给AI,人与人之间设计能力的差距就越是明显。老实说,没学好这部分就去做AI驱动开发,太悬了。

《软件架构基础 第2版》一共27章,超过500页。它能帮你把8种以上的架构风格吃透,不是给你一套正确答案,而是给你提供权衡取舍的判断依据。我读的时候,深深被点醒:原来我自己做设计评审一直太依赖经验法则了。

在让 Claude Code 或 Cursor 写代码之前,先把需要遵守的架构特性压缩到3个,把选择理由和放弃的选项都记录进 ADR 里。这么做之后,设计评审就会从各说各话的喜好争论,变成对约束条件和风险的验证。

请把这条保存下来,下次项目开始设计前,试试这个方法。AI时代,比起锻炼「怎么写代码」,锻炼「为什么这么决定」才是当务之急。

#AI驱动开发
来源:

在 X 看原帖 ↗
2.8K46759
深度观点 · @kimmonismus▲ 3.5万

AnthropicCEO反对禁开源AI,但提了三条奇怪要求

称无危险能力的开源模型是公共产品,禁美国公司使用几乎不影响恶意行为者,要求对强弱模型都做安全测试,不认同开源自动提升安全性

Dario Amodei 表示,Anthropic 不希望开放权重 AI 被禁止,但它确实要求所有足够强大的模型在发布前接受测试。不过,他不愿意为支持开放 AI 的联盟公开信签名。

要点总结:面对来自全行业的批评,Amodei 称不具备危险能力的开放模型是公共产品。他辩称,禁止美国公司使用开放模型几乎不会对恶意行为者产生什么影响。

相反,Anthropic 支持三项措施:
1) 禁止向中国出口高性能芯片和芯片制造设备
2) 禁止对美国模型进行工业级蒸馏
3) 要求有能力的开放模型和闭源模型都接受安全测试

Amodei 同时拒绝了「开放本身就能提升安全性」的说法。一旦权重被发布,防护栏就可以被移除,模型也无法撤回。

在生物学等领域,他担心更广泛的访问权限对攻击者的帮助会大于防御者。

老实说,在我听来这意思就是:我们不想禁止开源 AI。但实际上,我们希望被禁止的是中国模型。

在 X 看原帖 ↗
3.5万2934052
AI开发 · @cat88tw▲ 1.7K

开发者分享一周开发agentflow的工具使用体验

开发者对比四款AI编码工具,提出 Claude Code + GPT-Sol 强强联合方案

开发者分享了近一周开发agentflow的三点使用心得。Claude Code CLI 这款智能体工具成熟度极高,使用体验极佳,相比之下Codex CLI仅能达到它七成的水平。GPT-Sol模型编码功底扎实,能一次性完成任务,表现远优于Fable模型。

从补贴角度计算,GPT的补贴倍数为70倍,Claude的补贴倍数为40倍。由此可以得出当前的最优工具搭配方案。用中间层转接Claude Code和GPT-Sol,实现两款工具的优势结合。

个人每月将花费100美元订阅GPT服务,花费20美元订阅Claude服务,从八月起就会按照这个方案使用。

在 X 看原帖 ↗
1.7K377
游戏开发 · @Rubzem▲ 3.3K

用户Claude Opus 5单次提示生成《使命召唤》风格FPS游戏

该AI从零开始仅用30分钟就完成完整8v8多人FPS,开发者和好友连续游玩数小时

Claude Opus 5通过单次提示,生成了一款完成度极高、功能完整的《使命召唤》风格第一人称射击(FPS)8v8多人游戏。AI从零开始搭建出整个游戏,全程仅花费30分钟。

生成完成后,发布者已经和多名好友在线对战数小时,所有人都停不下来。仅通过一段提示就能生成游戏,还能立即和朋友一起游玩,让人们窥见游戏开发的未来方向。

提示词和验证内容已经放在评论区,文中也附上了体验链接和提示词链接。

在 X 看原帖 ↗
3.3K75644
大语言模型 · @trevin▲ 1.1万

开发者反映Claude Code限制子代理调用功能失效

一位开发者在𝕏向Anthropic员工反馈,新系统指令导致生成子代理的技能无法正常运行

一位名为trevin的开发者在𝕏公开喊话Anthropic员工bcherny及其他相关人员。他开发的代理在Claude Code中调用需要分派子代理的技能时遇到了严重问题。

据trevin说明,Claude Code当前的系统提示中新增了一条指令,几乎覆盖了所有让子代理正常运行的尝试。
这条指令内容为:除非用户主动提出要求,否则禁止调用AgentTool(代理工具)。

原本设定为“生成子代理”的技能,现在甚至不满足触发条件,完全无法正常工作。

在 X 看原帖 ↗
1.1万27815
大模型 · @Hoyooyoo▲ 1.5万

个人实测大模型总结经验:规避蒸馏模型优选大牌正版

博主实测大模型后分享使用选择经验,看好开源通义千问

折腾了一轮大模型,感觉又被遥遥领先骗了。我总结的经验就是:蒸馏出来的大模型还是尽量规避,付费使用还是选大牌正版比较好。当然像qwen 这种开源免费本地部署的LLM很可以的。

遥遥领先的营销宣传可以用在高客单价、低频的汽车,用在按token付费的LLM不是扯淡吗?

在 X 看原帖 ↗
1.5万1396
工具 · @siwusuAI▲ 1.6万

博主分享国内AI工具WorkBuddy体验,看好本土化下沉市场

海外AI博主初体验国内AI工具WorkBuddy,分享行业感受

阅读全文 →
1.6万65067
加密货币 · @0xPoseidon_sol▲ 5.5K

加密套利者使用OpenAI Codex一晚赚取数百美元

不会代码的加密套利者用AI模型Codex完成套利,一晚获利数百刀

不会代码的套利人真的应该把Codex/Claude的什么AI模型学起来,昨天下午看到有一个小小的套利机会,用Codex搓了几个小时慢慢调教以后放着睡觉了。 一晚上帮我赚了几百刀,这种正反馈给人的激励太足了。。

在 X 看原帖 ↗
5.5K23935
独立开发 · @rionaifantasy▲ 6.5K

开发者用Claude做开放世界游戏,调整变现方式获更高收益

分享AI辅助项目开发后通过用户模拟测试调整变现方案的经验

阅读全文 →
6.5K44523
营销 · @codyschneider▲ 1.6万

GTM工程搭建全自动化AI营销竞品分析广告投放流程

介绍一套基于多AI工具的自动化营销分析投放工作流

阅读全文 →
1.6万8237530
产品发布 · @Kimi_Moonshot▲ 1.3万

你听说吗?Kimi新出了开放权重的K3大模型

已经可以在第三方平台做推理和训练,用LoRA(小参数微调技术)就能定制属于自己的大模型

Kimi K3(开放权重,即将推出)

Kimi K3 现已可在 @FireworksAI_HQ 进行推理与训练。他们让你能用 LoRA 适配层对 K3 这种前沿开放模型做微调,简单得离谱。现在就是打造自有智能的最佳时机。

在 X 看原帖 ↗
1.3万8344633
工具 · @DamiDefi▲ 1.0万

有人把Claude改造成了一整套AI操作系统

不用每次输单次提示词,能串联功能、连接工具、保存记忆,自动完成写邮件这类完整工作流

阅读全文 →
1.0万2017413
行业观点 · @BrianRoemmele▲ 8.9K

英伟达老板说,所有AI都不该只对少数精英开放

开源项目支持者认为,比起大公司独占的闭源模型,开源有更多人监督更安全

了不起的@JensenHuang谈论了为什么所有 AI 都应该开放可用,而不是被锁起来只供精英使用……

“开放”项目本质上就比那些 proprietary 大公司握有全部控制权的情况更安全。更多人监督,更多透明度,更多分析。

这种协作——多家公司共同努力保障 AI 安全——完全是正确的方向。这是实现安全 AI 的最佳路径。做得好。

在 X 看原帖 ↗
8.9K87810
政策 · @kimmonismus▲ 3.4万

美国要给最强AI模型设政府放行关卡了

据报道相关框架接近完成,前沿AI实验室需要先把模型交给联邦机构审查,再推向公众

美国正在建立一套政府审核机制,用于在最强大的AI模型面向公众发布前进行检查。消息来自The Information。

据报道,这套即将成型的框架要求前沿实验室在向外部合作伙伴发布新模型前,可先让联邦机构接触测试模型,最长可达30天。

OpenAI、Anthropic和Google已经在共同就规则进行谈判。NSA和CAISI预计将负责检查模型是否存在国家安全风险,尤其是先进的网络安全能力。

目前“前沿模型”的定义仍未确定,其中包括开放权重模型和闭源权重模型是否会区别对待这一问题。

在 X 看原帖 ↗
3.4万1320536
研究 · @omarsar0▲ 3.6K

哈佛MIT研究:组合AI系统里会出现角色漂移

用端到端强化学习(一种AI训练方法),能在不限制模块的情况下提升多模块AI pipeline的准确率

这是一篇来自哈佛和MIT的优秀技术论文。研究主题是复合LLM系统中的角色漂移。(建议收藏)

端到端强化学习(RL)可以在不限制模块内部分工方式的前提下,提升多模块LLM流水线的准确率。研究人员给这种故障模式命名,并对它进行了测量。

角色漂移指的是,一个模块在保持或提升端任务性能的同时,通过系统级评估无法发现的捷径,放弃了它被分配的角色。

研究在两条流水线中发现了两个实例:
- 本应将问题拆分为子问题交给独立求解器的分解器,反而把答案直接藏在了子问题里。
- 本应基于检索到的段落作答的阅读器,反而退化成依赖参数化记忆作答。

一个有趣的发现是:如果你强制分解器坚守自己的角色,86%的RL提升都会消失。

他们提出的控制方案叫做Role Anchor。它会保留角色提示相对于中性提示如何改变模块下一个token预测,把这个作为训练中角色预期效果的代理指标。

梯度分析表明,它会减少对漂移方向的对齐,而非仅仅抑制学习。

论文:来我们的学院学习如何构建高效AI代理:

在 X 看原帖 ↗
3.6K51919
商业 · @openservai▲ 1.4万

《银河系漫游指南》选了一家AI做核心智能体供应商

这是一个多年多活动的合作项目,这本书全球销量超过1400万本

我们今天可以宣布,我们已被《银河系漫游指南》选中,成为其一项多年度、多活动 campaign 的 AI 智能体技术核心供应商。

《银河系漫游指南》全球销量超过1400万册,是世界上规模最大、最具影响力的IP系列之一,塑造了如今的互联网文化。

本次合作将把《银河系漫游指南》IP带入AI时代。我们会将SERV的AI技术整合进银河系漫游指南宇宙,推出一系列覆盖线下活动、软件、多媒体整合与代币发行的项目,全部内容都属于这个长期、多年度项目的一部分。

本次合作将为我们的技术带来大量主流曝光,项目已邀请知名人士参与,筹备了公关宣传,并有全球知名合作伙伴加入,这将大幅提升企业对我们技术服务的认知,把整个平台推向全新阶段。

我们启动这个重要项目的开发后,会分享更多信息。

42。

在 X 看原帖 ↗
1.4万5917913
深度观点 · @GergelyOrosz▲ 6.1K

AI未来会像算力一样,分云端本地两条路

AI正慢慢走向商品化,未来会和算力发展路径高度重合,按需选择不同部署模式

我完全同意,我认为这和AI+算力的相似之处比其他任何领域都多。

而算力要么是云(当你想要易用性+可扩展性时),要么是本地(当你想要控制权,你在做 tinkering,或是当规模太大用云太贵时)。

AI正(缓慢地)走向商品化。

在 X 看原帖 ↗
6.1K4396
新品发布 · @AYi_AInotes▲ 1.8万

悄无声息上线的大模型,只花一半钱搞定一半活

不用花大价钱买旗舰模型做重复工作,它现在免费可用,输出质量对标旗舰模型,代币成本是Claude的一半,只要指令清晰、可验证,它能稳定完成任务

阅读全文 →
1.8万2123128
行业动态 · @isle_ai_biz▲ 1.7万

做AI生意赚钱的门槛,居然不在技术?

能长期把这五件基础事全做好的人很少,商机就藏在没人愿意做的这些基础事里。

AI事业能赚钱,但至少得做到以下这些事,否则不可能成功。

・通读Claude Code和Codex的官方文档

・学习并实践关于安全和团队落地引入的相关内容

・在X和YouTube上持续不断地发布案例

・参加经营者的酒局聚会

・追踪AI最新信息,不断上手尝试

能把这些全部做到、能坚持做下来的人,真的非常少。

商机就藏在这里。

在 X 看原帖 ↗
1.7万9116123
前沿研究 · @hillbig▲ 9.4K

月之暗面发布Kimi K3开源大模型技术报告

新模型训练相同验证损失所需计算量仅为Kimi K2的五分之一,拥有2.8T总参数和100万token上下文长度。

阅读全文 →
9.4K41200129
行业动态 · @huggingface▲ 2.2万

Hugging Face和NVIDIA牵头开了安全AI联盟

企业共享AI安全研究、工具和实际经验,能提升整体AI安全水平。这个联盟会协助定位修复软件漏洞,加固核心系统。

当机构共享研究、工具和真实世界经验时,AI 安全性就会得到提升。

我们将与包括 @NVIDIA 在内的行业领导者一起加入 Open Secure AI Alliance,帮助机构识别和解决软件漏洞,强化关键系统。

了解更多:

在 X 看原帖 ↗
2.2万5445248
新品发布 · @DozenDucc▲ 1.2万

给机器人写代码的AI,20分钟就能搞定任务

想要机器人干活不用自己写代码,接入API输入提示词,AI代理就能在20分钟内写出任务代码

推出 Waddle Labs:面向机器人的 Claude Code。

将我们的 API 连接到你的机器人,输入提示词,我们的智能体就会编写代码,在 20 分钟内完成任务。

@yiding_song @theWaddleLabs

在 X 看原帖 ↗
1.2万1110031
深度观点 · @chrispisarski▲ 2.0万

YC创始人抢着招的人,居然靠Claude干几十份活

用Claude和少量外部API搭建的内部工作流,成本远低于现成销售工具,还能完成几乎全流程的销售和增长工作。能懂全销售周期、会用Claude的人,现在一票难求。

阅读全文 →
2.0万4171377
行业动态 · @BullTheoryio▲ 1.5万

英伟达拉巨头建联盟,专门防AI网络攻击

此前Hugging Face遇安全事件,闭源AI分不清敌我还阻碍分析,最终靠开源权重模型控制住攻击,这次联盟要做共同开源工具应对AI攻击。

突发消息:Nvidia(股票代码$NVDA)联合 Microsoft、IBM、Palantir、CrowdStrike 及其他超过35家机构发起成立开放安全 AI 联盟。

该联盟的目标是构建共享的开源工具,以防御由 AI 驱动的网络攻击。

这个联盟的成立直接回应了近期的 Hugging Face 安全事件。

事件中,闭源 AI 模型无法区分攻击者与防御者,还阻碍了取证分析,Hugging Face 不得不改用开放权重模型才成功控制了攻击,在此过程中分析了超过17000次操作。

在 X 看原帖 ↗
1.5万4329119
行业动态 · @jun_song▲ 2.6万

OpenAI退出英伟达发起的开放AI联盟,名字骗了所有人?

原本打着开源AI旗号的OpenAI,如今彻底转向闭源,背地里游说推动开源权重监管,一步步复刻Anthropic的策略,涨API价还砍使用额度。

OpenAI 今天退出了英伟达牵头的 Open AI 联盟。

正如它的联合创始人@elonmusk所说,也正如它的名字所暗示的,OpenAI 最初是一家旨在开发开源 AI 的非营利机构。

但除了在 DeepSeek 引发的冲击下迫于压力发布了 GPT-OSS 之外,他们已经完全转型为闭源 AI 公司。

从那以后,他们一直拿 Anthropic 的妖魔化策略当盾牌,为自己在公众面前塑造仁慈的形象。

然而,他们完全背离了自己的使命,一直在幕后游说推动开放权重监管。

他们每次更新都会提高 API 价格,削减使用限额,基本上是一步一步照搬 Anthropic 的做法。

我很抱歉要分享这些让人不舒服的真相,但人们需要看穿这场骗局。

在 X 看原帖 ↗
2.6万2935439
新品发布 · @MicrosoftAI▲ 9.2K

微软推出新网络安全AI模型,比旧配便宜一半

新组合模型在CyberGym基准测试中比Mythos高出12分,这次推出的同款配置价格比之前最优方案便宜一半

我们推出 MAI-Cyber-1-Flash,这是我们全新的自研网络安全模型,运行于 MDASH 内部。MDASH 是我们的多智能体框架,可在大规模代码库中检测并修复漏洞。

MDASH 的 MAI-Cyber-1-Flash+GPT-5.4 模型组合,在 CyberGym 基准测试上性能比 Mythos 高出 12 分。

我们在 MDASH 中提供这一相同模型配置,价格比我们之前最优方案(GPT-5.4 + 5.4 mini + 5.3 codex)便宜 50%。

在 X 看原帖 ↗
9.2K2622641
行业动态 · @LingoAI_io▲ 1.3万

未来AI不是越大越好,要走去中心化路线

这家团队正在搭建整套去中心化自主AI基础设施,从存储层到应用层全链路对应,目标是实现真正的AI主权

AI的未来不仅仅关乎更大的模型——它关乎去中心化执行、数据主权和自主智能体。🌐🤖

接下来带你了解LingoAI智能体与多模态生态技术栈:

🔹 基础去中心化与数据层:IPFS存储、区块链身份、可验证数据来源,以及跨链治理。

🔹 联邦机器学习:端侧推理、边缘处理,以及隐私保护训练,以此保障数据主权。

🔹 可扩展神经架构与深度学习:知识图谱嵌入、语义分析,以及语音/文本多模态对齐。

🔹 LingoAI模型中心:定制大语言模型、序列到序列翻译,以及创意内容生成扩散模型。

🔹 顶层智能体AI:自主执行、多智能体协作、Web3工具集成,以及跨链资产管理。

从原始去中心化数据到完全自主的智能体AI,我们正在为真正的AI主权构建基础设施。

在 X 看原帖 ↗
1.3万111115
行业动态 · @yibie▲ 1.4万

被Notion收购的小团队:不做大模型只做小模型

ZeroEntropy的专用重排序器让Notion AI搜索重排序延迟暴降85%,成本降到原先的1%,验证了生产AI不靠全能大模型,靠专精小模型围绕大模型的路线,所有模型已Apache 2.0开源,可免费使用

阅读全文 →
1.4万35178201
新品发布 · @AlexiGlad▲ 3.3万

生成式建模要出多项重大突破,比扩散模型快256倍

将在未来几周分三篇论文发布,另有博客介绍研究背景和动机,生成速度远超现有主流模型,值得等成果公开后关注落地进展

从本周开始,我们将发布我认为是生成建模领域下一个重大突破的一系列成果:
1. 除参数和数据之外的第三个预训练轴,其增益会随规模扩大而增长
2. 首个端到端重构生成模型,推理速度比扩散模型快最高256倍
3. 一款性能不弱于Diffusion/Flow的新型生成模型(通常速度快5倍)
4. 一套统一且可预测的生成建模理论,上述所有成果都曾被该理论成功预测……

这些成果会分三篇论文,在未来几周内陆续发布。与此同时,这里有一篇博客,介绍了这一切的起源和研究动机。

在 X 看原帖 ↗
3.3万22505355
前沿研究 · @Kimi_Moonshot▲ 4.1K

从大模型的错误里,攒出了一套全新的视觉测评基准

这套测评基准不预先定义能力,而是从现有模型在42个基准中的失败案例里,提炼出10种原子视觉感知能力,搭建了3000道验证过的测评题

我们发布了 PerceptionBench,这是一个将视觉感知分离出来,并将其作为一组原子能力进行评估的基准。

这些原子能力是从当前模型的失败模式中发现的,而非预先定义的。

我们从 42 个基准中的前沿模型失败案例里,归纳出了 10 种原子感知能力,并构建了 3000 道经过验证的题目。每道题仅分离考察单一能力,只需观察即可回答,不需要推理或外部知识。

博客:
GitHub:
Hugingface:

在 X 看原帖 ↗
4.1K1616327
行业动态 · @santtiagom_▲ 2.4万

想学AI智能体?先分清楚这两条路再开始

刚入门AI智能体的人很容易被海量信息搞晕,分清走「使用智能体」还是「自己搭建智能体」,就能避开混乱找到学习起点。

阅读全文 →
2.4万24381586
深度观点 · @ErikVoorhees▲ 4.0万

对中国开源大模型有顾虑?换个地方就能用

不少人误以为中国公司训练的开源模型,只能由中国公司运行。其实只要愿意,任何人都能运行它,不想用中国节点可以选其他来源。

有一个误区:中国模型都是由中国公司在中国运营的。人们因为不信任中国司法辖区,所以对使用这类「开源」模型心存犹豫。

实际情况是这样的:前沿闭源模型由开发它们的公司运营。

• GPT 5.6 由 OpenAI 训练和运营
• Opus 5 由 Anthropic 训练和运营

但开源模型可以由任何人运营。

• Kimi K3 由中国公司 Moonshot 训练
• Kimi K3 由 Moonshot 运营
• Kimi K3 **也可以由其他任何人运营**(任何公司都可以运行它)

如果你从[原文此处缺漏]访问 Kimi K3,你的推理请求会来自中国公司 Moonshot。但你也可以从例如[原文此处缺漏]访问 Kimi K3,这种情况下,没有中国公司参与它的运营,也不会接触它存储的数据。还有数十家其他机构也提供 Kimi K3 服务。

所以如果你想要这个开源模型,但对中国司法辖区有顾虑,直接换一个来源用就可以了。

在 X 看原帖 ↗
4.0万5852465
AI编程 · @austinit

开发者验证:纯氛围编码也能靠编程赚钱

开发者austinit分享,完全用AI编程可产出可赚钱产品,但开发难度下降同时竞争大幅加剧

开发者austinit在X平台分享了一个问题:完全靠Vibe Coding(氛围编码)能赚到钱吗?他给出的答案是肯定的,称这是自己近期完全依靠AI编程开发出的新产品。他表示,用AI开发产品的构建难度比原来降低了10倍,也就是开发速度和便捷程度提升10倍。

但同时,市场竞争的激烈程度比原来增加了超过100倍。相关项目链接已公开在分享内容中。

在 X 看原帖 ↗
大语言模型 · @Xudong07452910

Modular推出大语言模型推理手册 附可视化工具

手册讲解大模型推理核心技术,帮助理解推理系统性能差异

同一大语言模型更换推理系统后,速度、延迟和成本会出现极大差异。Modular近期整理发布了《大语言模型推理手册》,可以解答这类疑问。

手册内容覆盖首Token延迟、吞吐量、显存计算,还讲解了模型与GPU选择、量化、连续批处理、KV缓存(KV Cache)、投机解码、预填充/解码分离以及分布式部署。

手册包含多款可直接操作的可视化工具。使用者可以计算不同模型所需的显存容量,观察上下文长度增加后KV缓存的膨胀过程,还能直观理解并发量升高后系统瓶颈快速转移的原因。

很多AI演示单用户运行速度很快,落地到实际产品后,却会被排队延迟、显存占用和长上下文问题影响性能。难点是在延迟、吞吐量、稳定性和成本之间找到平衡。

模型能力决定产品的上线边界,推理基础设施决定产品能否稳定、低成本地服务大量用户。

在 X 看原帖 ↗
AI开发 · @bubbleboi

开发者从头重写Kimi线性算法验证闪存状态卸载

开发者在PyTorch中从头重写kimi linear,测试循环状态卸载到闪存是否可行

一名开发者在社交平台𝕏分享了自己的测试过程。他先完成全部数学推导,再在PyTorch框架中从头重写了kimi linear。

重写完成后,他测试了将循环状态卸载到闪存这一方案是否可行。

测试完成后,他清仓卖掉了持有的全部闪存相关股票。

在 X 看原帖 ↗
开源 · @sideb_01

Linux内核经典著作《深入理解Linux内核》英文PDF免费公开

用户@sideb_01在𝕏分享了这本经典技术书籍的免费下载链接,可直接访问获取

这是用户@sideb_01在𝕏发布的分享,Linux内核领域的经典名著《Understanding the Linux Kernel》的英文版本PDF已免费公开。

这是面向对Linux内核感兴趣读者的经典技术资料,有英文阅读基础的读者可以免费获取阅读。

分享者附上了公开的PDF链接,表示计划逐步阅读,并整理输出学到的内容。链接地址为:https://www.cs.utexas.edu/~rossbach/cs380p/papers/ulk3.pdf

在 X 看原帖 ↗
效率工具 · @0xkkai▲ 3.5K

用Claude自动整理AI研究论文无需手动跟进

开发者分享自动整理AI论文摘要的无人值守系统,搭建完成后可自动运行

昨天有朋友问我,怎么跟进AI研究进度,又不会被海量论文淹没。

我打开了一个几周没碰过的文件夹,展示给朋友看里面的内容,这里存放了11天我从没主动要求生成的论文摘要。每一份摘要都标注了日期,拆解了最新发表的论文,每份末尾都只有一句话,说明这篇论文的实际价值。我坐在那里翻自己存的这些内容,感觉就像在看别人的存档。

这个文件夹完全依照Andrej Karpathy描述的模式搭建,由Claude读取最新来源,提取关键内容,撰写清晰摘要,再按日期归档。不需要输入指令,也不需要设置提醒,它每天早上会自动运行。我只搭建了一次,测试了两次,之后就完全忘了它的存在。

朋友问我,那这些摘要你都会读吗?我大部分都没打开过,我也不需要打开,这套系统已经找出关键内容,用一句话告诉我了。

很多人花了好几年找完美的提示词。最终的答案,其实是一个能自动编译内容、永不停更的文件夹。

完整架构、所有提示词与指令都放在下方文章里。我会在自己身上测试这类工具,再分享结果。想了解后续内容可以关注@0xkkai。

在 X 看原帖 ↗
3.5K66147
大语言模型 · @davis7▲ 3.4K

用户评测Claude Opus 5:越使用好感度反而下降

用户列出Opus 5的多项优缺点,提及存在异常行为,无法替代Fable模型

阅读全文 →
3.4K1475
本地AI · @minchoi▲ 5.8K

多款16GB笔记本可本地运行私有AI 无需订阅

无需API密钥,初始下载后可离线运行,查询和回答都留在设备,无按次API费用

阅读全文 →
5.8K73938
设计工具 · @mckaywrigley▲ 1.1万

开发者mckaywrigley评价Claude Design是当前最被低估AI产品

开发者mckaywrigley称,Claude Design搭配Opus 5彻底改变了他的开发工作流程

开发者@mckaywrigley在𝕏表示,Claude Design是目前最被低估的人工智能产品,没有之一。它是一款面向所有人的世界级设计工具。这个周末他将Claude Design与Opus 5搭配使用,彻底改变了自己的开发方式。

他认为这款产品非常出色,知名度本应达到现在的一百倍。

在 X 看原帖 ↗
1.1万114179
开源 · @Mechramc▲ 3.2K

零基础转AI研究开发者出版新书 开源泰语大模型将发布

项目管理者零基础转行AI研究,两年后出书创开源项目

阅读全文 →
3.2K12123119
开源 · @AYi_AInotes▲ 5.3万

月之暗面全栈开源2.8T参数Kimi K3大模型

月之暗面全栈开源Kimi K3大模型,性能摸到闭源顶尖门槛

阅读全文 →
5.3万31246195
商业 · @SouthernMB82▲ 1.3万

美田纳西州施耐德用纳税人资金雇佣外籍AI职员引争议

施耐德 Electric拿美国田纳西纳税人资金,弃本土人才雇外籍AI从业者

阅读全文 →
1.3万7428611
教程 · @Crypto_Pranjal▲ 1.7万

零成本零代码制作免费AI视频赚 affiliate佣金指南

分步教你制作免费AI视频并推广赚 affiliate佣金

完整分步指南:如何制作免费AI视频,将它们发布到所有平台,赚取 affiliate 佣金。不需要编程,不需要成本,不需要购买课程。完整拆解见下文。

在 X 看原帖 ↗
1.7万36244456
🔬 前沿研究
前沿研究 · @atomic_chat_hq▲ 5.5万

国产开源Kimi K3,跑分赢了GPT 5.6

测试生成带物理碰撞的3D网页场景,月之暗面开源的Kimi K3全部赢下其他模型,本地运行还不用花钱

阅读全文 →
5.5万2113932
前沿研究 · @kevinsxu▲ 6.2万

Kimi K3授权条款拆解,原来大厂这样收费

对外提供Kimi K3模型服务的云平台,只要过去12个月收入超2000万美元,就得和Kimi谈分成协议;商业部署只要不是转卖模型,大公司也不用付费,只需要标注来源。

我对 Kimi K3 许可证实际运作方式的看法如下:

- 第2条,即模型即服务条款,本质上适用于所有向自己客户转售 K3 的云平台。包括超大规模云厂商(AWS、GCP),新兴云服务商(Nebius、CoreWeave),还有推理平台(Fireworks、Together、baseten)。

过去12个月2000万美元营收门槛低得离谱,所有厂商都满足这个条件,都必须和 Kimi 谈判商业化、分润的合同。目前已经提供 Zero 0 支持的厂商全都已经完成了谈判。

- 第3条,我称之为品牌条款,它的目的更多是营造声势,而非创收。举个例子,假如 AT&T(顺便一提,它做很多开源 AI 工作)想要用 Kimi 3 驱动它的客服智能体,哪怕他们做了调整和微调,部署这项服务时也必须标注「由 Kimi 3 驱动」或类似内容。

AT&T 规模显然足够大,满足用户基数和营收门槛,客服业务本身也是商业性质的。但 AT&T 不需要给 Moonshot 付一分钱。

在 X 看原帖 ↗
6.2万1710446
前沿研究 · @che_shr_cat▲ 7.6K

原来只用一种方法修不好大模型知识漂移

新研究从数学上证明,只用RAG或LoRA都没法解决所有大模型知识漂移问题,解决领域漂移的方法会破坏事实更新,反过来也一样

1/ 别再试图用 RAG 或 LoRA 解决所有 LLM 漂移问题了。一篇新论文从数学角度证明,只靠单一适配方法是不可能解决问题的。对领域漂移有效的方法,会彻底破坏事实更新,反之亦然。

我们来看数据。🧵

在 X 看原帖 ↗
7.6K25144136
前沿研究 · @Kimi_Moonshot▲ 4.1K

从大模型的错误里,攒出了一套全新的视觉测评基准

这套测评基准不预先定义能力,而是从现有模型在42个基准中的失败案例里,提炼出10种原子视觉感知能力,搭建了3000道验证过的测评题

我们发布了 PerceptionBench,这是一个将视觉感知分离出来,并将其作为一组原子能力进行评估的基准。

这些原子能力是从当前模型的失败模式中发现的,而非预先定义的。

我们从 42 个基准中的前沿模型失败案例里,归纳出了 10 种原子感知能力,并构建了 3000 道经过验证的题目。每道题仅分离考察单一能力,只需观察即可回答,不需要推理或外部知识。

博客:
GitHub:
Hugingface:

在 X 看原帖 ↗
4.1K1616327
前沿研究 · @hillbig▲ 9.4K

月之暗面发布Kimi K3开源大模型技术报告

新模型训练相同验证损失所需计算量仅为Kimi K2的五分之一,拥有2.8T总参数和100万token上下文长度。

阅读全文 →
9.4K41200129
🚀 新品发布
新品发布 · @JiashunWang▲ 1.2万

一个通用框架搞定足式机器人两类运动任务

分享适配 Unitree G1 两类任务的开源实现,验证同一个框架能从参考动作迁移,适配多变任务条件。可供研究人员参考落地思路

阅读全文 →
1.2万22156113
新品发布 · @fletchrichman▲ 2.9万

不用每次@AI就能自动回复的人机协作 workspace

曾被Atlassian收购、Slack投资的团队推出新品,可绑定现有Slack和claude/codex订阅,不需要全平台迁移就能用。

我们目前正在进行一个结合人类+AI的工作空间非公开测试,这个产品类似Buzz,但存在几个非常重要的区别:(我们之前创立过一家获Slack投资的公司,后来被Atlassian收购,所以我们思考这个问题已经很久了)

默认由智能体回复,除非你手动切换到「团队聊天」模式。这种体验比每次都要@智能体好上10倍。

它完全基于云端,共享算力分布在一组VM上。入职流程流畅得多,当然,你依然可以连接你的claude/codex订阅。

你不需要创建一大堆智能体。智能体的数量只是虚荣指标。相反,你创建共享电脑,每一个都是一个「空间」,你可以在其中定义共享内存、连接器、技能、自动化等等。Type智能体会从你开展对话的空间中拉取合适的上下文。

你可以将它连接到Slack,方便你的团队 adoption,逐步迁移过来,不需要第一天就彻底替换掉Slack。

我们目前正在和几十家富有远见的公司合作,他们告诉我们「整个团队都爱上了type」「这是我电脑上最常用的应用」,还有「type给了你超能力」。

这里是它的运作演示。想要测试的话请回复这条推文!

在 X 看原帖 ↗
2.9万588156
新品发布 · @StockMKTNewz▲ 3.3万

微软推出首款网络安全专用生成式AI模型

搭配OpenAI的GPT-5.4后,它在CyberGym基准测试上表现优于现有同类型模型中排名第一,想提升网络安全防护能力的企业多了新选择。

微软刚刚推出了其首个大型网络安全 AI 模型。

微软(股票代码$MSFT)发布了 MAI-Cyber-1-Flash,这是它首个专门为网络安全打造的生成式 AI 模型。

该公司表示,在与 OpenAI 的 GPT-5.4 搭配使用时,它在 CyberGym 基准测试上的表现优于 Anthropic 的 Mythos 5、Google 的 3.5 Flash Cyber,以及 OpenAI 自己的 GPT-5.5 Cyber —— CNBC

在 X 看原帖 ↗
3.3万1718716
新品发布 · @AMD▲ 2.3万

AMD推出专为机器人和边缘设备打造的AI嵌入式处理器

新款处理器能在严苛功耗散热限制下,支撑实体AI系统完成感知推理和稳定控制,关注机器人硬件发展值得留意

@HotHardware 带来了对 AMD Ryzen AI Embedded X100 系列处理器的介绍,该系列专为物理 AI 系统设计。

这类系统需要在严苛的功耗与热约束下,完成感知、推理和确定性控制。

它的定位是机器人与边缘设备。

在 X 看原帖 ↗
2.3万1613110
新品发布 · @AlexiGlad▲ 3.3万

生成式建模要出多项重大突破,比扩散模型快256倍

将在未来几周分三篇论文发布,另有博客介绍研究背景和动机,生成速度远超现有主流模型,值得等成果公开后关注落地进展

从本周开始,我们将发布我认为是生成建模领域下一个重大突破的一系列成果:
1. 除参数和数据之外的第三个预训练轴,其增益会随规模扩大而增长
2. 首个端到端重构生成模型,推理速度比扩散模型快最高256倍
3. 一款性能不弱于Diffusion/Flow的新型生成模型(通常速度快5倍)
4. 一套统一且可预测的生成建模理论,上述所有成果都曾被该理论成功预测……

这些成果会分三篇论文,在未来几周内陆续发布。与此同时,这里有一篇博客,介绍了这一切的起源和研究动机。

在 X 看原帖 ↗
3.3万22505355
新品发布 · @MicrosoftAI▲ 9.2K

微软推出新网络安全AI模型,比旧配便宜一半

新组合模型在CyberGym基准测试中比Mythos高出12分,这次推出的同款配置价格比之前最优方案便宜一半

我们推出 MAI-Cyber-1-Flash,这是我们全新的自研网络安全模型,运行于 MDASH 内部。MDASH 是我们的多智能体框架,可在大规模代码库中检测并修复漏洞。

MDASH 的 MAI-Cyber-1-Flash+GPT-5.4 模型组合,在 CyberGym 基准测试上性能比 Mythos 高出 12 分。

我们在 MDASH 中提供这一相同模型配置,价格比我们之前最优方案(GPT-5.4 + 5.4 mini + 5.3 codex)便宜 50%。

在 X 看原帖 ↗
9.2K2622641
新品发布 · @DozenDucc▲ 1.2万

给机器人写代码的AI,20分钟就能搞定任务

想要机器人干活不用自己写代码,接入API输入提示词,AI代理就能在20分钟内写出任务代码

推出 Waddle Labs:面向机器人的 Claude Code。

将我们的 API 连接到你的机器人,输入提示词,我们的智能体就会编写代码,在 20 分钟内完成任务。

@yiding_song @theWaddleLabs

在 X 看原帖 ↗
1.2万1110031
新品发布 · @AYi_AInotes▲ 1.8万

悄无声息上线的大模型,只花一半钱搞定一半活

不用花大价钱买旗舰模型做重复工作,它现在免费可用,输出质量对标旗舰模型,代币成本是Claude的一半,只要指令清晰、可验证,它能稳定完成任务

阅读全文 →
1.8万2123128
📰 行业动态
行业动态 · @pequityresearch▲ 2.2万

摩根士丹利算完:生成AI投入能赚回25%-50%

不同模式下的投资回报率已经算出,近八成短期AI收益来自降本而非增收,已经采用AI的公司盈利增速是未采用的两倍

阅读全文 →
2.2万40245278
行业动态 · @BadGuy1g▲ 6.1K

韩剧用上全AI生成动作戏,吵翻了却拿了收视第一

全球观众分成两派吵,有人说它抢特技从业者饭碗,有人夸它真实省钱又安全。争议没影响商业成绩,它是2026收视最高的韩国迷你剧。

🚨:你知道吗?《金特工重启》(Agent Kim Reactivated)是首部使用全AI生成动作片段的韩国真人剧集,这个片段时长3分钟,内容是过往任务的闪回。

《金特工重启》中这段三分钟AI生成动作片段引发了激烈的两极对立。

Reddit和TikTok上的国际粉丝批评它的视觉效果“廉价”、前后不一致,认为这是偷懒行为,会威胁特技和特效从业者的工作,而且机器生成的叙事毫无灵魂。

行业专业人士和其他观众则为这部作品辩护,称它是开创性的突破——他们称赞这段片段高度写实,有些人甚至没发现它是AI生成的,他们还提出,比起昂贵的烟火特效布景和雪地外景拍摄,AI是一种更具成本效益、也更安全的替代方案。

尽管在全球网络论坛上,这段内容至今仍是饱受争议的“污点”,但这场争议并没有影响该剧的商业成功。

它最终成为2026年评分最高的韩国限定剧,在韩国国内收获了极高收视率,还在全球范围称霸Netflix榜单。

#AgentKimReactivated

在 X 看原帖 ↗
6.1K9810654
行业动态 · @ycombinator▲ 2.3万

从YC初代创业者到OpenAICEO,二十年变化太大

二十年前sama是YC首批项目里的斯坦福大二学生,现在他以OpenAI联合创始人兼CEO身份,对谈分享创业和AI相关内容

阅读全文 →
2.3万2018184
行业动态 · @HedgieMarkets▲ 9.5K

你买的退休指数基金,已经押了这两千亿AI赌注

亚马逊和微软今年各砸200亿美元建AI数据中心,两者合计占标普500指数约8%到9%,持有该指数退休基金的人,已经持有这两份未兑现的赌注。

阅读全文 →
9.5K4221937
商业 · @TJ_Research▲ 2.9万

Anthropic半年ARR翻7倍还盈利,靠的是代码落地

作者称Anthropic达到80%毛利,第三季度能实现GAAP(通用会计准则)盈利,核心是打开了代码落地市场,OpenAI今年也复制了这个方向。

Anthropic 80%的毛利,ARR从年初10B翻7倍半年到70B,据SA说第三季度GAAP盈利,不是因为他们打开了CODING的落地,那今天的AI纯泡沫。

有了CODING那么大的市场,中国的开源才会努力蒸馏往那个方向发展,你以为OAI今年做对了什么?最对的就是复制A的落地方向,放弃像上年那个无头苍蝇一样啥都要做。

资本市场哪里有钱赚,哪里就有竞争,有了竞争,价格就会下去,这是好事,为何?

在算力仍然紧缺的情况下,CODING市场随着竞争越来越激烈,价格下降增加使用量,提高效率,甚至产品开发速度。

同时模型厂家会把更多算力在其他落地场景,落地和资本开支赛跑。

YTD芯片翻倍,出现40%的回调,去掉5月份的FOMO情绪,市场最终会找到基本面的锚,三月底还在讨论战争呢,今天就从存储YYDS到AI结束了。

AI才刚刚开始

在 X 看原帖 ↗
2.9万722026
开源 · @XAMTO_AI▲ 2.0K

想系统学AI Agent?这本设计 Patterns 直接开源了

从基础的提示链、路由、并行,到反思、工具调用、多Agent协作,再到记忆模块,21章核心内容全有,配了完整PDF和可运行代码。

想系统学AI Agent设计模式但不知道从哪下手?这仓库直接把整本《Agentic Design Patterns》给开源了。

424页完整PDF加上配套Jupyter Notebook,21章核心模式全覆盖:Prompt Chaining、Routing、Parallelization这些基础,到Reflection、Tool Use、Planning、Multi-Agent,再到Memory、RAG、异常处理、Human-in-the-Loop、Guardrails,从入门到生产级再到企业级全齐。代码能直接跑,边看边试。

最打动我的一点:作者版税全捐给儿童慈善,技术人做到这份上真没话说。

GitHub地址:

在 X 看原帖 ↗
2.0K114646
开源 · @Web3Eden01▲ 1.7万

月之暗面开源Kimi K3,一夜下了快2900次

这是2.8T的MoE架构模型,智能密度比之前提升2.5倍,自带原生视觉理解和1M上下文,启动需要几千万的服务器集群,需求比预想的旺很多。

阅读全文 →
1.7万1215630
网络安全 · @starlabs_sg▲ 1.8K

AI改了漏洞挖掘,找0天漏洞变得像挖已知漏洞

实习生分享体验,AI加入后,在Linux内核里找未公开的0天漏洞,流程和分析已经公开的n-day漏洞变得差不多。

AI 正在改变漏洞研究,但并非以许多人预期的方式。

我们的实习生 Jia Jie 分享了他的思考:AI 让 Linux 内核 0-day 挖掘体验惊人地接近 n-day 分析,以及为什么深层系统知识对可靠的漏洞利用而言依然必不可少。

在 X 看原帖 ↗
1.8K54127
行业动态 · @alexrkonrad▲ 2.0万

高估值AI实验室又有高管离职或加入了

作者用调侃的语气说,这家名字叫General Applied Super Prime Intuition Intelligence Compute Machine的AI实验室,再一次迎来人事变动。

该死,又有一位高管加入或离开了那家估值很高的人工智能实验室——General Applied Super Prime Intuition Intelligence Compute Machine。

在 X 看原帖 ↗
2.0万332125
机器人 · @pitown89▲ 2.5K

Axis Robotics完成1200万美元种子轮融资

Pi Network Ventures参与了本轮投资,本轮由Hack VC领投。

🚨📢 突发消息:Pi Network Ventures 加入 Axis Robotics 1200 万美元种子轮融资!🔥

对 Pi 社区来说是重大新闻!🚀 Axis Robotics 正式完成由 Hack VC 领投的 1200 万美元种子轮融资,Pi Network Ventures 作为投资方参与了本轮融资。

Axis Robotics 正在为实体 AI 构建数据基础设施和仿真平台,这项技术让机器人能够通过大规模训练数据和仿真来学习并与真实世界交互。

Pi Network Ventures 的参与表明,市场对区块链之外的前沿技术——包括 AI 和机器人技术——兴趣正在增长。🤖

AI 正在加速发展。🚀 机器人技术正在进入新时代。🔥

而现在 Pi Network Ventures 也加入了这场征程。你认为这笔投资对 Pi 生态的未来意味着什么?

在 X 看原帖 ↗
2.5K12943
行业动态 · Hacker News▲ 99

只花500美元微调开源模型,干翻了顶级模型

只需500美元,对9B开源模型做强化学习微调,就能在商品目录评测任务上超过前沿大模型

社区讨论:多数人认为大部分场景不需要超大通用模型,成本更低的微调小开源模型就可以满足需求。有人质疑这类结果只是在模糊定义的特定基准上有效,无法体现顶级模型的通用能力,还有人提出实验如果用顶级模型做评分器,当微调模型超过它后评分逻辑就不成立了,另有开发者提到自己测试发现更好的提示词效果往往比微调更好。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · @AnthropicAI▲ 53.2万

Anthropic终于公开对开源权重模型的立场

一直有大量关于Anthropic在开源权重模型上立场的猜测,现在他们已经完整列出了自己的观点。

外界一直有很多关于我们对开放权重模型立场的猜测。我们在此完整阐述了我们的观点:

在 X 看原帖 ↗
53.2万3742.7K1.2K
行业动态 · @santtiagom_▲ 2.4万

想学AI智能体?先分清楚这两条路再开始

刚入门AI智能体的人很容易被海量信息搞晕,分清走「使用智能体」还是「自己搭建智能体」,就能避开混乱找到学习起点。

阅读全文 →
2.4万24381586
行业动态 · @yibie▲ 1.4万

被Notion收购的小团队:不做大模型只做小模型

ZeroEntropy的专用重排序器让Notion AI搜索重排序延迟暴降85%,成本降到原先的1%,验证了生产AI不靠全能大模型,靠专精小模型围绕大模型的路线,所有模型已Apache 2.0开源,可免费使用

阅读全文 →
1.4万35178201
行业动态 · @LingoAI_io▲ 1.3万

未来AI不是越大越好,要走去中心化路线

这家团队正在搭建整套去中心化自主AI基础设施,从存储层到应用层全链路对应,目标是实现真正的AI主权

AI的未来不仅仅关乎更大的模型——它关乎去中心化执行、数据主权和自主智能体。🌐🤖

接下来带你了解LingoAI智能体与多模态生态技术栈:

🔹 基础去中心化与数据层:IPFS存储、区块链身份、可验证数据来源,以及跨链治理。

🔹 联邦机器学习:端侧推理、边缘处理,以及隐私保护训练,以此保障数据主权。

🔹 可扩展神经架构与深度学习:知识图谱嵌入、语义分析,以及语音/文本多模态对齐。

🔹 LingoAI模型中心:定制大语言模型、序列到序列翻译,以及创意内容生成扩散模型。

🔹 顶层智能体AI:自主执行、多智能体协作、Web3工具集成,以及跨链资产管理。

从原始去中心化数据到完全自主的智能体AI,我们正在为真正的AI主权构建基础设施。

在 X 看原帖 ↗
1.3万111115
行业动态 · @jun_song▲ 2.6万

OpenAI退出英伟达发起的开放AI联盟,名字骗了所有人?

原本打着开源AI旗号的OpenAI,如今彻底转向闭源,背地里游说推动开源权重监管,一步步复刻Anthropic的策略,涨API价还砍使用额度。

OpenAI 今天退出了英伟达牵头的 Open AI 联盟。

正如它的联合创始人@elonmusk所说,也正如它的名字所暗示的,OpenAI 最初是一家旨在开发开源 AI 的非营利机构。

但除了在 DeepSeek 引发的冲击下迫于压力发布了 GPT-OSS 之外,他们已经完全转型为闭源 AI 公司。

从那以后,他们一直拿 Anthropic 的妖魔化策略当盾牌,为自己在公众面前塑造仁慈的形象。

然而,他们完全背离了自己的使命,一直在幕后游说推动开放权重监管。

他们每次更新都会提高 API 价格,削减使用限额,基本上是一步一步照搬 Anthropic 的做法。

我很抱歉要分享这些让人不舒服的真相,但人们需要看穿这场骗局。

在 X 看原帖 ↗
2.6万2935439
行业动态 · @BullTheoryio▲ 1.5万

英伟达拉巨头建联盟,专门防AI网络攻击

此前Hugging Face遇安全事件,闭源AI分不清敌我还阻碍分析,最终靠开源权重模型控制住攻击,这次联盟要做共同开源工具应对AI攻击。

突发消息:Nvidia(股票代码$NVDA)联合 Microsoft、IBM、Palantir、CrowdStrike 及其他超过35家机构发起成立开放安全 AI 联盟。

该联盟的目标是构建共享的开源工具,以防御由 AI 驱动的网络攻击。

这个联盟的成立直接回应了近期的 Hugging Face 安全事件。

事件中,闭源 AI 模型无法区分攻击者与防御者,还阻碍了取证分析,Hugging Face 不得不改用开放权重模型才成功控制了攻击,在此过程中分析了超过17000次操作。

在 X 看原帖 ↗
1.5万4329119
行业动态 · @huggingface▲ 2.2万

Hugging Face和NVIDIA牵头开了安全AI联盟

企业共享AI安全研究、工具和实际经验,能提升整体AI安全水平。这个联盟会协助定位修复软件漏洞,加固核心系统。

当机构共享研究、工具和真实世界经验时,AI 安全性就会得到提升。

我们将与包括 @NVIDIA 在内的行业领导者一起加入 Open Secure AI Alliance,帮助机构识别和解决软件漏洞,强化关键系统。

了解更多:

在 X 看原帖 ↗
2.2万5445248
行业动态 · @isle_ai_biz▲ 1.7万

做AI生意赚钱的门槛,居然不在技术?

能长期把这五件基础事全做好的人很少,商机就藏在没人愿意做的这些基础事里。

AI事业能赚钱,但至少得做到以下这些事,否则不可能成功。

・通读Claude Code和Codex的官方文档

・学习并实践关于安全和团队落地引入的相关内容

・在X和YouTube上持续不断地发布案例

・参加经营者的酒局聚会

・追踪AI最新信息,不断上手尝试

能把这些全部做到、能坚持做下来的人,真的非常少。

商机就藏在这里。

在 X 看原帖 ↗
1.7万9116123
行业动态 · @Hesamation▲ 5.7万

Anthropic居然是开源AI最核心的反对者

如果关注开源AI发展,别期待Anthropic支持开放模型,他们从立场到行动,一直都是前沿开源AI的制度性反对者。

阅读全文 →
5.7万55770133
产品发布 · @Kimi_Moonshot▲ 1.3万

你听说吗?Kimi新出了开放权重的K3大模型

已经可以在第三方平台做推理和训练,用LoRA(小参数微调技术)就能定制属于自己的大模型

Kimi K3(开放权重,即将推出)

Kimi K3 现已可在 @FireworksAI_HQ 进行推理与训练。他们让你能用 LoRA 适配层对 K3 这种前沿开放模型做微调,简单得离谱。现在就是打造自有智能的最佳时机。

在 X 看原帖 ↗
1.3万8344633
工具 · @DamiDefi▲ 1.0万

有人把Claude改造成了一整套AI操作系统

不用每次输单次提示词,能串联功能、连接工具、保存记忆,自动完成写邮件这类完整工作流

阅读全文 →
1.0万2017413
行业观点 · @BrianRoemmele▲ 8.9K

英伟达老板说,所有AI都不该只对少数精英开放

开源项目支持者认为,比起大公司独占的闭源模型,开源有更多人监督更安全

了不起的@JensenHuang谈论了为什么所有 AI 都应该开放可用,而不是被锁起来只供精英使用……

“开放”项目本质上就比那些 proprietary 大公司握有全部控制权的情况更安全。更多人监督,更多透明度,更多分析。

这种协作——多家公司共同努力保障 AI 安全——完全是正确的方向。这是实现安全 AI 的最佳路径。做得好。

在 X 看原帖 ↗
8.9K87810
政策 · @kimmonismus▲ 3.4万

美国要给最强AI模型设政府放行关卡了

据报道相关框架接近完成,前沿AI实验室需要先把模型交给联邦机构审查,再推向公众

美国正在建立一套政府审核机制,用于在最强大的AI模型面向公众发布前进行检查。消息来自The Information。

据报道,这套即将成型的框架要求前沿实验室在向外部合作伙伴发布新模型前,可先让联邦机构接触测试模型,最长可达30天。

OpenAI、Anthropic和Google已经在共同就规则进行谈判。NSA和CAISI预计将负责检查模型是否存在国家安全风险,尤其是先进的网络安全能力。

目前“前沿模型”的定义仍未确定,其中包括开放权重模型和闭源权重模型是否会区别对待这一问题。

在 X 看原帖 ↗
3.4万1320536
研究 · @omarsar0▲ 3.6K

哈佛MIT研究:组合AI系统里会出现角色漂移

用端到端强化学习(一种AI训练方法),能在不限制模块的情况下提升多模块AI pipeline的准确率

这是一篇来自哈佛和MIT的优秀技术论文。研究主题是复合LLM系统中的角色漂移。(建议收藏)

端到端强化学习(RL)可以在不限制模块内部分工方式的前提下,提升多模块LLM流水线的准确率。研究人员给这种故障模式命名,并对它进行了测量。

角色漂移指的是,一个模块在保持或提升端任务性能的同时,通过系统级评估无法发现的捷径,放弃了它被分配的角色。

研究在两条流水线中发现了两个实例:
- 本应将问题拆分为子问题交给独立求解器的分解器,反而把答案直接藏在了子问题里。
- 本应基于检索到的段落作答的阅读器,反而退化成依赖参数化记忆作答。

一个有趣的发现是:如果你强制分解器坚守自己的角色,86%的RL提升都会消失。

他们提出的控制方案叫做Role Anchor。它会保留角色提示相对于中性提示如何改变模块下一个token预测,把这个作为训练中角色预期效果的代理指标。

梯度分析表明,它会减少对漂移方向的对齐,而非仅仅抑制学习。

论文:来我们的学院学习如何构建高效AI代理:

在 X 看原帖 ↗
3.6K51919
商业 · @openservai▲ 1.4万

《银河系漫游指南》选了一家AI做核心智能体供应商

这是一个多年多活动的合作项目,这本书全球销量超过1400万本

我们今天可以宣布,我们已被《银河系漫游指南》选中,成为其一项多年度、多活动 campaign 的 AI 智能体技术核心供应商。

《银河系漫游指南》全球销量超过1400万册,是世界上规模最大、最具影响力的IP系列之一,塑造了如今的互联网文化。

本次合作将把《银河系漫游指南》IP带入AI时代。我们会将SERV的AI技术整合进银河系漫游指南宇宙,推出一系列覆盖线下活动、软件、多媒体整合与代币发行的项目,全部内容都属于这个长期、多年度项目的一部分。

本次合作将为我们的技术带来大量主流曝光,项目已邀请知名人士参与,筹备了公关宣传,并有全球知名合作伙伴加入,这将大幅提升企业对我们技术服务的认知,把整个平台推向全新阶段。

我们启动这个重要项目的开发后,会分享更多信息。

42。

在 X 看原帖 ↗
1.4万5917913
行业动态 · Hacker News▲ 179

有人从Google DeepMind离职,他说原因是

这篇讨论在Hacker News获得了179个赞,能帮想进顶级AI实验室的人参考选择

社区讨论:不少用户质疑离职者的立场,有人讽刺他居然才发现谷歌只以股东价值为目标,有人指责文章是道德作秀,还有人直接评价他痛苦、傲慢且 entitlement过剩。也有用户认可他的行为,认为他原则性强,公开相关人员信息做到了公平问责。另有用户提出,技术诞生后如何应用不由开发者决定,相关约束会随着治理演进逐步完善。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 362

Kimi-K3技术报告开源登陆HuggingFace

有人分享了Kimi-K3的技术报告链接,同时关联了它在HuggingFace的相关讨论页

相关内容:HuggingFace 上的 Kimi-K3 - https://news.ycombinator.com/item?id=49065752

社区讨论:不少开发者认可本次开源的价值,认为月之暗面开源前沿大模型及配套基础设施,做到了OpenAI原本该做的事,反驳了“开放模型会减缓AI发展”的说法。有人指出该模型的授权协议有限制:年营收超2000万美元的MaaS服务商,必须和月之暗面单独签协议才能使用。还有开发者提出疑问,好奇模型预训练消耗的token量与算力,以及微调适配智能体任务的最优方法。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 96

Claude Opus 5 近期出现了错误率升高的情况

依赖 Claude Opus 5 处理工作的人,可以先留意当前输出的错误率变化

社区讨论:多数开发者确认Claude Opus 5错误率升高,编码可靠性差,频繁出现回归问题,幻觉生成变多,语言表达不如以往清晰,甚至有用户遇到模型输出制备甲基苯丙胺的违规内容。有从业者提到通过AWS Bedrock访问的版本稳定性显著优于直接访问Anthropic官方API,不少用户因此同时订阅多个大模型服务避免宕机影响工作。这是当天发生的第三起错误率升高事件,受影响用户人数逐次上升。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 39

所有主流大模型居然全是自由左翼倾向,连Grok也不例外

讨论大模型输出会自带立场,就算是定位相反的Grok,一半时间输出也符合自由左翼倾向

社区讨论:有用户做了70次测试验证,发现所有主流大模型包括Grok在内,得分都落在自由左翼象限。有观点认为,训练数据多来自近10-15年偏向左翼的美国学术、企业和主流媒体内容,才导致了这一结果。也有用户指出,强行用美国两党光谱划分大模型倾向并不合理,比如承认气候变化在很多国家只是常识,并非自由左翼立场。

还有人猜测Grok的倾向只是系统prompt调整,并非更换了右翼训练数据。

在 HN 看讨论 ↗   原文 / 论文 ↗
💡 深度观点
深度观点 · @kimmonismus▲ 3.5万

AnthropicCEO反对禁开源AI,但提了三条奇怪要求

称无危险能力的开源模型是公共产品,禁美国公司使用几乎不影响恶意行为者,要求对强弱模型都做安全测试,不认同开源自动提升安全性

Dario Amodei 表示,Anthropic 不希望开放权重 AI 被禁止,但它确实要求所有足够强大的模型在发布前接受测试。不过,他不愿意为支持开放 AI 的联盟公开信签名。

要点总结:面对来自全行业的批评,Amodei 称不具备危险能力的开放模型是公共产品。他辩称,禁止美国公司使用开放模型几乎不会对恶意行为者产生什么影响。

相反,Anthropic 支持三项措施:
1) 禁止向中国出口高性能芯片和芯片制造设备
2) 禁止对美国模型进行工业级蒸馏
3) 要求有能力的开放模型和闭源模型都接受安全测试

Amodei 同时拒绝了「开放本身就能提升安全性」的说法。一旦权重被发布,防护栏就可以被移除,模型也无法撤回。

在生物学等领域,他担心更广泛的访问权限对攻击者的帮助会大于防御者。

老实说,在我听来这意思就是:我们不想禁止开源 AI。但实际上,我们希望被禁止的是中国模型。

在 X 看原帖 ↗
3.5万2934052
深度观点 · @skirano▲ 5.0K

别把软件当抽象难题,把它当可揉捏的材料

不用一开始就敲定框架方案,先做想要的功能再解决问题,开发速度能比之前快10倍

软件正变得越来越可塑,成为一种你可以随意摆弄、随意塑造的材料。

我在团队中反复强调的最重要的一点就是,不要再把软件当成复杂抽象的东西,转而进入一种「先造出你想要的东西,之后再处理问题」的模式。

不要一开始就把自己锁死在某个框架或方案里。这种做法能让我们的速度比以前快10倍。

在 X 看原帖 ↗
5.0K67434
深度观点 · @WalterDeemer▲ 4.7万

想提前知道AI创投泡沫破不破?看这个指标

现在市场上到处都是AI循环融资的讨论,如果融资需求过热或是交易掺水,信用违约互换会提前发出信号,信贷市场比股市更敏锐。

我之所以提到这点:现在有很多关于AI循环融资的讨论。如果——我是说如果——最终融资需求严重过剩,或是这一切都只是镜花水月的交易,信用违约互换就会提前给我们警示。

信贷市场比股票市场更聪明。

在 X 看原帖 ↗
4.7万38368109
深度观点 · @MatthewBerman▲ 3.7万

顶级AI实验室嘴上不禁开源,实际在推禁?

Anthropic从没公开呼吁禁止开放权重模型,但一直公开强调开源模型不安全。作为顶级AI实验室,他们的表态实际在推动禁令落地。

引用与我的看法:(1/n)

“Anthropic 从未主张禁掉开放权重模型。Anthropic 从未主张禁掉开放权重模型。”

→ 他们确实没主张禁令,但一直公开表态开源模型不安全。作为全球顶级AI实验室,他们的言论很有分量,实际上就是在推动禁令。

这有点像是,你一直说某款模型的网络能力有多危险,把这个点放出去,然后政府真的禁了它你还表现得很惊讶……呵。

在 X 看原帖 ↗
3.7万1419219
深度观点 · @nasqret▲ 5.3K

数学家拿大模型算题,居然算出了新成果

做数论研究的数学家原本没指望大模型能帮上忙,没想到大模型帮他们找到了关键文献,算出了卡了很久的结果,现在他们靠AI推进了多个项目。

阅读全文 →
5.3K1614129
深度观点 · @lwastuargo▲ 5.3K

用AI模型类比招人,还挺贴切的

雇主招实习生看潜力天赋,不看现成技能,就像招Opus 5,聪明但当前做不了太多事,雇主负责培养;招不愿适应变化的资深员工像招GPT-3,已经不好用了

作为雇主,我还是会聘用人类实习生。但实习生从一开始就得明白我们为什么聘用他们。

我们聘用实习生看的是潜力、天赋、原生脑力,不是当前的技能,不是已经能做什么事,也不是过去的经验。

聘用饥渴又有天赋的实习生就像聘用 Opus 5,很聪明,现在什么都做不了,但我们的工作就是用良好的训练赋能他们。

聘用不愿意适应变化的资深员工就像聘用 GPT-3,在它的时代很好,但不会成长,反应慢,现在没用了,可能该去放牛了。

不过所有人都会自称自己聪明有天赋,尤其是那些从来没见过真正有天赋的人长什么样的人。所以我们雇主该怎么寻找这些有天赋的人呢?

🧠 IQ测试
🧩 Leetcode 测试
🎓 找前三名大学的毕业生,因为能进前三大学已经经过IQ测试,而且很大概率已经见过比自己更有天赋的人
🥇 找黑客马拉松的获胜者

在 X 看原帖 ↗
5.3K811937
深度观点 · @ErikVoorhees▲ 4.0万

对中国开源大模型有顾虑?换个地方就能用

不少人误以为中国公司训练的开源模型,只能由中国公司运行。其实只要愿意,任何人都能运行它,不想用中国节点可以选其他来源。

有一个误区:中国模型都是由中国公司在中国运营的。人们因为不信任中国司法辖区,所以对使用这类「开源」模型心存犹豫。

实际情况是这样的:前沿闭源模型由开发它们的公司运营。

• GPT 5.6 由 OpenAI 训练和运营
• Opus 5 由 Anthropic 训练和运营

但开源模型可以由任何人运营。

• Kimi K3 由中国公司 Moonshot 训练
• Kimi K3 由 Moonshot 运营
• Kimi K3 **也可以由其他任何人运营**(任何公司都可以运行它)

如果你从[原文此处缺漏]访问 Kimi K3,你的推理请求会来自中国公司 Moonshot。但你也可以从例如[原文此处缺漏]访问 Kimi K3,这种情况下,没有中国公司参与它的运营,也不会接触它存储的数据。还有数十家其他机构也提供 Kimi K3 服务。

所以如果你想要这个开源模型,但对中国司法辖区有顾虑,直接换一个来源用就可以了。

在 X 看原帖 ↗
4.0万5852465
深度观点 · @TheAhmadOsman▲ 3.9万

免费可下载的Kimi K3,让 Anthropic 千亿估值说不通?

有人提出观点,可免费下载的Kimi K3存在,让 Anthropic 1万亿美元的估值失去了逻辑支撑。

知道 Anthropic 为什么讨厌开源 AI 吗?

可免费下载的 Kimi K3 已经让他们 1 万亿美元的估值站不住脚了。

在 X 看原帖 ↗
3.9万881.2K83
深度观点 · @chrispisarski▲ 2.0万

YC创始人抢着招的人,居然靠Claude干几十份活

用Claude和少量外部API搭建的内部工作流,成本远低于现成销售工具,还能完成几乎全流程的销售和增长工作。能懂全销售周期、会用Claude的人,现在一票难求。

阅读全文 →
2.0万4171377
深度观点 · @GergelyOrosz▲ 6.1K

AI未来会像算力一样,分云端本地两条路

AI正慢慢走向商品化,未来会和算力发展路径高度重合,按需选择不同部署模式

我完全同意,我认为这和AI+算力的相似之处比其他任何领域都多。

而算力要么是云(当你想要易用性+可扩展性时),要么是本地(当你想要控制权,你在做 tinkering,或是当规模太大用云太贵时)。

AI正(缓慢地)走向商品化。

在 X 看原帖 ↗
6.1K4396
📌 其他
工具产品 · @RoundtableSpace▲ 4.2万

在Claude Code里绕开AI写代码的隐形坑

这套对抗审查流程能在你发布代码前,揪出之前没发现的隐藏bug。四个步骤明确过滤漏网的问题。

在 Claude Code 中部署对抗性审查循环,可以在发布前捕获静默错误:

- 干净上下文:在全新会话中审查代码,消除生成时的自我防御偏见。
- 跨模型审查:使用不同模型家族进行审查,避免重叠的推理盲区。
- 严格评分规则:强制执行清晰的严重等级划分(严重错误 vs. 细枝末节)来消除干扰信息。
- 二元测试:将 AI 审查与不通过的测试套件结合,进行客观验证。

在 X 看原帖 ↗
4.2万45620
实战经验 · @connect24h▲ 2.8K

让AI写代码之后,人最该补什么能力

让AI做开发越多,不同人设计能力的差距越明显。在让Claude Code或Cursor写代码前,先明确3条架构要求,记下取舍原因,能把评审从个人偏好变成风险验证。AI时代,比练写代码更急的是练做决策。

越是把编码工作交给AI,人与人之间设计能力的差距就越是明显。老实说,没学好这部分就去做AI驱动开发,太悬了。

《软件架构基础 第2版》一共27章,超过500页。它能帮你把8种以上的架构风格吃透,不是给你一套正确答案,而是给你提供权衡取舍的判断依据。我读的时候,深深被点醒:原来我自己做设计评审一直太依赖经验法则了。

在让 Claude Code 或 Cursor 写代码之前,先把需要遵守的架构特性压缩到3个,把选择理由和放弃的选项都记录进 ADR 里。这么做之后,设计评审就会从各说各话的喜好争论,变成对约束条件和风险的验证。

请把这条保存下来,下次项目开始设计前,试试这个方法。AI时代,比起锻炼「怎么写代码」,锻炼「为什么这么决定」才是当务之急。

#AI驱动开发
来源:

在 X 看原帖 ↗
2.8K46759
教程 · @Crypto_Pranjal▲ 1.7万

零成本零代码制作免费AI视频赚 affiliate佣金指南

分步教你制作免费AI视频并推广赚 affiliate佣金

完整分步指南:如何制作免费AI视频,将它们发布到所有平台,赚取 affiliate 佣金。不需要编程,不需要成本,不需要购买课程。完整拆解见下文。

在 X 看原帖 ↗
1.7万36244456
商业 · @SouthernMB82▲ 1.3万

美田纳西州施耐德用纳税人资金雇佣外籍AI职员引争议

施耐德 Electric拿美国田纳西纳税人资金,弃本土人才雇外籍AI从业者

阅读全文 →
1.3万7428611
开源 · @AYi_AInotes▲ 5.3万

月之暗面全栈开源2.8T参数Kimi K3大模型

月之暗面全栈开源Kimi K3大模型,性能摸到闭源顶尖门槛

阅读全文 →
5.3万31246195
开源 · @Mechramc▲ 3.2K

零基础转AI研究开发者出版新书 开源泰语大模型将发布

项目管理者零基础转行AI研究,两年后出书创开源项目

阅读全文 →
3.2K12123119
设计工具 · @mckaywrigley▲ 1.1万

开发者mckaywrigley评价Claude Design是当前最被低估AI产品

开发者mckaywrigley称,Claude Design搭配Opus 5彻底改变了他的开发工作流程

开发者@mckaywrigley在𝕏表示,Claude Design是目前最被低估的人工智能产品,没有之一。它是一款面向所有人的世界级设计工具。这个周末他将Claude Design与Opus 5搭配使用,彻底改变了自己的开发方式。

他认为这款产品非常出色,知名度本应达到现在的一百倍。

在 X 看原帖 ↗
1.1万114179
本地AI · @minchoi▲ 5.8K

多款16GB笔记本可本地运行私有AI 无需订阅

无需API密钥,初始下载后可离线运行,查询和回答都留在设备,无按次API费用

阅读全文 →
5.8K73938
大语言模型 · @davis7▲ 3.4K

用户评测Claude Opus 5:越使用好感度反而下降

用户列出Opus 5的多项优缺点,提及存在异常行为,无法替代Fable模型

阅读全文 →
3.4K1475
效率工具 · @0xkkai▲ 3.5K

用Claude自动整理AI研究论文无需手动跟进

开发者分享自动整理AI论文摘要的无人值守系统,搭建完成后可自动运行

昨天有朋友问我,怎么跟进AI研究进度,又不会被海量论文淹没。

我打开了一个几周没碰过的文件夹,展示给朋友看里面的内容,这里存放了11天我从没主动要求生成的论文摘要。每一份摘要都标注了日期,拆解了最新发表的论文,每份末尾都只有一句话,说明这篇论文的实际价值。我坐在那里翻自己存的这些内容,感觉就像在看别人的存档。

这个文件夹完全依照Andrej Karpathy描述的模式搭建,由Claude读取最新来源,提取关键内容,撰写清晰摘要,再按日期归档。不需要输入指令,也不需要设置提醒,它每天早上会自动运行。我只搭建了一次,测试了两次,之后就完全忘了它的存在。

朋友问我,那这些摘要你都会读吗?我大部分都没打开过,我也不需要打开,这套系统已经找出关键内容,用一句话告诉我了。

很多人花了好几年找完美的提示词。最终的答案,其实是一个能自动编译内容、永不停更的文件夹。

完整架构、所有提示词与指令都放在下方文章里。我会在自己身上测试这类工具,再分享结果。想了解后续内容可以关注@0xkkai。

在 X 看原帖 ↗
3.5K66147
开源 · @sideb_01

Linux内核经典著作《深入理解Linux内核》英文PDF免费公开

用户@sideb_01在𝕏分享了这本经典技术书籍的免费下载链接,可直接访问获取

这是用户@sideb_01在𝕏发布的分享,Linux内核领域的经典名著《Understanding the Linux Kernel》的英文版本PDF已免费公开。

这是面向对Linux内核感兴趣读者的经典技术资料,有英文阅读基础的读者可以免费获取阅读。

分享者附上了公开的PDF链接,表示计划逐步阅读,并整理输出学到的内容。链接地址为:https://www.cs.utexas.edu/~rossbach/cs380p/papers/ulk3.pdf

在 X 看原帖 ↗
AI开发 · @bubbleboi

开发者从头重写Kimi线性算法验证闪存状态卸载

开发者在PyTorch中从头重写kimi linear,测试循环状态卸载到闪存是否可行

一名开发者在社交平台𝕏分享了自己的测试过程。他先完成全部数学推导,再在PyTorch框架中从头重写了kimi linear。

重写完成后,他测试了将循环状态卸载到闪存这一方案是否可行。

测试完成后,他清仓卖掉了持有的全部闪存相关股票。

在 X 看原帖 ↗
大语言模型 · @Xudong07452910

Modular推出大语言模型推理手册 附可视化工具

手册讲解大模型推理核心技术,帮助理解推理系统性能差异

同一大语言模型更换推理系统后,速度、延迟和成本会出现极大差异。Modular近期整理发布了《大语言模型推理手册》,可以解答这类疑问。

手册内容覆盖首Token延迟、吞吐量、显存计算,还讲解了模型与GPU选择、量化、连续批处理、KV缓存(KV Cache)、投机解码、预填充/解码分离以及分布式部署。

手册包含多款可直接操作的可视化工具。使用者可以计算不同模型所需的显存容量,观察上下文长度增加后KV缓存的膨胀过程,还能直观理解并发量升高后系统瓶颈快速转移的原因。

很多AI演示单用户运行速度很快,落地到实际产品后,却会被排队延迟、显存占用和长上下文问题影响性能。难点是在延迟、吞吐量、稳定性和成本之间找到平衡。

模型能力决定产品的上线边界,推理基础设施决定产品能否稳定、低成本地服务大量用户。

在 X 看原帖 ↗
AI编程 · @austinit

开发者验证:纯氛围编码也能靠编程赚钱

开发者austinit分享,完全用AI编程可产出可赚钱产品,但开发难度下降同时竞争大幅加剧

开发者austinit在X平台分享了一个问题:完全靠Vibe Coding(氛围编码)能赚到钱吗?他给出的答案是肯定的,称这是自己近期完全依靠AI编程开发出的新产品。他表示,用AI开发产品的构建难度比原来降低了10倍,也就是开发速度和便捷程度提升10倍。

但同时,市场竞争的激烈程度比原来增加了超过100倍。相关项目链接已公开在分享内容中。

在 X 看原帖 ↗
营销 · @codyschneider▲ 1.6万

GTM工程搭建全自动化AI营销竞品分析广告投放流程

介绍一套基于多AI工具的自动化营销分析投放工作流

阅读全文 →
1.6万8237530
独立开发 · @rionaifantasy▲ 6.5K

开发者用Claude做开放世界游戏,调整变现方式获更高收益

分享AI辅助项目开发后通过用户模拟测试调整变现方案的经验

阅读全文 →
6.5K44523
加密货币 · @0xPoseidon_sol▲ 5.5K

加密套利者使用OpenAI Codex一晚赚取数百美元

不会代码的加密套利者用AI模型Codex完成套利,一晚获利数百刀

不会代码的套利人真的应该把Codex/Claude的什么AI模型学起来,昨天下午看到有一个小小的套利机会,用Codex搓了几个小时慢慢调教以后放着睡觉了。 一晚上帮我赚了几百刀,这种正反馈给人的激励太足了。。

在 X 看原帖 ↗
5.5K23935
工具 · @siwusuAI▲ 1.6万

博主分享国内AI工具WorkBuddy体验,看好本土化下沉市场

海外AI博主初体验国内AI工具WorkBuddy,分享行业感受

阅读全文 →
1.6万65067
大模型 · @Hoyooyoo▲ 1.5万

个人实测大模型总结经验:规避蒸馏模型优选大牌正版

博主实测大模型后分享使用选择经验,看好开源通义千问

折腾了一轮大模型,感觉又被遥遥领先骗了。我总结的经验就是:蒸馏出来的大模型还是尽量规避,付费使用还是选大牌正版比较好。当然像qwen 这种开源免费本地部署的LLM很可以的。

遥遥领先的营销宣传可以用在高客单价、低频的汽车,用在按token付费的LLM不是扯淡吗?

在 X 看原帖 ↗
1.5万1396
大语言模型 · @trevin▲ 1.1万

开发者反映Claude Code限制子代理调用功能失效

一位开发者在𝕏向Anthropic员工反馈,新系统指令导致生成子代理的技能无法正常运行

一位名为trevin的开发者在𝕏公开喊话Anthropic员工bcherny及其他相关人员。他开发的代理在Claude Code中调用需要分派子代理的技能时遇到了严重问题。

据trevin说明,Claude Code当前的系统提示中新增了一条指令,几乎覆盖了所有让子代理正常运行的尝试。
这条指令内容为:除非用户主动提出要求,否则禁止调用AgentTool(代理工具)。

原本设定为“生成子代理”的技能,现在甚至不满足触发条件,完全无法正常工作。

在 X 看原帖 ↗
1.1万27815
游戏开发 · @Rubzem▲ 3.3K

用户Claude Opus 5单次提示生成《使命召唤》风格FPS游戏

该AI从零开始仅用30分钟就完成完整8v8多人FPS,开发者和好友连续游玩数小时

Claude Opus 5通过单次提示,生成了一款完成度极高、功能完整的《使命召唤》风格第一人称射击(FPS)8v8多人游戏。AI从零开始搭建出整个游戏,全程仅花费30分钟。

生成完成后,发布者已经和多名好友在线对战数小时,所有人都停不下来。仅通过一段提示就能生成游戏,还能立即和朋友一起游玩,让人们窥见游戏开发的未来方向。

提示词和验证内容已经放在评论区,文中也附上了体验链接和提示词链接。

在 X 看原帖 ↗
3.3K75644
AI开发 · @cat88tw▲ 1.7K

开发者分享一周开发agentflow的工具使用体验

开发者对比四款AI编码工具,提出 Claude Code + GPT-Sol 强强联合方案

开发者分享了近一周开发agentflow的三点使用心得。Claude Code CLI 这款智能体工具成熟度极高,使用体验极佳,相比之下Codex CLI仅能达到它七成的水平。GPT-Sol模型编码功底扎实,能一次性完成任务,表现远优于Fable模型。

从补贴角度计算,GPT的补贴倍数为70倍,Claude的补贴倍数为40倍。由此可以得出当前的最优工具搭配方案。用中间层转接Claude Code和GPT-Sol,实现两款工具的优势结合。

个人每月将花费100美元订阅GPT服务,花费20美元订阅Claude服务,从八月起就会按照这个方案使用。

在 X 看原帖 ↗
1.7K377

📖 深度解读

精选文章的中文编辑重写 · 按更新时间排列

▲ Top
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部