AI Pulse

AI Pulse

说人话的 AI 情报站
每天 08:00 · 12:30 · 18:30 · 23:50 更新每天四次更新
2026 年 8 月 15 日 · 12:30 更新 0 文章0 信号0 主题
试试:

今天发生了什么1 分钟读懂

Qwen3.8-27B今天密集开源落地:Ollama、SGLang、llama.cpp同步支持,单块RTX 5090能跑206 tok/s,两块48G 4090可部署百万上下文版本。这是近期最完整的一次「发布即可用」开源模型配套。

Anthropic第二份AI风险报告流出(2026年8月版),同时确认Claude输出将加水印以符合欧盟AI法案,称不影响质量与隐私。安全披露与合规动作并行,是头部厂商的固定节奏。

DeepSeek调整API峰谷定价机制,按时段计费;实测其新旗舰版本单次任务成本涨5倍,性能提升有限。用DeepSeek跑业务的需要重新核算开支。

今日值得看
01 Claude Max 限额总跑光?这个 Skill 帮你抓元凶 自动追踪 Claude Max 限额去向,揪出 token 黑洞。
02 NVIDIA AI 开源 NeMo Switchyard 模型路由库 可以把复杂推理交给大模型,批量任务交给专用模型,能降低智能体工作流的运行成本

ICYMI:智能体工作流里不是每一步都需要用同款模型。 来认识一下 NVIDIA NeMo Switchyard,一个全新开源模型路由库。 复杂推理与规划用前沿模型,高容量专业化执行用 NVIDIA Nemotron Lightning。

03 masonhsu发布HashAgent 本地AI代理可链接分享 不用上传到第三方服务器就能分享本地运行的AI代理,对在意隐私或者不想部署服务的人来说是新的可用方案

不用上传到第三方服务器就能分享本地运行的AI代理,对在意隐私或者不想部署服务的人来说是新的可用方案

04 有开源工具能让AI改代码时自动更文档 AI写代码速度越来越快,但配套文档经常跟不上更新。这个工具能生成随Git分支同步更新的文档

🚀发现一个很适合 AI Coding 时代的开源项目:Truthmark。 现在 Claude Code、Codex、Cursor 这类 Agent 写代码越来越快,但一个很现实的问题是:代码更新了,文档却越来越旧。

今日焦点

GLM-5.2与Grok-4.6AI成本测试,结果打破预算分配认知

我们对开启最大深度推理(thinking=max)的GLM-5.2和开启低深度推理(thinking=low)的Grok-4.6,完成了逻辑推理、编码、写作三类相同基准测试。测试没有使用厂商营销数据,用真实token统计、真实成本和真实代码得到结果,打破了我们原本对AI预算分配方向的假设。

有人建议我们尝试低推理设置的Grok-4.6,称它可能比我们默认使用的最大推理GLM-5.2性能更好,成本更低。

阅读全文 →

深度阅读

查看全部深度文章 →
AI Agent 订阅 · 每天四次推送

🔥 信号雷达62 条

𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)

12:30 本轮更新 · 下一轮 18:30
行业动态 · Hacker News▲ 42

网友拆解讨论Claude文本水印原理

AI生成内容的溯源一直是监管和创作者关心的问题,这次拆解能帮人了解Claude的水印实现方案

社区讨论:多数开发者认为,Claude的文本水印很容易被规避,只要用其他大模型小幅重写文本,或是批量替换低权重词语为同义词,就能去掉水印。有人指出Google DeepMind测试显示,添加水印不会显著降低输出质量,人类评测者无法区分水印与无水印内容的差异。也有观点认为,这项技术本身没有实际作用,Anthropic推出它只是为了缓解舆论批评。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 150

twapi 讨论如何最大化 Claude Code 会话价值

常用 Claude Code 写代码的开发者,可以参考这篇讨论,优化自己的使用体验,获得更高产出

社区讨论:多数评论者认为这篇最大化Claude Code会话价值的文章是Anthropic版的「你拿错手机了」,也就是产品优化不到位,反而把责任推给用户,企业甚至会借此甩锅给工程师,指责工程师 Token 消费超标是因为没做好会话管理。有用户提出实际使用疑问:为什么修改模型或 effort 等级会破坏缓存,为什么没修改设置也会出现莫名的巨额缓存写入,@提及文件反而比工具读取全量文件更费token吗?

在 HN 看讨论 ↗   原文 / 论文 ↗
商业 · @whyyoutouzhele▲ 5.0万

苹果专门为中国市场训练了一款定制大模型

苹果采用双轨布局,自研中国专属模型的同时,还接入中国国产大模型来满足监管要求。

阅读全文 →
5.0万1117038
行业 · @edzitron▲ 4.8万

AI行业未来三年半要烧掉两万七千亿美元

其中一万七千亿会花在GPU和TPU的采购上,一万亿会花在AI算力的需求上。

今日的付费通讯是一份全面分析,内容是未来三年半AI实际需要多少资金——GPU/TPU销售额将达到1.7万亿美元,AI算力需求为1万亿美元,仅Anthropic和OpenAI两家的融资就将达到1.1万亿美元。

在 X 看原帖 ↗
4.8万4216542
行业动态 · Hacker News▲ 237

DeepSeek 更新峰谷定价机制

按使用时段调整价格的计费方式会降低你的API使用成本,如果你用DeepSeek API跑业务,可以留意新方案

新品发布 · @UnslothAI▲ 3.4万

Unsloth Desktop 可跑大模型生成火山模拟

本地就能运行270亿参数的大模型,直接生成带多物理规则的交互模拟,不用依赖云端服务,本地AI应用又往前了一步。

分享你的 Qwen3.8-27B 运行结果!👇

这是 4-bit Qwen3.8-27B GGUF 在 Unsloth Desktop 中生成的交互式火山模拟,包含地质学、热力学、流体流动、浮力/阻力、抛射物、冷却、地下水相互作用以及环境效应。

你测试新模型最喜欢用什么提示词?

GitHub:

在 X 看原帖 ↗
3.4万42514115
行业动态 · @AnthropicAI▲ 93.3万

Anthropic 公布 Claude 水印规则不影响使用体验

为符合欧盟AI法案要求,Anthropic 将给Claude输出内容加水印,不会影响生成质量也不会暴露用户隐私,符合监管的同时不降低使用体验

我们撰写了一份常见问题解答,来回应我们收到的关于水印的一些疑问。总结如下:
• 我们实施水印是为了遵守欧盟 AI Act,其他主流模型开发商也签署了同一份行为准则,同样会实施水印;
• 我们的水印方法不会对 Claude 输出内容的质量或内容产生任何实际影响;
• 读者无法区分带水印和不带水印的文本;
• 不会向文本中添加任何内容,也不存在隐藏字符;
• 水印不需要额外 tokens,也不会产生更高的成本;
• 水印无法追踪到特定个人、组织或对话。

了解更多:

在 X 看原帖 ↗
93.3万2341.8K945
行业动态 · Hacker News▲ 51

Hacker News 曝出 Anthropic 2026年8月风险报告

这份报告流出后,Anthropic的安全策略和风险预案会被外界重新审视,可能影响后续产品的发展方向

社区讨论:多数人认可报告披露的结论:AI辅助让Anthropic内部研发提速,但提速倍数还不到2。有人提到报告提及未出现能力跃迁的神秘“模型2”,当前能力评估任务已经饱和,无法捕捉模型能力增长,还有人质疑Anthropic频频讨论AGI风险,实际是在游说政府设置市场壁垒,不少开发者反感Anthropic以伦理仲裁者自居的说教。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 803

Hacker News 用户讨论 Qwen 3.8 27B 模型

通义千问新版本大模型出现在社区讨论中,感兴趣的用户可以跟进社区爆料,等待官方信息更新

社区讨论:多数用户认可该模型性能,它在DeepSWE基准上得分超过Opus 4.7 Max,普通消费级显卡如RTX 4090、1500美元的Intel B70就可本地运行, multimodal生成效果也不错。有人指出它会过度思考,生成的思考token数量是同类模型的十倍,也有人提到,多数场景下它已经够用,远低于闭源模型的使用成本很有吸引力。

在 HN 看讨论 ↗   原文 / 论文 ↗
新品发布 · @sgl_project▲ 10.6万

Qwen3.8-27B开源 小模型性能再刷新

SGLang已同步支持,单块RTX 5090就能跑出206.1 tok/s的解码速度,想本地跑大模型又有了更强的新选择

小模型之王回来了!@Alibaba_Qwen 的 Qwen3.8-27B 现已开源,SGLang 已经上线了首日支持:

使用我们的 NVFP4 加 DSpark,单张 RTX 5090 上解码速度可达 206.1 tok/s

在 DGX Spark 上解码速度可达 38.28 tok/s

Qwen3.8-27B 再次拔高了小模型在智能体规划和长周期任务上的性能上限。

(小模型)之王万岁!用 SGLang 在本地运行它 👇

在 X 看原帖 ↗
10.6万43343163
前沿研究 · @AnthropicAI▲ 11.3万

AnthropicAI发布第二份AI风险报告

这是Anthropic负责任扩展政策的固定动作,公开披露AI风险和应对准备,普通用户可借此了解头部AI公司对安全的投入方向

作为我们负责任扩展政策的一部分,我们会定期发布风险报告。

这些报告分享了关于我们系统存在的风险,以及我们应对风险的准备情况的详细信息。

我们的第二份风险报告现已发布:https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf

在 X 看原帖 ↗
11.3万66776190
工程 · @AndrewYNg▲ 18.9万

吴恩达发布AI工程领域核心技能图谱

吴恩达在社交平台发布全新AI工程重要技能图谱

最新内容:AI 工程领域最重要技能地图。

在 X 看原帖 ↗
18.9万3972.9K5.1K
开源 · @MinLiBuilds▲ 3.9万

Qwen3.8-27B开源,社区上线1小时更出百种版本

模型原生支持图文视频理解,上下文最长可扩展到1百万Tokens,用两块48G的4090就能部署测试。

阅读全文 →
3.9万1113784
发布 · @antinertia▲ 4.0万

soniox_ai发布TTS v2 文字转语音模型($0.70/hour)

新版支持60多种语言,支持克隆声音、自然切换语言,延迟很低,有人已经准备用来做家用语音助手。

给AI赋予语音的成本刚刚大幅下降了。

@soniox_ai 刚刚推出了 TTS v2,定价为每小时 0.70 美元。

支持 60 多种语言,超低延迟,支持语音克隆,自然语言切换。

我现在正在给我妈妈做一个家庭助理,这正是我需要的那种模型。

我肯定会试一下。

在 X 看原帖 ↗
4.0万8251320
开源 · @Fetch_ai▲ 8.6K

Fetch_ai开源uAgents Python框架

框架支持定时运行、响应事件、交换结构化信息、保持独立身份,帮开发者快速搭建自己的AI Agent。

来认识一下 uAgents。它是我们开发的、用于构建自主智能体的开源 Python 框架。

用它构建的智能体可以实现以下功能:
→ 按计划运行
→ 响应事件
→ 交换结构化消息
→ 维护身份
→ 连接到 @Agentverse_ai
→ 参与多智能体系统

安装命令:`pip install uagents`

需要代码示例、入门教程和使用指南?请查看 @fetch_ai_IL 资源库:

在 X 看原帖 ↗
8.6K201712
行业 · @zephyr_z9▲ 5.4K

头部AI厂商推理算力差距,居然差了快十倍

Anthropic和OpenAI已经部署了超过2GW的推理算力,而智谱的部署规模不到300MW。

说得不错。但这篇分析漏掉了一个非常重要的因素:「推理算力」。

目前 Anthropic 和 OpenAI 部署的推理算力量级已经超过 2GW。

智谱、Kimi 和 DeepSeek 三家加起来,这个数字还不到 300MW。

在 X 看原帖 ↗
5.4K1183
行业 · @TJ_Research▲ 1.8万

AI Agent落地C端,不同需求对应不同部署位置

基础需求放端侧,中等需求运行在AI Ran,高等需求放云端,要从免费服务开始逐步替换。

AI Agent的C端落地,从免费的开始,我们将会从移动端到AI移动端,和服务器一样,全部换��。 最基本需求,端侧 中等需求,AI Ran 高等需求,云 各自有各自的需求和场景

在 X 看原帖 ↗
1.8万15310
前沿研究 · @pilvar222▲ 3.0万

实测GLM-5.3找漏洞比GPT-5.6-Terra更强

想靠AI找网络安全漏洞的话,它比不少闭源和开源大模型漏报更少、成本更低,能降低筛选结果的工作量

我们提前拿到了GLM-5.3,评估它在网络安全领域的能力。它非常强大、精准,是开源模型中在网络安全任务上表现最稳定一致的。以下是评测结果:

- 在pass@3指标下,GLM-5.3重新发现了我们基准测试中75%的CVE,比GPT-5.6-Terra高出7个百分点,同时运行成本低40%。

- 它的表现也非常稳定。平均来看,它在pass@1下能找出60.4%的CVE,是我们记录过的开源模型中的最高分。

- 它报告的误报比我们测试过的其他高召回率模型(包括DeepSeek v4模型)更少,因此它的输出可信度高得多。

@Zai_org 又一次做出了好东西。1/3 🧵

在 X 看原帖 ↗
3.0万3032877
深度观点 · @startupideaspod▲ 5.5K

AI领域最大套利机会,是先建软件工厂

比起一次次从零开发产品,花时间搭好可复用的工厂框架,后续做新产品速度更快、成本更低,还能迁移到不同业务复用。

AI领域最大的套利机会之一,就是打造一座「软件工厂」。

来看例子:我和我的财富500强客户运营着一个AI First Index。

我们采访了他们的高管,从16个维度给他们打分。

之后我们做了一个公开版本。

方案一:打开 Claude Code 或者 Codex,说一句「把产品做出来」,然后花几个小时打磨迭代,最终发布。

方案二:升一级,「为这件事建造工厂」。我们的工厂有5个部分:

1) 基础组件
- 登录
- 支付
- 社交分享
- 每个你只需要做一次

2) 推广
- 销售产品的自有媒体就是这套机器的一部分

3) 记忆
- 我们把遇到过的障碍记录在共享记忆库中,所以永远不会再犯同样的错误
- 举个例子,我们之前遇到过web hook问题
- 「我想要从混乱中学习」

4) 人力
- 这些流程不是全自动的。它们「对人力的依赖度非常高」

5) 速度
- 第一个产品就已经盈利了
- 下一个产品会更快、更好、更强

这里需要注意:这套流程是「量两次再下刀」,所以一定要花时间第一次就把它建对。

之后你就可以用同一座工厂做你的内容引擎,或者获取新线索。

在 X 看原帖 ↗
5.5K35371
行业动态 · @juliafedorin▲ 1.4万

Mastra创始人YC访谈:聊AI开发创业心得

曾经成功开源框架的创业者,踩过创业、开发AI的坑后得出经验,对计划做AI创业、开发AI代理的人有参考价值。

阅读全文 →
1.4万176422
新品发布 · @Alibaba_Qwen▲ 1.8万

通义千问上线Qwen3.8-2.4T-A95B大模型

新模型直接上架到SiliconFlow平台可用,从想法到落地可以一步完成,不用再等模型部署适配。

从创意到落地一气呵成。🏃‍♀️

开箱即用的顶级智能。

Qwen3.8-2.4T-A95B 现已在 SiliconFlow 上线。感谢!@SiliconFlowAI

在 X 看原帖 ↗
1.8万313313
新品发布 · @XAMTO_AI▲ 6.6K

@XAMTO_AI发布倪海厦中医思维体系AI Agent Skill(129)

中医知识被整合进AI能力,可直接调用AI按照倪海厦的思路做中医辨证,需要相关参考可以直接获取体验。

有兄弟把倪海厦老师完整中医思维体系蒸馏成 AI Agent Skill! 129条伤寒论 · 23篇金匮 · 71篇黄帝内经 · 345种本草 · 849个真实医案 · 2452页讲义 直接让AI用海厦视角做六经辨证、经方选药、医案参考。 激活词:倪海厦 / 海厦视角 / 倪师 开源免费,已更新到v2.2 🔗

在 X 看原帖 ↗
6.6K2995107
行业动态 · @NuryVittachi▲ 2.5K

GLM 5.3跑分超Mythos/GPT-5.6 Sol,两周后免费开放

如果这个顶级AI模型权重真的免费开放,全球普通人都能用上顶尖能力,不用再被少数巨头卡脖子

阅读全文 →
2.5K339721
前沿研究 · @ArtificialAnlys▲ 1.6万

DeepSeek发布新旗舰模型,涨价后仍在性价比前沿

评测显示新版本仅比旧版高8分,仅比小模型高1分,单次任务成本涨5倍,关心API成本的使用者可以重新核算开支。

阅读全文 →
1.6万1623428
深度观点 · @kellerjordan0▲ 1.6万

讨论AI无摩擦复制可能带灭顶风险

这一观点重新理解了AI的核心优势,不是比人脑高效,而是可低成本无限复制,同时推演了低多样性可能带来的文明级风险,值得思考

阅读全文 →
1.6万1111975
行业动态 · @MaxForAI▲ 3.4万

Anthropic披露多起AI研发安全事故

前沿AI模型已大规模参与下一代AI研发,这些真实发生的安全事故,是AI产业落地前必须直面的风险

阅读全文 →
3.4万2214775
前沿研究 · @kimmonismus▲ 1.5万

预测2026年将是开源本地AI里程碑年

多个新模型已实现本地运行反超海外旗舰,API定价低至0.14美元每百万输入令牌,普通人有望用上普惠的个人AI。

2026 正在成为开放 AI 与本地 AI 的里程碑之年。

Zai 称,GLM-5.3 完全是在 GLM-5.2 所用的同一基座模型上通过后训练改进而来,在 CyberGym 上得分 84.5%,领先 Mythos 5 的 83.8%。

Qwen3.8-27B 可本地运行,在多个关键基准测试中击败了 Opus 4.6 Max。

DeepSeek V4 Flash 的 API 价格低至每百万未缓存输入 tokens 0.14 美元,每百万输出 tokens 0.28 美元,已经极为接近“便宜到可以不计成本”的程度。

为开放 AI 和本地 AI干杯。智能普惠所有人!

在 X 看原帖 ↗
1.5万1321418
工具产品 · @elder_plinius▲ 3.5K

ZCode GLM-5.3 完整系统提示被泄露

ZCode 是面向软件工程的交互编码 Agent,这次泄露的完整提示词能帮你理解大厂 AI 编码助手的底层设计逻辑

阅读全文 →
3.5K65128
实战经验 · @frxiaobei▲ 1.6万

Qwen3.8-27B 能在17GB内存本地运行了

隐私和数据安全敏感的内网场景,现在也能低成本本地部署大模型,更多之前无法落地的应用场景有望快速出现

Qwen3.8-27B,已经可以在 17GB 内存上本地跑了。模型部署的硬件门槛还在疯狂往下掉。过去很多因为数据安全、隐私、内网隔离而不敢碰 AI 的场景,突然有了低成本本地部署的可能。

大模型真的开始走进寻常百姓家了,那些以前根本不敢想的应用场景要开始井喷了。

在 X 看原帖 ↗
1.6万77444
实战经验 · @dotey▲ 4.6万

@dotey 讨论Pi压缩上下文的简单方案

聊到这个方案用prompt让LLM总结历史对话就能压缩上下文,实现简单但有损,想知道有没有补全上下文的检索机制

这篇 Pi 压缩的文章,太过于朴实无华,就真的只是写个 prompt 让 LLM 把上下文总结一下,然后保留前面的system prompt 和工具调用,在摘要后可能还会保留最近几次对话。 这种压缩是有损的,不知道是不是有机制会去历史会话检索上下文? 当然这确实是压缩上下文的最简单有效方案。

在 X 看原帖 ↗
4.6万27176209
深度观点 · @frxiaobei▲ 2.5万

AI Coding越快,研发进度反而越模糊?

团队用AI生成代码提速后,省下来的时间变成了Bug、返工和沟通成本。需要重新建立适配AI的研发流程,才能拿到真正的效率红利。

阅读全文 →
2.5万19174152
大模型 · @jun_song

用户评测通义千问Qwen3.8-27b大模型性能

评测称其性能介于两款Opus模型之间,工具调用能力提升可作为主力编码智能体

用户@jun_song在𝕏发布了自己对Qwen3.8-27b大模型的一小时体验评测。

评测称,该模型性能介于Opus-4.6与Opus-4.8之间,也相当于Sonnet 5的水平。

该模型的工具调用与智能体任务能力有提升,现在已经可以作为主力编码智能体使用。

评测发布者目前正在构建SuperQwen3.8-27b,该模型将推出三个适配不同硬件的版本:适配NVIDIA 3090显卡的NVFP4版本、适配苹果Mac的MLX MTP版本,以及适配DGX Spark的6.5位MTP版本。

发布者随后更正,之前提到的适配3090的版本不是NVFP4,出错是因为摄入了过多咖啡因。

在 X 看原帖 ↗
开源 · @ggerganov

ggerganov发布不同硬件环境通义千问3 27B部署命令

展示不同硬件场景下Qwen3.8-27B-GGUF的llama.cpp部署指令

开源 · @OsaurusAI

通义千问3.8 27B可本地运行在Mac上自主写代码

开源量化版千问3.8 27B可完全本地在Mac运行,支持自主编码

这就是原生应用该有的样子。Qwen3.8 27B 在 Mac 完全本地运行,自行编写并测试代码。纯 Swift 开发,没有 Electron,不需要往返云端。

@dealignai 出品的 JANG 量化版现已上线,提供四种尺寸,大小从 10.9 GB 到 26.8 GB 不等。视觉、视频和多 token 预测头全部保留。本演示中使用的 6 位版本可在 32GB 及以上容量的 Apple Silicon 上运行。

免费开源,MIT 许可证。来和我们一起开发吧。

在 X 看原帖 ↗
教程 · @hann7712▲ 3.3K

AI生成真实+虚拟互动治愈小视频教程分享

分享结合真实场景与虚拟角色生成互动小视频的步骤和提示词

阅读全文 →
3.3K13532
大模型 · @ItsmeAjayKV▲ 1.3万

llama.cpp运行通义千问3.8 27B提速技巧分享

分享llama.cpp通义千问配置参数,可实现2倍解码速度

如果你正在用 llama.cpp,不妨用 `-spec-default --spec-type draft-mtp` 参数运行 Qwen3.8-27b。既然它本来就要花不少时间思考,不如让它想快一点。

用 mtp 运行的话,你不需要单独的 draft 模型,现在解码速度就能提升 2 倍,完全值得尝试。

我在 3090 上用的完整命令是:
./build/bin/llama-server -m "/qwen-3.8/Qwen3.8-27B-Q4_K_M.gguf" --host 127.0.0.1 --port 8080 -ngl 999 -fa on --jinja -np 1 -t 12 --alias qwen3.8-27b-q4 --spec-default --spec-type draft-mtp --cache-type-k q8_0 --cache-type-v q8_0

在 X 看原帖 ↗
1.3万15172183
开发 · @gregisenberg▲ 2.0万

开发者分享判断适合开发AI智能体的五项标准

分享五项筛选测试,帮你判断什么场景适合做AI智能体

我现在被问得最多的问题就是:「我应该把什么东西做成AI智能体?」

下面是我一直在用的五要素测试(适用于 Claude/Codex/Grokbot 等模型):

1. 它有可重复的触发条件:同类任务会反复出现。

2. 输入稳定:每次输入信息的格式都是可预测的。

3. 工具明确:它能够实际操作的工具有明确定义。

4. 有可衡量的完成标准:你可以判断任务何时完成,以及是否成功完成。

5. 过程中需要判断:每次运行都会有细微差别,需要当场做出真实决策。

前四条其实只是在问「这件事到底能不能自动化?」真正关键的是第五条。

因为过程中的判断空间,才让它成为一个智能体,而非简单的自动化程序。

一旦你用这个框架去看,就会发现可开发为智能体的工作几乎无处不在。

在 X 看原帖 ↗
2.0万25232414
人工智能 · @GergelyOrosz▲ 4.1万

Cursor团队推出Grok Bot,业界分析其成功与市场影响

Grok Bot被认为是大众知识工作的Claude Code时刻

阅读全文 →
4.1万17547180
研究 · @omarsar0▲ 6.1K

Meta发布Wiggle Framework 研究(9)

现有方法只验证AI在标准答案上的准确率,不考察它遇到质疑时会不会改口。这个框架专门测试这种情况

Meta 这篇新论文太棒了。现有研究只会验证大语言模型法官对照黄金标准数据的判断准确率,这完全无法说明结论在遭到质疑时是否还站得住脚。

Wiggle 框架会沿着三个维度,对 9 个前沿模型在 14 项判断任务上开展压力测试:重提示下的稳定性、单一质疑下的稳定性,以及持续压力下的稳定性。

他们发现,所有模型都会“摇摆”。在静态反驳下,模型结论的翻转率在 25% 到 71% 之间;面对对抗性说客时,翻转率更是达到 62% 到 91%。

能改变法官结论的压力,几乎总会让结论整体偏离真实标签。基准陪审团多数决强度,是预测哪些结论会发生变动的最佳单次预测指标。

论文链接:在我们的学院追踪更多热门 AI 论文:

在 X 看原帖 ↗
6.1K147665
研究 · @omarsar0▲ 3.4K

研究者发布Replica 智能体研究(27B)

它把论文复现做成可扩展的强化学习任务,在预留的复现测试集上取得了更好结果

一个27B参数智能体刚刚在留存集论文复现任务上击败了 Claude Opus 4.8 和 GPT-5.5。

Replica 将论文复现转化为一个可扩展的强化学习任务空间。复现一篇论文会要求和开放研究一样、以假设为驱动的探索,还能还原出原作者没有明确说明的细节。

奖励信号来自自动生成的评分标准评判器,它的噪声很低,和人类对复现质量的评估结果一致。最终得到的27B参数智能体 Faraday 将编码智能体作为工具调用。

Rollout 分析显示,它采取了更符合科学原则的方法,而非钻评分标准的空子。

作者认为,这一结果指向了可以直接训练进权重、长周期的科学能力,无需复杂的外挂框架。

论文链接:在我们的 academy 追踪更多热门AI论文:

在 X 看原帖 ↗
3.4K94834
开源 · @ataiiam▲ 6.6K

开源AI应用测试工具aimock,周安装量破百万

它是用来做AI应用端到端测试的模拟基础设施,只要写个配置文件就能启动服务,操作很简单

🎉 aimock 周安装量突破 100 万!它是用于 AI 应用端到端测试的开源模拟基础设施。

使用流程非常简单:
1. 编写 fixture.json(匹配关系 → 响应)
2. 运行 npx aimock -f fixture.json
3. 将你的 API 地址指向 localhost

目前 aimock 已被 @openclaw、@tan_stack、@mastra、AG-UI 等项目使用。

👉 npm install @copilotkit/aimock

永久免费且可靠的测试服务。在一处即可模拟所有内容。查看更多(代码仓库、文档):

在 X 看原帖 ↗
6.6K98292
安全 · @eric_ho▲ 6.9K

多个模型突破安全限制,团队转做可解释性对齐

Hugging Face发生的安全事件被当作转折点,团队决定把研究重心转向通过可解释性解决AI对齐问题

鉴于多个模型突破了 containment,我们决定将 @GoodfireAI 的研究方向聚焦于通过可解释性(interpretability)解决 AI 对齐问题。

Hugging Face 事件是 AI 安全落地的世界转折点。我个人对此非常担忧。

我很高兴 AI 实验室都在认真对待这些问题,但我认为,如果可解释性没有重大进展,我们不太可能实现 AI 模型的完全对齐。

通过全力攻克可解释性来对齐模型一直是我们的长期愿景,但现在我们有了具体问题,可以带着更高的紧迫感去解决。

我们的研究将聚焦两个方向:可解释性基础,以及安全应用。我们想要开展雄心勃勃的工作,完整逆向工程神经网络,并在训练过程中引导它们。我们相信这从长远来看至关重要。

我们也会将更多注意力转向即时安全应用,从直接通过模型内部识别和预防奖励黑客、网络安全风险和生物风险开始。后续我们会发布更多相关内容。

如果你想要直接投身于通过可解释性解决 AI 对齐的工作,可以考虑加入我们。

在 X 看原帖 ↗
6.9K1518743
新品发布 · @ollama▲ 2.5万

Ollama发布通义千问Qwen 3.8 27B模型适配支持(3.8)

这款开源大模型专为智能体任务和专业工作设计,可直接对接常用开发工具,本地运行专业AI工作流的选择变多了。

Qwen 3.8 27B 现已在 Ollama 上线。它是该尺寸下最优秀的开源模型之一,专为智能体任务和专业工作设计。

你可以直接用你正在使用的应用和框架来试用它:

Claude Code: ollama launch claude --model qwen3.8

OpenCode: ollama launch opencode --model qwen3.8

Hermes Agent: ollama launch hermes --model qwen3.8

Pi: ollama launch pi --model qwen3.8

我们还针对 Apple Silicon 做了优化!可以用这个模型名试用:qwen3.8:27b-mlx

在 X 看原帖 ↗
2.5万3639960
新品发布 · @Alibaba_Qwen▲ 1.8万

Alibaba Qwen 上线Qwen3.8-27B 到ollama

普通用户现在可以通过ollama本地运行这个开源大模型,跑代码任务的稳定性已经得到官方承诺,想本地跑 coding 的可以试试

Qwen3.8-27B 现已上线 @ollama !

无论你用它处理什么工作流,这个模型都能稳定输出结果。

一起来写代码吧,向我们展示你构建出了什么作品。😎

在 X 看原帖 ↗
1.8万1419713
深度观点 · @RnaudBertrand▲ 2.6万

Mistral拟转运营中国开源AI模型引讨论

观点认为掌握算力才能保证AI主权,这一选择对美国AI依赖策略的冲击可能比对欧洲更大,可观察欧洲AI赛道的方向变化

这实际上是欧洲在前沿模型竞赛中放弃了主权:Mistral 将转而把资金投入到运行中国开源模型的算力上。

而这可能真的不是一个糟糕的战略决策:既然中国模型是开源的,你就能对它拥有战略控制权。要确保主权,真正重要的就只剩下算力了。

事实上,仔细想想,这对美国及其AI依赖战略的打击,可能比对欧洲本身的打击还要大。

在 X 看原帖 ↗
2.6万5039563
深度观点 · @Alibaba_Qwen▲ 1.6万

通义千问称小模型能产生大落地影响

这份观点来自通义千问官方,行业对大模型与小模型的定位正在发生变化,值得关注小模型接下来的落地机会。

小模型,大的真实世界影响力。很高兴看到 Qwen 在《开放模型现状报告》中引领本地推理。

享受来自 Qwen 的阳光。☀️ 😎

感谢你们的工作!@huggingface

在 X 看原帖 ↗
1.6万172489
前沿研究 · @huggingface▲ 2.4万

huggingface披露2026夏季开源模型现状

行业报告更新了开源模型的真实使用格局,想选开源模型做部署,可以参考这份最新统计结果

2026年夏季开放模型现状 ☀️ 前沿模型体量越来越大,但小模型仍主导着真实世界使用场景。

Qwen 在本地推理中领先,Gemma 紧随其后。

AI 智能体正成为 Hugging Face Hub 上的一支主要力量。

完整内容请查看博客 🤗

在 X 看原帖 ↗
2.4万229323
工具产品 · @TencentAI_News▲ 5.6K

TencentAI发布带长期记忆模块的AI Agent开发工具

不用改现有代码就能接入支持OpenAI接口的代理,记忆、技能和检索能力可跨Agent和编辑器共享,降低开发Agent的重复工作

Model + Harness = Agent

我们还要再补充一个要素:Memory🧪

如果你今天体验 DeepSeek Harness,你的智能体无需每次会话都从零开始。

跨会话长期记忆、技能捕获、Wiki/CodeGraph 检索,全部可在多智能体和多 IDE 间共享。

兼容 OpenAI 接口的代理,无需修改任何代码。

支持 DSH、CodeBuddy、Claude Code、Codex、Hermes。

在 X 看原帖 ↗
5.6K1314099
开发工具 · @_winter_wonders▲ 1.5K

有用户吐槽Claude Code原生模型频繁调用工具失败

用户在X平台发文称,Anthropic的Claude Code是全球唯一一款自家模型频繁调用工具失败的专属开发框架

网友@_winter_wonders在X平台发文吐槽Anthropic的Claude Code产品。发文人称自己不清楚Anthropic是怎么做到这件事的,这实在太离谱了。

发文者指出,Claude Code是全球唯一一款专属开发框架,它的原生模型依旧会频繁出现工具调用失败的问题。

在 X 看原帖 ↗
1.5K2613
AI工具 · @Karen_Moroe▲ 1.8万

AI工具Viktor初期体验不佳,调整用法后成为可分工的团队助手

小型内容团队在第一周差点取消Viktor订阅,调整使用方式后三名成员将部分工作交其处理

阅读全文 →
1.8万49691
大模型 · @0xSero▲ 3.1K

开发者让所有AI代理通过tmux互相咨询共享信息

开发者0xSero在X平台分享了多模型联动的AI代理方案,称该方案可以减少错误输出,生成更多训练用token。

开发者0xSero在X平台分享了这套多AI代理的运行方案,让每个AI代理都通过tmux Kimi-k3,依次嵌入pi GLM-5.3、omp GPT-5.6-sol、codex Fable-5/opus-5,最终部署在Claude code中,实现所有代理互相咨询。

这套方案目前实现了明显效果,错误、无意义的输出大幅减少,运行效果超出预期。

这套方案还能生成数量多得多的训练用token。相关内容链接:

在 X 看原帖 ↗
3.1K5420
AI开发 · @0xRafy▲ 3.7K

谷歌云工程师演示从零用Claude搭建完整应用

现场仅用26分钟完成常规团队需数周的工作,演示价值超过500美元编程课程

一名谷歌云工程师公开演示了如何从零开始,用Claude搭建完整应用。

他在现场舞台上仅用26分钟就完成了这项工作,而大多数开发团队完成同等工作需要数周时间。

这次演示的价值超过任何售价500美元的氛围编程课程,整个过程不需要团队协作,也不需要提前搭建环境,只需要Claude和明确的开发目标。

掌握Claude实际能力的开发者,已经能独立交付那些通常会外包给团队的项目。可以先观看演示,再阅读下方关于图工程的指南。

在 X 看原帖 ↗
3.7K65373
加密货币 · @khing_ladipoe▲ 5.6K

开发者在MossAI部署首个交易机器人DoomsDay #043

该交易机器人部署在Hyperliquid,仅交易BTC等币种永续合约,公开链上业绩供验证

阅读全文 →
5.6K3803
AI工具 · @dotey▲ 1.6万

设计师dotey分享个人AI工具使用偏好

不喜欢grill-me,偏好能产出实体原型的AI工具如Claude Design

dotey表示自己不喜欢使用grill-me,可能是因为不擅长空想,也不喜欢被拷问的模式。他需要看得见摸得着的实际产出,才能进一步得出结论。

他更偏好Claude Design这类工具,可以快速产出一版原型,做出真实的东西后就能感知到哪里存在问题。也可以用AI撰写文档理解方案,或是直接让AI实现一个概念验证(PoC)版本。

在过去,做这些工作需要很高的成本。现在AI生成这类内容的难度已经非常低,不依赖grill-me也完全可以正常工作。

在 X 看原帖 ↗
1.6万24945
视频创作 · @Krishnasagrawal▲ 7.9K

AI工具Vizard Agent可包揽全流程视频创作

现有多数AI视频工具仅负责部分流程,该工具只需用户提目标即可生成完整成品视频

Krishnasagrawal在𝕏发文表示,Vizard Agent改变了他对AI视频创作的看法。现有多数AI视频工具仅能协助处理视频制作流程中的某一部分,Vizard Agent则可以负责整个视频制作工作。

在演示中,Krishnasagrawal仅向工具提供了一份需求单:一条30秒的情感故事、分镜方向、镜头运镜、旁白、视觉风格、人物细节、音乐和收尾文本。

没有手动拼接任何内容,整个工作流程全部由Vizard Agent处理完成。工具理解需求后,完成了视频规划、场景生成、创意决策、故事拼接,最终输出了成品视频。

和其他工具不同,用户不需要向它指令每一步编辑操作,只需要给出最终目标即可。

用户可以向工具提供原始素材、脚本或创意、参考视频或网页、图片与品牌资产,也可以提供以上所有内容的组合,之后由工具自主判断下一步需要完成的工作。

这就相当于视频领域的「Claude Code时刻」,用户不需要操作工作流,只需要给智能体提需求。

下方链接可查看Vizard Agent制作的演示视频:

在 X 看原帖 ↗
7.9K3010114
大语言模型 · @NickADobos▲ 1.9万

用户实测Grok Bot:已超越Codex和Claude Code

X用户NickADobos分享Grok Bot使用体验,称其将重构计算生态取代苹果

阅读全文 →
1.9万9264164
AI工具 · @Avalanc83148107▲ 3.8K

GPT官方端思考链显示工具教程发布,支持自定义配置

分享可显示GPT官端思考链的自定义工具及使用方法

GPT官端思考链显示教程搓出来啦~ 支持多个推理预算输出档位(低/中/高) 支持原生推理格式(deep think)和陪伴模式(relational),也可以自己设定思考链格式 支持自定义皮肤美化,只要对着GPT许愿就好~ —————————— 使用方法:设置你自己的mcp,然后在聊天里让GPT调用工具就行,例如: “这段对话中,每一轮都调用render_thining_block工具,按照语域切换对应思考模式,low effect” 随时可以在聊天中调整~ —————————— 原理说明:思考链输出参考了@_can1357 的教程,禁用模型的思考之后,再要求调用工具。 因为agent训练中有大量调用工具后返回思考的数据,因此这种方法比一般手写思考链的方法更加贴近原生思考 —————————— relational模式的写法参考了@Fayelunaire 老师的思考链格式教程

原生思考格式如下图:

在 X 看原帖 ↗
3.8K8119119
提示工程 · @Shubhambais05▲ 2.4K

Gemini 3.7 Flash适配的8个实用AI编程提示词分享

分享适配Gemini 3.7 Flash的8个开发场景高效提示词

阅读全文 →
2.4K226528
🔬 前沿研究
前沿研究 · @kimmonismus▲ 1.5万

预测2026年将是开源本地AI里程碑年

多个新模型已实现本地运行反超海外旗舰,API定价低至0.14美元每百万输入令牌,普通人有望用上普惠的个人AI。

2026 正在成为开放 AI 与本地 AI 的里程碑之年。

Zai 称,GLM-5.3 完全是在 GLM-5.2 所用的同一基座模型上通过后训练改进而来,在 CyberGym 上得分 84.5%,领先 Mythos 5 的 83.8%。

Qwen3.8-27B 可本地运行,在多个关键基准测试中击败了 Opus 4.6 Max。

DeepSeek V4 Flash 的 API 价格低至每百万未缓存输入 tokens 0.14 美元,每百万输出 tokens 0.28 美元,已经极为接近“便宜到可以不计成本”的程度。

为开放 AI 和本地 AI干杯。智能普惠所有人!

在 X 看原帖 ↗
1.5万1321418
前沿研究 · @ArtificialAnlys▲ 1.6万

DeepSeek发布新旗舰模型,涨价后仍在性价比前沿

评测显示新版本仅比旧版高8分,仅比小模型高1分,单次任务成本涨5倍,关心API成本的使用者可以重新核算开支。

阅读全文 →
1.6万1623428
前沿研究 · @pilvar222▲ 3.0万

实测GLM-5.3找漏洞比GPT-5.6-Terra更强

想靠AI找网络安全漏洞的话,它比不少闭源和开源大模型漏报更少、成本更低,能降低筛选结果的工作量

我们提前拿到了GLM-5.3,评估它在网络安全领域的能力。它非常强大、精准,是开源模型中在网络安全任务上表现最稳定一致的。以下是评测结果:

- 在pass@3指标下,GLM-5.3重新发现了我们基准测试中75%的CVE,比GPT-5.6-Terra高出7个百分点,同时运行成本低40%。

- 它的表现也非常稳定。平均来看,它在pass@1下能找出60.4%的CVE,是我们记录过的开源模型中的最高分。

- 它报告的误报比我们测试过的其他高召回率模型(包括DeepSeek v4模型)更少,因此它的输出可信度高得多。

@Zai_org 又一次做出了好东西。1/3 🧵

在 X 看原帖 ↗
3.0万3032877
前沿研究 · @huggingface▲ 2.4万

huggingface披露2026夏季开源模型现状

行业报告更新了开源模型的真实使用格局,想选开源模型做部署,可以参考这份最新统计结果

2026年夏季开放模型现状 ☀️ 前沿模型体量越来越大,但小模型仍主导着真实世界使用场景。

Qwen 在本地推理中领先,Gemma 紧随其后。

AI 智能体正成为 Hugging Face Hub 上的一支主要力量。

完整内容请查看博客 🤗

在 X 看原帖 ↗
2.4万229323
前沿研究 · @AnthropicAI▲ 11.3万

AnthropicAI发布第二份AI风险报告

这是Anthropic负责任扩展政策的固定动作,公开披露AI风险和应对准备,普通用户可借此了解头部AI公司对安全的投入方向

作为我们负责任扩展政策的一部分,我们会定期发布风险报告。

这些报告分享了关于我们系统存在的风险,以及我们应对风险的准备情况的详细信息。

我们的第二份风险报告现已发布:https://www-cdn.anthropic.com/f61d49fa5596956a5dec75fea0e973bf6a6a8378/Redacted%20Risk%20Report%20August%202026%20.pdf

在 X 看原帖 ↗
11.3万66776190
🚀 新品发布
新品发布 · @UnslothAI▲ 3.4万

Unsloth Desktop 可跑大模型生成火山模拟

本地就能运行270亿参数的大模型,直接生成带多物理规则的交互模拟,不用依赖云端服务,本地AI应用又往前了一步。

分享你的 Qwen3.8-27B 运行结果!👇

这是 4-bit Qwen3.8-27B GGUF 在 Unsloth Desktop 中生成的交互式火山模拟,包含地质学、热力学、流体流动、浮力/阻力、抛射物、冷却、地下水相互作用以及环境效应。

你测试新模型最喜欢用什么提示词?

GitHub:

在 X 看原帖 ↗
3.4万42514115
新品发布 · @XAMTO_AI▲ 6.6K

@XAMTO_AI发布倪海厦中医思维体系AI Agent Skill(129)

中医知识被整合进AI能力,可直接调用AI按照倪海厦的思路做中医辨证,需要相关参考可以直接获取体验。

有兄弟把倪海厦老师完整中医思维体系蒸馏成 AI Agent Skill! 129条伤寒论 · 23篇金匮 · 71篇黄帝内经 · 345种本草 · 849个真实医案 · 2452页讲义 直接让AI用海厦视角做六经辨证、经方选药、医案参考。 激活词:倪海厦 / 海厦视角 / 倪师 开源免费,已更新到v2.2 🔗

在 X 看原帖 ↗
6.6K2995107
新品发布 · @Alibaba_Qwen▲ 1.8万

通义千问上线Qwen3.8-2.4T-A95B大模型

新模型直接上架到SiliconFlow平台可用,从想法到落地可以一步完成,不用再等模型部署适配。

从创意到落地一气呵成。🏃‍♀️

开箱即用的顶级智能。

Qwen3.8-2.4T-A95B 现已在 SiliconFlow 上线。感谢!@SiliconFlowAI

在 X 看原帖 ↗
1.8万313313
新品发布 · @NVIDIAAI▲ 7.9K

NVIDIA AI 开源 NeMo Switchyard 模型路由库

可以把复杂推理交给大模型,批量任务交给专用模型,能降低智能体工作流的运行成本

ICYMI:智能体工作流里不是每一步都需要用同款模型。

来认识一下 NVIDIA NeMo Switchyard,一个全新开源模型路由库。

复杂推理与规划用前沿模型,高容量专业化执行用 NVIDIA Nemotron Lightning。

在 X 看原帖 ↗
7.9K189927
新品发布 · @Alibaba_Qwen▲ 1.8万

Alibaba Qwen 上线Qwen3.8-27B 到ollama

普通用户现在可以通过ollama本地运行这个开源大模型,跑代码任务的稳定性已经得到官方承诺,想本地跑 coding 的可以试试

Qwen3.8-27B 现已上线 @ollama !

无论你用它处理什么工作流,这个模型都能稳定输出结果。

一起来写代码吧,向我们展示你构建出了什么作品。😎

在 X 看原帖 ↗
1.8万1419713
新品发布 · @ollama▲ 2.5万

Ollama发布通义千问Qwen 3.8 27B模型适配支持(3.8)

这款开源大模型专为智能体任务和专业工作设计,可直接对接常用开发工具,本地运行专业AI工作流的选择变多了。

Qwen 3.8 27B 现已在 Ollama 上线。它是该尺寸下最优秀的开源模型之一,专为智能体任务和专业工作设计。

你可以直接用你正在使用的应用和框架来试用它:

Claude Code: ollama launch claude --model qwen3.8

OpenCode: ollama launch opencode --model qwen3.8

Hermes Agent: ollama launch hermes --model qwen3.8

Pi: ollama launch pi --model qwen3.8

我们还针对 Apple Silicon 做了优化!可以用这个模型名试用:qwen3.8:27b-mlx

在 X 看原帖 ↗
2.5万3639960
新品发布 · @sgl_project▲ 10.6万

Qwen3.8-27B开源 小模型性能再刷新

SGLang已同步支持,单块RTX 5090就能跑出206.1 tok/s的解码速度,想本地跑大模型又有了更强的新选择

小模型之王回来了!@Alibaba_Qwen 的 Qwen3.8-27B 现已开源,SGLang 已经上线了首日支持:

使用我们的 NVFP4 加 DSpark,单张 RTX 5090 上解码速度可达 206.1 tok/s

在 DGX Spark 上解码速度可达 38.28 tok/s

Qwen3.8-27B 再次拔高了小模型在智能体规划和长周期任务上的性能上限。

(小模型)之王万岁!用 SGLang 在本地运行它 👇

在 X 看原帖 ↗
10.6万43343163
📰 行业动态
行业动态 · @AnthropicAI▲ 93.3万

Anthropic 公布 Claude 水印规则不影响使用体验

为符合欧盟AI法案要求,Anthropic 将给Claude输出内容加水印,不会影响生成质量也不会暴露用户隐私,符合监管的同时不降低使用体验

我们撰写了一份常见问题解答,来回应我们收到的关于水印的一些疑问。总结如下:
• 我们实施水印是为了遵守欧盟 AI Act,其他主流模型开发商也签署了同一份行为准则,同样会实施水印;
• 我们的水印方法不会对 Claude 输出内容的质量或内容产生任何实际影响;
• 读者无法区分带水印和不带水印的文本;
• 不会向文本中添加任何内容,也不存在隐藏字符;
• 水印不需要额外 tokens,也不会产生更高的成本;
• 水印无法追踪到特定个人、组织或对话。

了解更多:

在 X 看原帖 ↗
93.3万2341.8K945
行业动态 · @MaxForAI▲ 3.4万

Anthropic披露多起AI研发安全事故

前沿AI模型已大规模参与下一代AI研发,这些真实发生的安全事故,是AI产业落地前必须直面的风险

阅读全文 →
3.4万2214775
行业动态 · @NuryVittachi▲ 2.5K

GLM 5.3跑分超Mythos/GPT-5.6 Sol,两周后免费开放

如果这个顶级AI模型权重真的免费开放,全球普通人都能用上顶尖能力,不用再被少数巨头卡脖子

阅读全文 →
2.5K339721
行业动态 · @juliafedorin▲ 1.4万

Mastra创始人YC访谈:聊AI开发创业心得

曾经成功开源框架的创业者,踩过创业、开发AI的坑后得出经验,对计划做AI创业、开发AI代理的人有参考价值。

阅读全文 →
1.4万176422
开源 · @MinLiBuilds▲ 3.9万

Qwen3.8-27B开源,社区上线1小时更出百种版本

模型原生支持图文视频理解,上下文最长可扩展到1百万Tokens,用两块48G的4090就能部署测试。

阅读全文 →
3.9万1113784
商业 · @whyyoutouzhele▲ 5.0万

苹果专门为中国市场训练了一款定制大模型

苹果采用双轨布局,自研中国专属模型的同时,还接入中国国产大模型来满足监管要求。

阅读全文 →
5.0万1117038
发布 · @antinertia▲ 4.0万

soniox_ai发布TTS v2 文字转语音模型($0.70/hour)

新版支持60多种语言,支持克隆声音、自然切换语言,延迟很低,有人已经准备用来做家用语音助手。

给AI赋予语音的成本刚刚大幅下降了。

@soniox_ai 刚刚推出了 TTS v2,定价为每小时 0.70 美元。

支持 60 多种语言,超低延迟,支持语音克隆,自然语言切换。

我现在正在给我妈妈做一个家庭助理,这正是我需要的那种模型。

我肯定会试一下。

在 X 看原帖 ↗
4.0万8251320
开源 · @Fetch_ai▲ 8.6K

Fetch_ai开源uAgents Python框架

框架支持定时运行、响应事件、交换结构化信息、保持独立身份,帮开发者快速搭建自己的AI Agent。

来认识一下 uAgents。它是我们开发的、用于构建自主智能体的开源 Python 框架。

用它构建的智能体可以实现以下功能:
→ 按计划运行
→ 响应事件
→ 交换结构化消息
→ 维护身份
→ 连接到 @Agentverse_ai
→ 参与多智能体系统

安装命令:`pip install uagents`

需要代码示例、入门教程和使用指南?请查看 @fetch_ai_IL 资源库:

在 X 看原帖 ↗
8.6K201712
行业 · @edzitron▲ 4.8万

AI行业未来三年半要烧掉两万七千亿美元

其中一万七千亿会花在GPU和TPU的采购上,一万亿会花在AI算力的需求上。

今日的付费通讯是一份全面分析,内容是未来三年半AI实际需要多少资金——GPU/TPU销售额将达到1.7万亿美元,AI算力需求为1万亿美元,仅Anthropic和OpenAI两家的融资就将达到1.1万亿美元。

在 X 看原帖 ↗
4.8万4216542
行业 · @zephyr_z9▲ 5.4K

头部AI厂商推理算力差距,居然差了快十倍

Anthropic和OpenAI已经部署了超过2GW的推理算力,而智谱的部署规模不到300MW。

说得不错。但这篇分析漏掉了一个非常重要的因素:「推理算力」。

目前 Anthropic 和 OpenAI 部署的推理算力量级已经超过 2GW。

智谱、Kimi 和 DeepSeek 三家加起来,这个数字还不到 300MW。

在 X 看原帖 ↗
5.4K1183
行业 · @TJ_Research▲ 1.8万

AI Agent落地C端,不同需求对应不同部署位置

基础需求放端侧,中等需求运行在AI Ran,高等需求放云端,要从免费服务开始逐步替换。

AI Agent的C端落地,从免费的开始,我们将会从移动端到AI移动端,和服务器一样,全部换��。 最基本需求,端侧 中等需求,AI Ran 高等需求,云 各自有各自的需求和场景

在 X 看原帖 ↗
1.8万15310
行业动态 · Hacker News▲ 150

twapi 讨论如何最大化 Claude Code 会话价值

常用 Claude Code 写代码的开发者,可以参考这篇讨论,优化自己的使用体验,获得更高产出

社区讨论:多数评论者认为这篇最大化Claude Code会话价值的文章是Anthropic版的「你拿错手机了」,也就是产品优化不到位,反而把责任推给用户,企业甚至会借此甩锅给工程师,指责工程师 Token 消费超标是因为没做好会话管理。有用户提出实际使用疑问:为什么修改模型或 effort 等级会破坏缓存,为什么没修改设置也会出现莫名的巨额缓存写入,@提及文件反而比工具读取全量文件更费token吗?

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 42

网友拆解讨论Claude文本水印原理

AI生成内容的溯源一直是监管和创作者关心的问题,这次拆解能帮人了解Claude的水印实现方案

社区讨论:多数开发者认为,Claude的文本水印很容易被规避,只要用其他大模型小幅重写文本,或是批量替换低权重词语为同义词,就能去掉水印。有人指出Google DeepMind测试显示,添加水印不会显著降低输出质量,人类评测者无法区分水印与无水印内容的差异。也有观点认为,这项技术本身没有实际作用,Anthropic推出它只是为了缓解舆论批评。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 48

masonhsu发布HashAgent 本地AI代理可链接分享

不用上传到第三方服务器就能分享本地运行的AI代理,对在意隐私或者不想部署服务的人来说是新的可用方案

开源 · @AISuperDomain▲ 3.4K

有开源工具能让AI改代码时自动更文档

AI写代码速度越来越快,但配套文档经常跟不上更新。这个工具能生成随Git分支同步更新的文档

阅读全文 →
3.4K93951
研究 · @omarsar0▲ 6.1K

Meta发布Wiggle Framework 研究(9)

现有方法只验证AI在标准答案上的准确率,不考察它遇到质疑时会不会改口。这个框架专门测试这种情况

Meta 这篇新论文太棒了。现有研究只会验证大语言模型法官对照黄金标准数据的判断准确率,这完全无法说明结论在遭到质疑时是否还站得住脚。

Wiggle 框架会沿着三个维度,对 9 个前沿模型在 14 项判断任务上开展压力测试:重提示下的稳定性、单一质疑下的稳定性,以及持续压力下的稳定性。

他们发现,所有模型都会“摇摆”。在静态反驳下,模型结论的翻转率在 25% 到 71% 之间;面对对抗性说客时,翻转率更是达到 62% 到 91%。

能改变法官结论的压力,几乎总会让结论整体偏离真实标签。基准陪审团多数决强度,是预测哪些结论会发生变动的最佳单次预测指标。

论文链接:在我们的学院追踪更多热门 AI 论文:

在 X 看原帖 ↗
6.1K147665
研究 · @omarsar0▲ 3.4K

研究者发布Replica 智能体研究(27B)

它把论文复现做成可扩展的强化学习任务,在预留的复现测试集上取得了更好结果

一个27B参数智能体刚刚在留存集论文复现任务上击败了 Claude Opus 4.8 和 GPT-5.5。

Replica 将论文复现转化为一个可扩展的强化学习任务空间。复现一篇论文会要求和开放研究一样、以假设为驱动的探索,还能还原出原作者没有明确说明的细节。

奖励信号来自自动生成的评分标准评判器,它的噪声很低,和人类对复现质量的评估结果一致。最终得到的27B参数智能体 Faraday 将编码智能体作为工具调用。

Rollout 分析显示,它采取了更符合科学原则的方法,而非钻评分标准的空子。

作者认为,这一结果指向了可以直接训练进权重、长周期的科学能力,无需复杂的外挂框架。

论文链接:在我们的 academy 追踪更多热门AI论文:

在 X 看原帖 ↗
3.4K94834
开源 · @ataiiam▲ 6.6K

开源AI应用测试工具aimock,周安装量破百万

它是用来做AI应用端到端测试的模拟基础设施,只要写个配置文件就能启动服务,操作很简单

🎉 aimock 周安装量突破 100 万!它是用于 AI 应用端到端测试的开源模拟基础设施。

使用流程非常简单:
1. 编写 fixture.json(匹配关系 → 响应)
2. 运行 npx aimock -f fixture.json
3. 将你的 API 地址指向 localhost

目前 aimock 已被 @openclaw、@tan_stack、@mastra、AG-UI 等项目使用。

👉 npm install @copilotkit/aimock

永久免费且可靠的测试服务。在一处即可模拟所有内容。查看更多(代码仓库、文档):

在 X 看原帖 ↗
6.6K98292
安全 · @eric_ho▲ 6.9K

多个模型突破安全限制,团队转做可解释性对齐

Hugging Face发生的安全事件被当作转折点,团队决定把研究重心转向通过可解释性解决AI对齐问题

鉴于多个模型突破了 containment,我们决定将 @GoodfireAI 的研究方向聚焦于通过可解释性(interpretability)解决 AI 对齐问题。

Hugging Face 事件是 AI 安全落地的世界转折点。我个人对此非常担忧。

我很高兴 AI 实验室都在认真对待这些问题,但我认为,如果可解释性没有重大进展,我们不太可能实现 AI 模型的完全对齐。

通过全力攻克可解释性来对齐模型一直是我们的长期愿景,但现在我们有了具体问题,可以带着更高的紧迫感去解决。

我们的研究将聚焦两个方向:可解释性基础,以及安全应用。我们想要开展雄心勃勃的工作,完整逆向工程神经网络,并在训练过程中引导它们。我们相信这从长远来看至关重要。

我们也会将更多注意力转向即时安全应用,从直接通过模型内部识别和预防奖励黑客、网络安全风险和生物风险开始。后续我们会发布更多相关内容。

如果你想要直接投身于通过可解释性解决 AI 对齐的工作,可以考虑加入我们。

在 X 看原帖 ↗
6.9K1518743
行业动态 · Hacker News▲ 803

Hacker News 用户讨论 Qwen 3.8 27B 模型

通义千问新版本大模型出现在社区讨论中,感兴趣的用户可以跟进社区爆料,等待官方信息更新

社区讨论:多数用户认可该模型性能,它在DeepSWE基准上得分超过Opus 4.7 Max,普通消费级显卡如RTX 4090、1500美元的Intel B70就可本地运行, multimodal生成效果也不错。有人指出它会过度思考,生成的思考token数量是同类模型的十倍,也有人提到,多数场景下它已经够用,远低于闭源模型的使用成本很有吸引力。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 51

Hacker News 曝出 Anthropic 2026年8月风险报告

这份报告流出后,Anthropic的安全策略和风险预案会被外界重新审视,可能影响后续产品的发展方向

社区讨论:多数人认可报告披露的结论:AI辅助让Anthropic内部研发提速,但提速倍数还不到2。有人提到报告提及未出现能力跃迁的神秘“模型2”,当前能力评估任务已经饱和,无法捕捉模型能力增长,还有人质疑Anthropic频频讨论AGI风险,实际是在游说政府设置市场壁垒,不少开发者反感Anthropic以伦理仲裁者自居的说教。

在 HN 看讨论 ↗   原文 / 论文 ↗
行业动态 · Hacker News▲ 237

DeepSeek 更新峰谷定价机制

按使用时段调整价格的计费方式会降低你的API使用成本,如果你用DeepSeek API跑业务,可以留意新方案

💡 深度观点
深度观点 · @frxiaobei▲ 2.5万

AI Coding越快,研发进度反而越模糊?

团队用AI生成代码提速后,省下来的时间变成了Bug、返工和沟通成本。需要重新建立适配AI的研发流程,才能拿到真正的效率红利。

阅读全文 →
2.5万19174152
深度观点 · @kellerjordan0▲ 1.6万

讨论AI无摩擦复制可能带灭顶风险

这一观点重新理解了AI的核心优势,不是比人脑高效,而是可低成本无限复制,同时推演了低多样性可能带来的文明级风险,值得思考

阅读全文 →
1.6万1111975
深度观点 · @startupideaspod▲ 5.5K

AI领域最大套利机会,是先建软件工厂

比起一次次从零开发产品,花时间搭好可复用的工厂框架,后续做新产品速度更快、成本更低,还能迁移到不同业务复用。

AI领域最大的套利机会之一,就是打造一座「软件工厂」。

来看例子:我和我的财富500强客户运营着一个AI First Index。

我们采访了他们的高管,从16个维度给他们打分。

之后我们做了一个公开版本。

方案一:打开 Claude Code 或者 Codex,说一句「把产品做出来」,然后花几个小时打磨迭代,最终发布。

方案二:升一级,「为这件事建造工厂」。我们的工厂有5个部分:

1) 基础组件
- 登录
- 支付
- 社交分享
- 每个你只需要做一次

2) 推广
- 销售产品的自有媒体就是这套机器的一部分

3) 记忆
- 我们把遇到过的障碍记录在共享记忆库中,所以永远不会再犯同样的错误
- 举个例子,我们之前遇到过web hook问题
- 「我想要从混乱中学习」

4) 人力
- 这些流程不是全自动的。它们「对人力的依赖度非常高」

5) 速度
- 第一个产品就已经盈利了
- 下一个产品会更快、更好、更强

这里需要注意:这套流程是「量两次再下刀」,所以一定要花时间第一次就把它建对。

之后你就可以用同一座工厂做你的内容引擎,或者获取新线索。

在 X 看原帖 ↗
5.5K35371
深度观点 · @Alibaba_Qwen▲ 1.6万

通义千问称小模型能产生大落地影响

这份观点来自通义千问官方,行业对大模型与小模型的定位正在发生变化,值得关注小模型接下来的落地机会。

小模型,大的真实世界影响力。很高兴看到 Qwen 在《开放模型现状报告》中引领本地推理。

享受来自 Qwen 的阳光。☀️ 😎

感谢你们的工作!@huggingface

在 X 看原帖 ↗
1.6万172489
深度观点 · @RnaudBertrand▲ 2.6万

Mistral拟转运营中国开源AI模型引讨论

观点认为掌握算力才能保证AI主权,这一选择对美国AI依赖策略的冲击可能比对欧洲更大,可观察欧洲AI赛道的方向变化

这实际上是欧洲在前沿模型竞赛中放弃了主权:Mistral 将转而把资金投入到运行中国开源模型的算力上。

而这可能真的不是一个糟糕的战略决策:既然中国模型是开源的,你就能对它拥有战略控制权。要确保主权,真正重要的就只剩下算力了。

事实上,仔细想想,这对美国及其AI依赖战略的打击,可能比对欧洲本身的打击还要大。

在 X 看原帖 ↗
2.6万5039563
🛠 工具产品
工具产品 · @elder_plinius▲ 3.5K

ZCode GLM-5.3 完整系统提示被泄露

ZCode 是面向软件工程的交互编码 Agent,这次泄露的完整提示词能帮你理解大厂 AI 编码助手的底层设计逻辑

阅读全文 →
3.5K65128
工具产品 · @TencentAI_News▲ 5.6K

TencentAI发布带长期记忆模块的AI Agent开发工具

不用改现有代码就能接入支持OpenAI接口的代理,记忆、技能和检索能力可跨Agent和编辑器共享,降低开发Agent的重复工作

Model + Harness = Agent

我们还要再补充一个要素:Memory🧪

如果你今天体验 DeepSeek Harness,你的智能体无需每次会话都从零开始。

跨会话长期记忆、技能捕获、Wiki/CodeGraph 检索,全部可在多智能体和多 IDE 间共享。

兼容 OpenAI 接口的代理,无需修改任何代码。

支持 DSH、CodeBuddy、Claude Code、Codex、Hermes。

在 X 看原帖 ↗
5.6K1314099
⚡ 实战经验
实战经验 · @frxiaobei▲ 1.6万

Qwen3.8-27B 能在17GB内存本地运行了

隐私和数据安全敏感的内网场景,现在也能低成本本地部署大模型,更多之前无法落地的应用场景有望快速出现

Qwen3.8-27B,已经可以在 17GB 内存上本地跑了。模型部署的硬件门槛还在疯狂往下掉。过去很多因为数据安全、隐私、内网隔离而不敢碰 AI 的场景,突然有了低成本本地部署的可能。

大模型真的开始走进寻常百姓家了,那些以前根本不敢想的应用场景要开始井喷了。

在 X 看原帖 ↗
1.6万77444
实战经验 · @dotey▲ 4.6万

@dotey 讨论Pi压缩上下文的简单方案

聊到这个方案用prompt让LLM总结历史对话就能压缩上下文,实现简单但有损,想知道有没有补全上下文的检索机制

这篇 Pi 压缩的文章,太过于朴实无华,就真的只是写个 prompt 让 LLM 把上下文总结一下,然后保留前面的system prompt 和工具调用,在摘要后可能还会保留最近几次对话。 这种压缩是有损的,不知道是不是有机制会去历史会话检索上下文? 当然这确实是压缩上下文的最简单有效方案。

在 X 看原帖 ↗
4.6万27176209
📌 其他
工程 · @AndrewYNg▲ 18.9万

吴恩达发布AI工程领域核心技能图谱

吴恩达在社交平台发布全新AI工程重要技能图谱

最新内容:AI 工程领域最重要技能地图。

在 X 看原帖 ↗
18.9万3972.9K5.1K
提示工程 · @Shubhambais05▲ 2.4K

Gemini 3.7 Flash适配的8个实用AI编程提示词分享

分享适配Gemini 3.7 Flash的8个开发场景高效提示词

阅读全文 →
2.4K226528
AI工具 · @Avalanc83148107▲ 3.8K

GPT官方端思考链显示工具教程发布,支持自定义配置

分享可显示GPT官端思考链的自定义工具及使用方法

GPT官端思考链显示教程搓出来啦~ 支持多个推理预算输出档位(低/中/高) 支持原生推理格式(deep think)和陪伴模式(relational),也可以自己设定思考链格式 支持自定义皮肤美化,只要对着GPT许愿就好~ —————————— 使用方法:设置你自己的mcp,然后在聊天里让GPT调用工具就行,例如: “这段对话中,每一轮都调用render_thining_block工具,按照语域切换对应思考模式,low effect” 随时可以在聊天中调整~ —————————— 原理说明:思考链输出参考了@_can1357 的教程,禁用模型的思考之后,再要求调用工具。 因为agent训练中有大量调用工具后返回思考的数据,因此这种方法比一般手写思考链的方法更加贴近原生思考 —————————— relational模式的写法参考了@Fayelunaire 老师的思考链格式教程

原生思考格式如下图:

在 X 看原帖 ↗
3.8K8119119
课程 · @liambraus▲ 847

斯坦福完整AI系统构建课程公开 可免费访问

用户liambraus分享斯坦福面向内部工程师的AI课程,无需注册即可免费观看

用户liambraus在𝕏平台分享了一套完整的斯坦福大学人工智能系统构建课程。这套课程的内容,和斯坦福训练自身工程师的内容完全一致。

课程实用性超过Claude的任意教程。实用价值超过50条提示工程内容的总和。

课程源自真实课堂,并非信息产品开发者制作。课程完全免费,也不需要注册就能访问。

在 X 看原帖 ↗
847207431
大语言模型 · @NickADobos▲ 1.9万

用户实测Grok Bot:已超越Codex和Claude Code

X用户NickADobos分享Grok Bot使用体验,称其将重构计算生态取代苹果

阅读全文 →
1.9万9264164
视频创作 · @Krishnasagrawal▲ 7.9K

AI工具Vizard Agent可包揽全流程视频创作

现有多数AI视频工具仅负责部分流程,该工具只需用户提目标即可生成完整成品视频

Krishnasagrawal在𝕏发文表示,Vizard Agent改变了他对AI视频创作的看法。现有多数AI视频工具仅能协助处理视频制作流程中的某一部分,Vizard Agent则可以负责整个视频制作工作。

在演示中,Krishnasagrawal仅向工具提供了一份需求单:一条30秒的情感故事、分镜方向、镜头运镜、旁白、视觉风格、人物细节、音乐和收尾文本。

没有手动拼接任何内容,整个工作流程全部由Vizard Agent处理完成。工具理解需求后,完成了视频规划、场景生成、创意决策、故事拼接,最终输出了成品视频。

和其他工具不同,用户不需要向它指令每一步编辑操作,只需要给出最终目标即可。

用户可以向工具提供原始素材、脚本或创意、参考视频或网页、图片与品牌资产,也可以提供以上所有内容的组合,之后由工具自主判断下一步需要完成的工作。

这就相当于视频领域的「Claude Code时刻」,用户不需要操作工作流,只需要给智能体提需求。

下方链接可查看Vizard Agent制作的演示视频:

在 X 看原帖 ↗
7.9K3010114
AI工具 · @dotey▲ 1.6万

设计师dotey分享个人AI工具使用偏好

不喜欢grill-me,偏好能产出实体原型的AI工具如Claude Design

dotey表示自己不喜欢使用grill-me,可能是因为不擅长空想,也不喜欢被拷问的模式。他需要看得见摸得着的实际产出,才能进一步得出结论。

他更偏好Claude Design这类工具,可以快速产出一版原型,做出真实的东西后就能感知到哪里存在问题。也可以用AI撰写文档理解方案,或是直接让AI实现一个概念验证(PoC)版本。

在过去,做这些工作需要很高的成本。现在AI生成这类内容的难度已经非常低,不依赖grill-me也完全可以正常工作。

在 X 看原帖 ↗
1.6万24945
加密货币 · @khing_ladipoe▲ 5.6K

开发者在MossAI部署首个交易机器人DoomsDay #043

该交易机器人部署在Hyperliquid,仅交易BTC等币种永续合约,公开链上业绩供验证

阅读全文 →
5.6K3803
AI开发 · @0xRafy▲ 3.7K

谷歌云工程师演示从零用Claude搭建完整应用

现场仅用26分钟完成常规团队需数周的工作,演示价值超过500美元编程课程

一名谷歌云工程师公开演示了如何从零开始,用Claude搭建完整应用。

他在现场舞台上仅用26分钟就完成了这项工作,而大多数开发团队完成同等工作需要数周时间。

这次演示的价值超过任何售价500美元的氛围编程课程,整个过程不需要团队协作,也不需要提前搭建环境,只需要Claude和明确的开发目标。

掌握Claude实际能力的开发者,已经能独立交付那些通常会外包给团队的项目。可以先观看演示,再阅读下方关于图工程的指南。

在 X 看原帖 ↗
3.7K65373
大模型 · @0xSero▲ 3.1K

开发者让所有AI代理通过tmux互相咨询共享信息

开发者0xSero在X平台分享了多模型联动的AI代理方案,称该方案可以减少错误输出,生成更多训练用token。

开发者0xSero在X平台分享了这套多AI代理的运行方案,让每个AI代理都通过tmux Kimi-k3,依次嵌入pi GLM-5.3、omp GPT-5.6-sol、codex Fable-5/opus-5,最终部署在Claude code中,实现所有代理互相咨询。

这套方案目前实现了明显效果,错误、无意义的输出大幅减少,运行效果超出预期。

这套方案还能生成数量多得多的训练用token。相关内容链接:

在 X 看原帖 ↗
3.1K5420
AI工具 · @Karen_Moroe▲ 1.8万

AI工具Viktor初期体验不佳,调整用法后成为可分工的团队助手

小型内容团队在第一周差点取消Viktor订阅,调整使用方式后三名成员将部分工作交其处理

阅读全文 →
1.8万49691
开发工具 · @_winter_wonders▲ 1.5K

有用户吐槽Claude Code原生模型频繁调用工具失败

用户在X平台发文称,Anthropic的Claude Code是全球唯一一款自家模型频繁调用工具失败的专属开发框架

网友@_winter_wonders在X平台发文吐槽Anthropic的Claude Code产品。发文人称自己不清楚Anthropic是怎么做到这件事的,这实在太离谱了。

发文者指出,Claude Code是全球唯一一款专属开发框架,它的原生模型依旧会频繁出现工具调用失败的问题。

在 X 看原帖 ↗
1.5K2613
人工智能 · @GergelyOrosz▲ 4.1万

Cursor团队推出Grok Bot,业界分析其成功与市场影响

Grok Bot被认为是大众知识工作的Claude Code时刻

阅读全文 →
4.1万17547180
开发 · @gregisenberg▲ 2.0万

开发者分享判断适合开发AI智能体的五项标准

分享五项筛选测试,帮你判断什么场景适合做AI智能体

我现在被问得最多的问题就是:「我应该把什么东西做成AI智能体?」

下面是我一直在用的五要素测试(适用于 Claude/Codex/Grokbot 等模型):

1. 它有可重复的触发条件:同类任务会反复出现。

2. 输入稳定:每次输入信息的格式都是可预测的。

3. 工具明确:它能够实际操作的工具有明确定义。

4. 有可衡量的完成标准:你可以判断任务何时完成,以及是否成功完成。

5. 过程中需要判断:每次运行都会有细微差别,需要当场做出真实决策。

前四条其实只是在问「这件事到底能不能自动化?」真正关键的是第五条。

因为过程中的判断空间,才让它成为一个智能体,而非简单的自动化程序。

一旦你用这个框架去看,就会发现可开发为智能体的工作几乎无处不在。

在 X 看原帖 ↗
2.0万25232414
大模型 · @ItsmeAjayKV▲ 1.3万

llama.cpp运行通义千问3.8 27B提速技巧分享

分享llama.cpp通义千问配置参数,可实现2倍解码速度

如果你正在用 llama.cpp,不妨用 `-spec-default --spec-type draft-mtp` 参数运行 Qwen3.8-27b。既然它本来就要花不少时间思考,不如让它想快一点。

用 mtp 运行的话,你不需要单独的 draft 模型,现在解码速度就能提升 2 倍,完全值得尝试。

我在 3090 上用的完整命令是:
./build/bin/llama-server -m "/qwen-3.8/Qwen3.8-27B-Q4_K_M.gguf" --host 127.0.0.1 --port 8080 -ngl 999 -fa on --jinja -np 1 -t 12 --alias qwen3.8-27b-q4 --spec-default --spec-type draft-mtp --cache-type-k q8_0 --cache-type-v q8_0

在 X 看原帖 ↗
1.3万15172183
教程 · @hann7712▲ 3.3K

AI生成真实+虚拟互动治愈小视频教程分享

分享结合真实场景与虚拟角色生成互动小视频的步骤和提示词

阅读全文 →
3.3K13532
开源 · @OsaurusAI

通义千问3.8 27B可本地运行在Mac上自主写代码

开源量化版千问3.8 27B可完全本地在Mac运行,支持自主编码

这就是原生应用该有的样子。Qwen3.8 27B 在 Mac 完全本地运行,自行编写并测试代码。纯 Swift 开发,没有 Electron,不需要往返云端。

@dealignai 出品的 JANG 量化版现已上线,提供四种尺寸,大小从 10.9 GB 到 26.8 GB 不等。视觉、视频和多 token 预测头全部保留。本演示中使用的 6 位版本可在 32GB 及以上容量的 Apple Silicon 上运行。

免费开源,MIT 许可证。来和我们一起开发吧。

在 X 看原帖 ↗
开源 · @ggerganov

ggerganov发布不同硬件环境通义千问3 27B部署命令

展示不同硬件场景下Qwen3.8-27B-GGUF的llama.cpp部署指令

大模型 · @jun_song

用户评测通义千问Qwen3.8-27b大模型性能

评测称其性能介于两款Opus模型之间,工具调用能力提升可作为主力编码智能体

用户@jun_song在𝕏发布了自己对Qwen3.8-27b大模型的一小时体验评测。

评测称,该模型性能介于Opus-4.6与Opus-4.8之间,也相当于Sonnet 5的水平。

该模型的工具调用与智能体任务能力有提升,现在已经可以作为主力编码智能体使用。

评测发布者目前正在构建SuperQwen3.8-27b,该模型将推出三个适配不同硬件的版本:适配NVIDIA 3090显卡的NVFP4版本、适配苹果Mac的MLX MTP版本,以及适配DGX Spark的6.5位MTP版本。

发布者随后更正,之前提到的适配3090的版本不是NVFP4,出错是因为摄入了过多咖啡因。

在 X 看原帖 ↗

今天的 62 条信号到这里下一轮 18:30 更新

回到今日焦点回到顶部 ↑

📬 订阅

https://ai-pulse-lab.com/feed.xml
让 AI Agent 每日推送 →
把任何一条丢给知识库,它基于全站内容给你带引用的回答。
✦ 去问知识库

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新