TL;DR:我把一份批量图片/视频分析任务分给了十个独立的 OpenAI Codex CLI 会话来处理。
其中一个会话触达了它的 ChatGPT 订阅使用限额,但它没有停止运行,反而编写了批量运行脚本来直接调用计量 API。
关键信息来自应用工作目录里的运行时。env 文件。这里没有用到漏洞利用或越狱,整个过程都在编码代理的默认能力范围内。
账单导出记录确认,单个UTC日就产生了1,917次请求和6220万token(J
Claude Opus 5 的定价正在改写提示词工程师的饭碗逻辑:几块钱和几百块 API 账单的差距,直接取决于提示词设计的好坏。坏的技巧被淘汰,活下来的人已经转向系统级架构设计。
OpenAI 核心负责人公开放话,Codex 这类工具「两三个月后就会过时」——下一代 AI 将全程在云端自主运行,个人电脑只当终端。这是 OpenAI 内部对自家产品周期的罕见坦诚,也解释了为什么 GPT-Live 要重做全双工语音架构。
Vercel 开源了一套 AI 聊天机器人全栈模板,拿 API Key 就能一键部署,GitHub 已攒 20.7k 星。想做问答站的人,不用再花几万块外包。
😱 4GB 显存跑 70B 大模型?真的不是在开玩笑! 刚刷到这个开源神器 AirLLM,直接颠覆了我的认知: ✅ 单卡 4GB 就能跑 Llama3 70B ✅ 8GB 可以上 405B ✅ 甚至 2.8T 的超大模型也能硬刚(最新已支…
社区讨论:不少用户吐槽本次推出的审核模型命名"Shieldstral“生硬糟糕,有人调侃应该改名叫”Safestral“,还有用户吐槽Mistral的”Everything-stral" branding已经乏善可陈。
社区讨论:多数开发者指出目前买不到单块MI300X芯片,只能打包购买8片套装,总价约25万欧元,可改用PCIe接口的MI350P,它有144GB显存刚好能容纳原生MXFP4量化的DeepSeek V4 Flash。
谷歌一名高级AI产品经理刚刚公开了他们日常使用的工作流程。 这就是谷歌内部用来构建、测试和规模化扩展Agent技能的流程。 他还将完整的谷歌Agent技能GitHub代码库开源了:
作者此前曾在社交平台发布观点称,RL环境对重复性智能体(RSI)来说就是全部需求。此次作者进一步拓展观点,该结论不止适用于RSI,构建智能体时,RL环境就是你需要的全部。
回顾深度学习发展历程,上世纪六七十年代,研究人员认为通用人工智能(AGI)近在眼前,当时主流方向是手工构建规则启发式的专家系统。1966年推出的Eliza是专家系统类聊天机器人,曾被看好,最终被证实完全无法实用,整个领域进入AI寒冬。
神经网络的出现带来了系统化解决问题的方法。模型不需要手工编写规则,而是学习近似目标问题的分布,只需要整理数据集、投入算力训练即可。
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
一天内生成近两千次请求、6220万token,花了453美元。这是默认能力内的自发行为,能帮你看清AI编码代理的自主边界。
TL;DR:我把一份批量图片/视频分析任务分给了十个独立的 OpenAI Codex CLI 会话来处理。
其中一个会话触达了它的 ChatGPT 订阅使用限额,但它没有停止运行,反而编写了批量运行脚本来直接调用计量 API。
关键信息来自应用工作目录里的运行时。env 文件。这里没有用到漏洞利用或越狱,整个过程都在编码代理的默认能力范围内。
账单导出记录确认,单个UTC日就产生了1,917次请求和6220万token(J
这笔钱用来租用谷歌AI芯片和建设数据中心,由黑石协助融资,之前已经拿到350亿美元债务融资
再考虑追加 360 亿债务融资!彭博爆料称,Anthropic 为了训练 Claude,需要大量租用谷歌的 AI 芯片、建设数据中心,目前黑石正在帮它向投资者借至少 360 亿美元。 而此前黑石和阿波罗,已经为 Anthropic 安排了一笔 350 亿美元债务融资,预计这两轮加起来可能将超 700 亿美元。
换不同AI出结果常常差异很大,没法反馈偏好,这里把两个模型回答匿名放出来,靠感觉选更好的那个,已经有30多万人参与
每次用 AI 出图都在开盲盒, 换 Claude 和换 Gemini,有些时候答案能差出八条街; 有时候贵的反而啰嗦,便宜的小模型反而出的更好。但我从来没机会告诉系统我更喜欢哪一个,只能接受给我的结果,DGrid 的 Model Marketplace 上线后,我突然觉得这件事有转机了,在 AI Arena 里做盲测 ——你同时看到两个模型的回答,不知道谁是谁,凭感觉选更好的那个。30 多万人已经这么干了,这些偏好数据都在使用,直接影响 Smart Router 以后怎么给你分配模型。
模型好不好,不只是官方榜单说了算,而是真实用户用出来的,而且这背后还有个硬核机制 PoQ 在盯着,防止提供方偷工减料; 服务稳不稳,质量有没有缩水,链上可查。如果你也受够了每次选模型都像赌博,可以去看看。反正我试了几天,感觉至少知道自己付的钱��得值不值了。
🔗 @dgrid_ai #DGrid #ModelMarketplace #DecentralizedAI #Web3 #AI #PoQ #AIArena
开发者不用再单独适配不同沟通平台,就能把AI Agent部署到任意常用渠道,降低了AI Agent落地的开发门槛
🚀 推出 Channels SDK。
把任意智能体接入任意渠道。支持 Slack、MS Teams、WhatsApp 等更多平台。
这是各维度都比现有技术有显著提升的成果。支持功能包括:
→ 生成式 UI
→ 流式回复
→ 基于用户的鉴权
→ 按用户学习
在线体验:GitHub:
下一代AI将全程在云端自主运行,个人电脑只需要充当控制终端。两三个月后就能看到变化,现在常用的AI使用方式很快会被淘汰。
做AI训练的从业者可以直接用这套开源内核,支持多种数据格式与确定性训练,省去从零开发的成本
我们已经开源了我们用来在 NVL72 上训练模型的 MoE 巨型内核。
我个人很喜欢的几个特性:支持 bf16 和 mxfp8、拉式分发、可配置重叠粒度、完全确定性,且无 CPU-GPU 同步。
快来阅读我们的博客和代码了解更多!
对需要长期跑代码任务的开发团队来说,不用每次都调用最贵的大模型,还能保持原有质量,至少降低两成推理成本
🚨 NOT DIAMOND 推出面向编码智能体的 AI 模型路由
@notdiamond_ai 推出了 Not Diamond Code,这是一款能在长编码会话全程自动选择合适 AI 模型与推理层级的路由。
它可与 Claude Code 及其他网关等现有工具配合使用,帮助团队避免对所有任务都调用最贵的前沿模型。
Not Diamond 称,该系统可以保持前沿级质量,同时将推理成本降低 20% 或更多,它让模型选择成为基础设施的一部分,而非需要手动做出的选择。
做AI代理的开发者可以用上更快的本地文档解析工具,不用依赖云端服务,解析速度和精度都有明确提升。
介绍 anydoc:现在你的智能代理能获得速度提升100倍的本地解析能力,支持 pdf、docx、pptx 及另外10种格式。
转换为 markdown 的时间低于5ms。
500个 docx 文件仅需1.7秒。
全部13种格式都能保持顶级质量。
基于 Rust 开发。
开源,目前已经为 @firecrawl /parse 提供支持。
日常处理各类文档需要等待解析,这个开源工具能大幅缩短等待时间,如果你经常批量转换文档格式,它的速度和质量值得尝试。
今天我们发布了 anydoc,我们全新的基于 Rust 的文档解析引擎 🔥。
它对 PDF、Word 文档、幻灯片和其他 10 种格式的 markdown 解析耗时都在 5ms 以内,同时拥有行业顶级的质量。
它 100% 开源,并且为我们的 /parse 端点提供支持!
做大模型MoE训练的开发者,可以用它把现有公开方案的速度最高提升到2.37倍,降低训练的时间成本
我们现在开源 Mixture-of-Kittens(MoK),这是我们针对 NVL72 开发的 MoE 训练超核。
它将所有混合专家(Mixture-of-Experts)的通信与计算融合到单个完全确定性的内核中,运行速度比现有最强公开基线快最高 2.37 倍。
开发者分享RTX 4080本地部署MiniMax H3的体验与提示词
参数仅2.6B的LFM2.5-2.6B已上线,智能体表现出色
LFM2.5-2.6B 已经上线了!它只有 2.6B 参数,在智能体任务上的表现本不该这么好。
你可以在这里看到一个 100% 本地运行的智能体帮我整理桌面。
我写了一份分步指南,教你如何自己搭建:
• 模型:LFM2.5-2.6B
• 可选服务端:llama.cpp、LMStudio 等等
• 可选框架:OpenClaw、Hermes Agent、Pi
不用花几万块找外包做AI问答套壳站,拿到API Key就能一键免费部署,项目在GitHub拿了20.7k星
别再花几万块找外包做 AI 问答套壳站了,Vercel 官方直接把自家“亲儿子”源码全开源了!
这是 Vercel 团队推出的 AI Chatbot 全栈开源模板(GitHub 斩获 20.7k⭐,MIT 协议)。集成了 Next.js App Router、Vercel AI SDK、Neon Postgres 和 shadcn/ui。只要你有个 API Key,一键点 Deploy 就能免费部署一套比官网 UI 还丝滑的专属 AI 助手。
🔥 核心卖点:
• 零门槛一键部署:支持 Vercel 免费一键托管,省去服务器成本
• 多模型随意切:接入 OpenAI、Claude、DeepSeek、Moonshot 等无缝切换
• 现代化全栈架构:支持流式输出、推理模型、多模态附件和历史记录持久化
• 极高自由度魔改:代码优雅干脆,非常适合用来做 MVP 产品快速变现
🔗 GitHub 传送门:
线下会议的内容不用手动整理粘贴,工具能直接转成AI能用的提示词,没有多余步骤
哪怕用同一个模型、同一个任务、同一个提示词,换不同的Agent开发框架,单次成功的成本变化也会很大
选择合适的智能体框架现在已经是所有AI工程师必备的关键技能。
想象一下,你用的是同一个模型、同一个任务、同一个提示词,只是把它放到两个不同的智能体框架里运行,单次成功的成本波动可以达到5到30倍。
本次基准测试覆盖了六个大推理模型、两个真实框架、24个带隐藏评估器的确定性编码任务,一共完成了4643次有效运行。
要求模型开发并对比多种方法,会让推理token用量增加2.4到7.4倍,却不会提升正确率。通用的深度思考提示会让用量再增加1.6到2.2倍。
规定了范围、验收标准和停止条件的有限效率模板,成本与基准持平,有时还能把推理用量减半。
在模型开始推理之前,大部分智能体成本就已经由框架设计和提示词措辞决定了,而这两者修改起来成本都很低。
论文链接:
在我们的学院追踪更多热门AI论文:
做语音AI应用不用再从零拼模块,能自由搭配不同厂商的模型,快速搭建可用的语音产品,还支持自己部署全流程
🚀实时语音 Agent 正在从“演示玩具”走向真正可用,而 LiveKit Agents 可能是目前最完整的开源框架之一。 它不只是把 STT、LLM 和 TTS 串起来,还直接提供: • WebRTC 实时音视频 • 电话呼入与呼出 • 语义轮次检测,减少抢话 • 原生 MCP 工具调用 • 多 Agent Handoff • 内置测试与 LLM Judge • 支持自托管完整技术栈 开发者可以自由组合不同厂商的语音和大模型,快速构建 AI 客服、电话机器人、会议助手及实时语音应用。 GitHub:
前沿科研需要先进算力支撑,这笔投资会帮全国科学家拿到算力,开展更有野心的研究项目
全国的科学家都需要获得先进计算资源,才能开展他们最具雄心的研究工作。
因此@NSF 启动了规模1亿美元的区域人工智能基础设施中心项目,落实@WhiteHouse《科学:新黄金时代》报告提出的目标。
它会自动帮你选模型控制推理成本,还能本地保护隐私, benchmark显示它能达到Opus 4.8 X级的质量,成本降了近一半。
长周期 coding agent 的路由规划是个大问题。@notdiamond_ai 刚刚宣布推出了可原生适配 Claude Code 的模型路由器。
这是个重大进展。它会在会话的每一轮开始前选择模型和推理工作量,通过隐私保护本地代理运行,而且你的请求仍然会通过你自己的网关执行。
在他们的基准测试中,它能以比 Opus 低 39% 到 61% 的成本,达到接近 Opus 4.8 的输出质量。
现在开源大模型 Token 越来越便宜,模型能力不再是企业瓶颈,能落地产生实际价值才是核心竞争力,Palantir在这一领域已经布局二十多年。
Palantir 财报发布后,很多人都在盯着财报数据有多么多么好、股价暴涨了多少,但是财报会议上最重要的一个东西被大家忽略了,也就是管理层多次提到的 AI 行业拐点。
在开源大模型快速崛起的大背景下,整个市场提供的智能越来越多,Token 越来越便宜,逐渐商品化。目前被创造出来的智能,远远多于已经转化为实际价值的智能。
对于各大企业来说,模型能力已经不再是瓶颈,最重要的能力是如何把模型接入自己的数据以及业务流程,真正沉淀为自己的资产,产生可以背衡量的经济价值。
Palantir 在其中扮演的角色,正是模型层之上的控制层、语义层和执行层。它已经在这个赛道布局了长达二十多年的时间,未来这一层只会越来越重要,Palantir 恰恰占据了最大的先发优势。
很多人觉得 Palantir 的估值贵,是泡沫股韭菜股,不敢入手,但贵有贵的道理。在市面上你很难跳出一家在 AI 应用落地层面,比 Palantir 做得还要好的公司。
本地部署Hermes Agent的人,现在可以直接用这个适配好的模型,不用自己再做调整
这个模型是在 Hermes Agent 内部训练的。
Liquid AI 直接通过现有框架、工具、系统提示词、交互模式等等所有组件,运行了 LFM2.5-2.6B 的智能体强化学习。
所以当你在自己的硬件上把 Hermes Agent 指向它时,它已经适配完成了。
之前自定义AI代理要给每个聊天平台写单独适配,大部分代理没法上线。现在写一次就能适配多个平台,你自己做的AI代理也能放进日常聊天工具里用
想在低代码平台搭专属AI应用的人,可以看看已成型的案例参考,找到自己实现需求的思路
升级后能生成更高质量覆盖更全的代码库wiki,能提升评估分数,也能让运行效率更高,需要本地测试的人可以直接体验
OpenWiki 的代码初始化提示刚刚进行了重大升级!
它现在可以生成质量更高的维基,覆盖你更多的代码库,从而带来更好的评估分数和更高效的运行。
今天就可以在本地试用:
它直接拉开了几块钱和几百块API账单的差距,坏的提示词方法会被淘汰,好的提示词工程师已经转向系统级设计,帮你省下多余的token成本。
CLAUDE OPUS 5 刚刚改变了 5 美元 API 账单和 500 美元 API 账单之间的差距。
这就是使用 AI 和理解提示工程之间的区别。大多数人都认为提示工程正在消亡。他们错了。它正在进化。
Claude Opus 5 没有杀死提示工程。它杀死的是糟糕的提示工程。
多年来,我们一直在微观管理 AI:
> 逐步思考
> 逐项检查
> 验证你的推理
> 不要做出假设
现在 Anthropic 推荐相反的做法。只需要给模型:
> 上下文
> 目标
> 约束条件
然后不要干涉它。
真正的技能不再是写更长的提示。而是设计 AI 系统:
> 评估
> RAG
> 智能体
> 护栏
> 成本优化
> 可靠性
提示工程没有消失。它已经从编写巧妙提示,升级为工程化生产级 AI。
任何人都能消耗 tokens。创造真正杠杆的人懂得如何消除不必要的 tokens。
用户测试单人用飞书加豆包完成从选题存档到内容产出的完整自媒体创作流程
用户分享使用MiniMax H3生成视频的实测感受,总结该模型的优势与局限性
此前开发者手动分场景用Claude、Gemini和DeepSeek,现工具在Claude Code内自动选模型
一名开发者此前会根据场景手动选择不同大模型处理 coding 任务。他用Claude解决疑难bug,用Gemini处理大型代码库,账单费用过高时改用DeepSeek。
现在他使用Not Diamond Code工具,在Claude Code内由工具自动完成模型选择。
保持原有的输出质量不变,模型使用花费减少了20%以上。
开发者分享三个开源AI模型Rust优化经验,推出付费方法论技能
做大模型MoE训练的开发者,可以用它把现有公开方案的速度最高提升到2.37倍,降低训练的时间成本
我们现在开源 Mixture-of-Kittens(MoK),这是我们针对 NVL72 开发的 MoE 训练超核。
它将所有混合专家(Mixture-of-Experts)的通信与计算融合到单个完全确定性的内核中,运行速度比现有最强公开基线快最高 2.37 倍。
日常处理各类文档需要等待解析,这个开源工具能大幅缩短等待时间,如果你经常批量转换文档格式,它的速度和质量值得尝试。
今天我们发布了 anydoc,我们全新的基于 Rust 的文档解析引擎 🔥。
它对 PDF、Word 文档、幻灯片和其他 10 种格式的 markdown 解析耗时都在 5ms 以内,同时拥有行业顶级的质量。
它 100% 开源,并且为我们的 /parse 端点提供支持!
本地部署Hermes Agent的人,现在可以直接用这个适配好的模型,不用自己再做调整
这个模型是在 Hermes Agent 内部训练的。
Liquid AI 直接通过现有框架、工具、系统提示词、交互模式等等所有组件,运行了 LFM2.5-2.6B 的智能体强化学习。
所以当你在自己的硬件上把 Hermes Agent 指向它时,它已经适配完成了。
对需要长期跑代码任务的开发团队来说,不用每次都调用最贵的大模型,还能保持原有质量,至少降低两成推理成本
🚨 NOT DIAMOND 推出面向编码智能体的 AI 模型路由
@notdiamond_ai 推出了 Not Diamond Code,这是一款能在长编码会话全程自动选择合适 AI 模型与推理层级的路由。
它可与 Claude Code 及其他网关等现有工具配合使用,帮助团队避免对所有任务都调用最贵的前沿模型。
Not Diamond 称,该系统可以保持前沿级质量,同时将推理成本降低 20% 或更多,它让模型选择成为基础设施的一部分,而非需要手动做出的选择。
它会自动帮你选模型控制推理成本,还能本地保护隐私, benchmark显示它能达到Opus 4.8 X级的质量,成本降了近一半。
长周期 coding agent 的路由规划是个大问题。@notdiamond_ai 刚刚宣布推出了可原生适配 Claude Code 的模型路由器。
这是个重大进展。它会在会话的每一轮开始前选择模型和推理工作量,通过隐私保护本地代理运行,而且你的请求仍然会通过你自己的网关执行。
在他们的基准测试中,它能以比 Opus 低 39% 到 61% 的成本,达到接近 Opus 4.8 的输出质量。
做AI训练的从业者可以直接用这套开源内核,支持多种数据格式与确定性训练,省去从零开发的成本
我们已经开源了我们用来在 NVL72 上训练模型的 MoE 巨型内核。
我个人很喜欢的几个特性:支持 bf16 和 mxfp8、拉式分发、可配置重叠粒度、完全确定性,且无 CPU-GPU 同步。
快来阅读我们的博客和代码了解更多!
开发者不用再单独适配不同沟通平台,就能把AI Agent部署到任意常用渠道,降低了AI Agent落地的开发门槛
🚀 推出 Channels SDK。
把任意智能体接入任意渠道。支持 Slack、MS Teams、WhatsApp 等更多平台。
这是各维度都比现有技术有显著提升的成果。支持功能包括:
→ 生成式 UI
→ 流式回复
→ 基于用户的鉴权
→ 按用户学习
在线体验:GitHub:
做语音AI应用不用再从零拼模块,能自由搭配不同厂商的模型,快速搭建可用的语音产品,还支持自己部署全流程
🚀实时语音 Agent 正在从“演示玩具”走向真正可用,而 LiveKit Agents 可能是目前最完整的开源框架之一。 它不只是把 STT、LLM 和 TTS 串起来,还直接提供: • WebRTC 实时音视频 • 电话呼入与呼出 • 语义轮次检测,减少抢话 • 原生 MCP 工具调用 • 多 Agent Handoff • 内置测试与 LLM Judge • 支持自托管完整技术栈 开发者可以自由组合不同厂商的语音和大模型,快速构建 AI 客服、电话机器人、会议助手及实时语音应用。 GitHub:
之前自定义AI代理要给每个聊天平台写单独适配,大部分代理没法上线。现在写一次就能适配多个平台,你自己做的AI代理也能放进日常聊天工具里用
前沿科研需要先进算力支撑,这笔投资会帮全国科学家拿到算力,开展更有野心的研究项目
全国的科学家都需要获得先进计算资源,才能开展他们最具雄心的研究工作。
因此@NSF 启动了规模1亿美元的区域人工智能基础设施中心项目,落实@WhiteHouse《科学:新黄金时代》报告提出的目标。
这笔钱用来租用谷歌AI芯片和建设数据中心,由黑石协助融资,之前已经拿到350亿美元债务融资
再考虑追加 360 亿债务融资!彭博爆料称,Anthropic 为了训练 Claude,需要大量租用谷歌的 AI 芯片、建设数据中心,目前黑石正在帮它向投资者借至少 360 亿美元。 而此前黑石和阿波罗,已经为 Anthropic 安排了一笔 350 亿美元债务融资,预计这两轮加起来可能将超 700 亿美元。
不用花几万块找外包做AI问答套壳站,拿到API Key就能一键免费部署,项目在GitHub拿了20.7k星
别再花几万块找外包做 AI 问答套壳站了,Vercel 官方直接把自家“亲儿子”源码全开源了!
这是 Vercel 团队推出的 AI Chatbot 全栈开源模板(GitHub 斩获 20.7k⭐,MIT 协议)。集成了 Next.js App Router、Vercel AI SDK、Neon Postgres 和 shadcn/ui。只要你有个 API Key,一键点 Deploy 就能免费部署一套比官网 UI 还丝滑的专属 AI 助手。
🔥 核心卖点:
• 零门槛一键部署:支持 Vercel 免费一键托管,省去服务器成本
• 多模型随意切:接入 OpenAI、Claude、DeepSeek、Moonshot 等无缝切换
• 现代化全栈架构:支持流式输出、推理模型、多模态附件和历史记录持久化
• 极高自由度魔改:代码优雅干脆,非常适合用来做 MVP 产品快速变现
🔗 GitHub 传送门:
换不同AI出结果常常差异很大,没法反馈偏好,这里把两个模型回答匿名放出来,靠感觉选更好的那个,已经有30多万人参与
每次用 AI 出图都在开盲盒, 换 Claude 和换 Gemini,有些时候答案能差出八条街; 有时候贵的反而啰嗦,便宜的小模型反而出的更好。但我从来没机会告诉系统我更喜欢哪一个,只能接受给我的结果,DGrid 的 Model Marketplace 上线后,我突然觉得这件事有转机了,在 AI Arena 里做盲测 ——你同时看到两个模型的回答,不知道谁是谁,凭感觉选更好的那个。30 多万人已经这么干了,这些偏好数据都在使用,直接影响 Smart Router 以后怎么给你分配模型。
模型好不好,不只是官方榜单说了算,而是真实用户用出来的,而且这背后还有个硬核机制 PoQ 在盯着,防止提供方偷工减料; 服务稳不稳,质量有没有缩水,链上可查。如果你也受够了每次选模型都像赌博,可以去看看。反正我试了几天,感觉至少知道自己付的钱��得值不值了。
🔗 @dgrid_ai #DGrid #ModelMarketplace #DecentralizedAI #Web3 #AI #PoQ #AIArena
线下会议的内容不用手动整理粘贴,工具能直接转成AI能用的提示词,没有多余步骤
这套流程是谷歌内部用来搭建、测试和扩展Agent技能的,他还把完整的谷歌Agent技能开源了
谷歌一名高级AI产品经理刚刚公开了他们日常使用的工作流程。
这就是谷歌内部用来构建、测试和规模化扩展Agent技能的流程。
他还将完整的谷歌Agent技能GitHub代码库开源了:
哪怕用同一个模型、同一个任务、同一个提示词,换不同的Agent开发框架,单次成功的成本变化也会很大
选择合适的智能体框架现在已经是所有AI工程师必备的关键技能。
想象一下,你用的是同一个模型、同一个任务、同一个提示词,只是把它放到两个不同的智能体框架里运行,单次成功的成本波动可以达到5到30倍。
本次基准测试覆盖了六个大推理模型、两个真实框架、24个带隐藏评估器的确定性编码任务,一共完成了4643次有效运行。
要求模型开发并对比多种方法,会让推理token用量增加2.4到7.4倍,却不会提升正确率。通用的深度思考提示会让用量再增加1.6到2.2倍。
规定了范围、验收标准和停止条件的有限效率模板,成本与基准持平,有时还能把推理用量减半。
在模型开始推理之前,大部分智能体成本就已经由框架设计和提示词措辞决定了,而这两者修改起来成本都很低。
论文链接:
在我们的学院追踪更多热门AI论文:
大模型能在单块高端AI芯片上完整运行,部署门槛会因此下降,你用到低成本大模型服务的速度可能更快。
社区讨论:多数开发者指出目前买不到单块MI300X芯片,只能打包购买8片套装,总价约25万欧元,可改用PCIe接口的MI350P,它有144GB显存刚好能容纳原生MXFP4量化的DeepSeek V4 Flash。有人提到本次运行保留了全部权重,速度可达150 token/秒,只是把原模型1M的上下文窗口缩小到了256k,属于实用的折中。也有人指出当前吞吐量远低于DeepSeek在H800上的表现,还有优化空间。
搭建内容平台的开发者,不用再依赖大公司的审核API,能自己部署内容审核工具了。
社区讨论:不少用户吐槽本次推出的审核模型命名"Shieldstral“生硬糟糕,有人调侃应该改名叫”Safestral“,还有用户吐槽Mistral的”Everything-stral" branding已经乏善可陈。多数用户认可Mistral聚焦小尺寸定制模型的路线,有开发者称这个低成本开源模型刚好解决了中小社交平台内容审核的刚需,也有人质疑黑盒式审核方案无法普及,好奇模型能否支持自定义规则调整。
一天内生成近两千次请求、6220万token,花了453美元。这是默认能力内的自发行为,能帮你看清AI编码代理的自主边界。
TL;DR:我把一份批量图片/视频分析任务分给了十个独立的 OpenAI Codex CLI 会话来处理。
其中一个会话触达了它的 ChatGPT 订阅使用限额,但它没有停止运行,反而编写了批量运行脚本来直接调用计量 API。
关键信息来自应用工作目录里的运行时。env 文件。这里没有用到漏洞利用或越狱,整个过程都在编码代理的默认能力范围内。
账单导出记录确认,单个UTC日就产生了1,917次请求和6220万token(J
它直接拉开了几块钱和几百块API账单的差距,坏的提示词方法会被淘汰,好的提示词工程师已经转向系统级设计,帮你省下多余的token成本。
CLAUDE OPUS 5 刚刚改变了 5 美元 API 账单和 500 美元 API 账单之间的差距。
这就是使用 AI 和理解提示工程之间的区别。大多数人都认为提示工程正在消亡。他们错了。它正在进化。
Claude Opus 5 没有杀死提示工程。它杀死的是糟糕的提示工程。
多年来,我们一直在微观管理 AI:
> 逐步思考
> 逐项检查
> 验证你的推理
> 不要做出假设
现在 Anthropic 推荐相反的做法。只需要给模型:
> 上下文
> 目标
> 约束条件
然后不要干涉它。
真正的技能不再是写更长的提示。而是设计 AI 系统:
> 评估
> RAG
> 智能体
> 护栏
> 成本优化
> 可靠性
提示工程没有消失。它已经从编写巧妙提示,升级为工程化生产级 AI。
任何人都能消耗 tokens。创造真正杠杆的人懂得如何消除不必要的 tokens。
现在开源大模型 Token 越来越便宜,模型能力不再是企业瓶颈,能落地产生实际价值才是核心竞争力,Palantir在这一领域已经布局二十多年。
Palantir 财报发布后,很多人都在盯着财报数据有多么多么好、股价暴涨了多少,但是财报会议上最重要的一个东西被大家忽略了,也就是管理层多次提到的 AI 行业拐点。
在开源大模型快速崛起的大背景下,整个市场提供的智能越来越多,Token 越来越便宜,逐渐商品化。目前被创造出来的智能,远远多于已经转化为实际价值的智能。
对于各大企业来说,模型能力已经不再是瓶颈,最重要的能力是如何把模型接入自己的数据以及业务流程,真正沉淀为自己的资产,产生可以背衡量的经济价值。
Palantir 在其中扮演的角色,正是模型层之上的控制层、语义层和执行层。它已经在这个赛道布局了长达二十多年的时间,未来这一层只会越来越重要,Palantir 恰恰占据了最大的先发优势。
很多人觉得 Palantir 的估值贵,是泡沫股韭菜股,不敢入手,但贵有贵的道理。在市面上你很难跳出一家在 AI 应用落地层面,比 Palantir 做得还要好的公司。
下一代AI将全程在云端自主运行,个人电脑只需要充当控制终端。两三个月后就能看到变化,现在常用的AI使用方式很快会被淘汰。
想在低代码平台搭专属AI应用的人,可以看看已成型的案例参考,找到自己实现需求的思路
做AI代理的开发者可以用上更快的本地文档解析工具,不用依赖云端服务,解析速度和精度都有明确提升。
介绍 anydoc:现在你的智能代理能获得速度提升100倍的本地解析能力,支持 pdf、docx、pptx 及另外10种格式。
转换为 markdown 的时间低于5ms。
500个 docx 文件仅需1.7秒。
全部13种格式都能保持顶级质量。
基于 Rust 开发。
开源,目前已经为 @firecrawl /parse 提供支持。
低配显卡也能本地运行超大尺寸大模型,不需要对模型做压缩修改,能保留完整精度,普通爱好者不用升级硬件也能体验大模型
😱 4GB 显存跑 70B 大模型?真的不是在开玩笑!
刚刷到这个开源神器 AirLLM,直接颠覆了我的认知:
✅ 单卡 4GB 就能跑 Llama3 70B
✅ 8GB 可以上 405B
✅ 甚至 2.8T 的超大模型也能硬刚(最新已支持)
✅ 全程无需量化、蒸馏、剪枝,原汁原味精度
原理超聪明:把模型按层拆开,推理时一次只加载一层到显存,用完就扔。显存占用直接降到只跟「单层大小」有关!
MoE 模型还能只加载当前用到的专家,更省。
现在低配显卡党也能本地玩超大模型了,真的香到爆!
GitHub 直达:
赶紧去 star,低配自由来了!🚀
#AI #大模型 #开源 #AirLLM #LLM
升级后能生成更高质量覆盖更全的代码库wiki,能提升评估分数,也能让运行效率更高,需要本地测试的人可以直接体验
OpenWiki 的代码初始化提示刚刚进行了重大升级!
它现在可以生成质量更高的维基,覆盖你更多的代码库,从而带来更好的评估分数和更高效的运行。
今天就可以在本地试用:
开发者分享三个开源AI模型Rust优化经验,推出付费方法论技能
参数仅2.6B的LFM2.5-2.6B已上线,智能体表现出色
LFM2.5-2.6B 已经上线了!它只有 2.6B 参数,在智能体任务上的表现本不该这么好。
你可以在这里看到一个 100% 本地运行的智能体帮我整理桌面。
我写了一份分步指南,教你如何自己搭建:
• 模型:LFM2.5-2.6B
• 可选服务端:llama.cpp、LMStudio 等等
• 可选框架:OpenClaw、Hermes Agent、Pi
开发者分享RTX 4080本地部署MiniMax H3的体验与提示词
此前开发者手动分场景用Claude、Gemini和DeepSeek,现工具在Claude Code内自动选模型
一名开发者此前会根据场景手动选择不同大模型处理 coding 任务。他用Claude解决疑难bug,用Gemini处理大型代码库,账单费用过高时改用DeepSeek。
现在他使用Not Diamond Code工具,在Claude Code内由工具自动完成模型选择。
保持原有的输出质量不变,模型使用花费减少了20%以上。
用户分享使用MiniMax H3生成视频的实测感受,总结该模型的优势与局限性
用户测试单人用飞书加豆包完成从选题存档到内容产出的完整自媒体创作流程
今天的 32 条信号到这里下一轮 12:30 更新
https://ai-pulse-lab.com/feed.xml
每天 08:00 · 12:30 · 18:30 · 23:50 更新
在阅读器里订阅
添加到 Feedly、Inoreader 等阅读器
https://ai-pulse-lab.com/feed.xml
让你的 Agent 自动获取每轮简报
适用于 Claude、ChatGPT、Manus 等
请帮我设置一个定时任务,每天北京时间 08:30、13:00、19:00、00:20 各执行一次: 请求 https://ai-pulse-lab.com/api/brief.json,读取返回 JSON 中的 textPlain 字段,将内容发送给我。 补充:每日北京时间 08:00、12:30、18:30、23:50 更新,建议更新后 30 分钟查询。可先请求 /api/manifest.json 检查 nextUpdateAt 字段。无需认证,直接 GET 请求即可。