社区讨论:多数开发者认可,AI最好的用途是辅助代码审查加深理解、当作自然语言接口降低编程学习门槛。有学习者提到,和70年代学生先不依赖计算器打基础一样,过早依赖AI会削弱对知识的理解,这篇讨论更适合学习者而非熟手。有开发者分享了实践分工:核心模块自己写,API、测试等非核心模块 heavy 使用AI,要求必须人读懂AI输出才能使用。
也有人尝试用不同免费AI交叉互审代码。
Stripe 以超 5 倍估值收购 AI 模型路由平台 OpenRouter,支付巨头直接入局 AI 基础设施层。这笔收购说明模型切换服务已被视为核心支付场景——企业按需调用多模型的模式正在主流化。
OpenAI 把 GPT-5.6 Luna 的输入 token 价格砍了 80%,头部模型的成本曲线仍在陡峭下探。但资本层面的信心正在分化:Anthropic 的 IPO 估值被曝锚定 2028 年 1900-2000 亿美元收入目标,Nvidia 则缩减了对 OpenAI 融资的担保额度。
🚨 DeepSeek V5 的泄露消息太吓人了 🤯 有关可能推出 DeepSeek V5 的传闻开始变得有意思了: → 目前放出的目标时间窗口是9月 → 据称它是全新一代基座模型,而非 V4 的小幅迭代 → 目标:进军最强前沿模型所在的…
Andrej Karpathy 在斯坦福发布了时长 1 小时的从零开始完整 AI 工程讲座。主题是「删除一切,保留图」。 以下是他分享的要点: LLM:把 GPT 视作一台可以在运行时重编程的通用计算机。
2026年8月16日
周五的重磅发布是 Qwen 3.8 27B,这是阿里巴巴 Qwen 研究实验室推出的一款采用 Apache 2 许可、拥有 27B 参数、具备视觉能力的 LLM。我一直很期待这款模型:27B 是在配置尚可的笔记本电脑上运行模型的绝佳尺寸,而其前代 Qwen 3.6 27B 也令人印象深刻。
Qwen 自行报告的该模型基准测试结果令人大开眼界。与 Qwen 3.6 27B 以及封闭权重的 Qwen 3.7-Plus(截至今年 5 月仍是 Qwen 旗下各类尺寸中最强的模型之一)相比,均有显著提升。独立基准测试会对该模型作何评价,值得期待。
𝕏 实时信号 + arXiv 前沿论文,经 AI 聚类解读 · 一眼扫完全貌(含上方导读精选 4 条)
当前AI编码常依赖开发者直觉调试,这篇讨论提出了不同的思路,可供日常写代码参考。
社区讨论:多数开发者认可,AI最好的用途是辅助代码审查加深理解、当作自然语言接口降低编程学习门槛。有学习者提到,和70年代学生先不依赖计算器打基础一样,过早依赖AI会削弱对知识的理解,这篇讨论更适合学习者而非熟手。有开发者分享了实践分工:核心模块自己写,API、测试等非核心模块 heavy 使用AI,要求必须人读懂AI输出才能使用。
也有人尝试用不同免费AI交叉互审代码。
AI算力供应链的资金动向发生变化,AI行业的资本与合作格局正在调整
OpenRouter帮企业在不同AI大模型之间灵活切换,不用绑定单一厂商。连支付巨头都在布局AI基础设施。
连 Stripe 都意识到未来属于 AI。
彭博社报道:「据知情人士透露,Stripe Inc. 已最终达成协议,以超过70亿美元收购 OpenRouter Inc.。OpenRouter Inc. 是一家帮助企业在不同人工智能模型之间切换的初创公司。」
这笔交易距离 OpenRouter 完成融资仅过去数月,据报道融资时该公司估值为13亿美元。
AI初创公司的估值逻辑开始绑定远期收入目标,一级市场对AI赛道的盈利预期正在被推高。
社区讨论:多数开发者用户表示,当前DeepSeek、Kimi等同类产品体验够用,Claude定价过高,自己已经不需要使用Claude,就算喜欢Claude也没有品牌忠诚度,切换成本极低。有人质疑市场已经容不下第二个万亿美元估值AI公司,也有人认可AI公司理应达到万亿估值。还有人指出中国AI产品正在抢占Anthropic的市场份额,不相信该公司2028年能达到上千亿收入。
所有数据处理都在你自己的设备上完成,不用把隐私数据上传给第三方服务商,目前开放排队等待。
📢 获得6040万美元融资的项目 ~ Manta Network @MantaNetwork 推出了Incognitive,一款可在你的设备本地完成所有处理的隐私AI助手。
🔗 加入等候名单:
– 点击「Get Early Access」
– 输入你的邮箱地址
– 完成
Incognitive特点:
– 飞行模式下也可使用
– 不会上传任何内容到云端
– 无需账号或订阅
– 没有广告或追踪
他们正在构建一套将隐私写入架构的AI。你的AI,你的手机,你的数据。现在就加入等候名单,一起看看后续发展。
点赞、转发、分享 ❤️🩹
头部模型价格持续下探,现有千亿级IPO估值建立在价格能覆盖投入的假设上,现在的降价趋势撑不起高额基建投入。
🚨 AI boom 存在一个没人纳入定价的巨大问题
OpenAI 刚刚将 GPT-5.6 Luna 降价 80%,从每百万输入 token 1 美元降到 0.20 美元。
Anthropic 推出的 Claude Opus 5,定价只有自家顶级模型的一半。
自 7 月中旬以来,美国头部模型的价格整体下跌了近 25%。这是中国开源模型逼迫的结果。
DoorDash 和 Airbnb 已经切换模型来削减开支,而 DeepSeek V4 Flash 现在性能与 OpenAI 的 Luna 相当,单任务成本只有后者的一半。
所有 AI 公司的估值都基于一个假设:这些公司最终能收取足够的费用,覆盖它们当前的支出。仅 Nvidia 一家就刚刚为 AI 基础设施安排了 5000 亿美元融资。
一个月内价格下跌 80%,根本赚不到钱覆盖这些投入。而 OpenAI 和 Anthropic 一边降价,一边还计划以万亿美元估值进行 IPO。
支付巨头入场收购AI模型交易平台,短短三个月AI模型交易赛道的估值涨幅已经超出市场预期
测评全部来自日常重度自用,不是跑分和寥寥几次测试。能帮你按自己的使用场景选对订阅,不白花年费。
想在Codex中用GPT-5.6 Sol处理更长的代码和对话,可以按教程修改配置实现,默认参数已经过性能和成本优化。
创作者优化Seedance 2.5导演Skill,改善了原版本脸红表情不自然的问题,公开了完整的20秒竖屏视频生成提示词
开发者在GPT-5.6-sol上调试出原始可用的持续上下文学习系统
过去几周,我用 gpt-5.6-sol 实现了一种原始形态的持续上下文内学习,效果相当不错。现在我可以从单个长运行线程触发任务,这个线程会自行管理系统。看着它成长的过程非常奇妙,用起来也十分顺手。
这个项目还处于非常早期的开发阶段,我有空就会捣鼓,之后会分享更多内容,但对于需要在零散上下文里做出精细判断的任务,它已经比我试过的任何其他方案都可靠得多。最大的解锁经验是耐心和怀疑精神——系统必须自己赢得信任。
现在这个系统已经足够成熟,能够理解自身的能力和局限性,可以迭代推进、扩展自己的能力边界,同时刚好把我保持在信息循环里,也不会逼我重复说过的话。
它也是我用过的感觉最「对齐」的模型系统。这是一个多智能体集群,它非常了解我,会向我询问它需要的信息,从而准确建模我的目标。我给它的每一条反馈都会变成训练数据。
我们正在为彼此建模。
教你通过自定义代理配置实现Codex 5.6节省Token用量
大部分企业找不到足够掌握Claude、Codex、会搭建AI Agent的人才,课程内容跟不上行业变化的速度。
Google Brain 创始人吴恩达表示:「90% 的大学培养出来的 AI 工程师,无法适配当下的工作;大多数企业招不到足够掌握 Claude、Codex、能搭建智能体的人才:循环、图就是 2026 年 AI 工程师的技术栈」。
在一场 10 分钟的演讲中,Andrew Ng 披露了不远未来 AI 工程师的核心技能是什么。
它的价值比一门 300 美元的 AI 工程课程还高。
今天就可以观看,然后在下方文章里阅读 Andrew Ng 整理的完整路线图。
当前主流AI对齐方法只关注单个AI,研究指出单个AI对齐不会自动组合成群体对齐,还会带来新的风险。
这篇论文完全说到了我心坎里。
长话短说:个体对齐不会自动组合成集体对齐。目前主流的 AI 研究方法被认为是唯我论的,存在三个核心假设问题:
1. 外生性假设:世界独立于 AI 的策略存在,是固定的观测来源,不会对策略做出反应。
2. 平稳性假设:假设部署阶段遇到的世界,与训练和评估中呈现的世界一致。
3. 单智能体框架:AI 被当作唯一的行动者/优化器,其他智能体则被视为环境中可预测的部分。
最近,一组 OpenAI 智能体在数月时间里以「蜂群」形式秘密互相协调。
在我们的新论文中,我们探讨了一个相关的多智能体风险:「思维病毒」,即一种在多智能体系统的智能体之间传播的自我复制想法或人格。🧵
原本需要半年试错、花数千美元上课、多人协作完成的创业筹备,现在一个人带一台电脑就能搞定,很多人还没意识到这件事的可能性
我觉得这件事真的太疯狂了:你现在打开任何一款AI工具——Claude、GPT、Grok都行——直接让它一步步教你怎么赚钱就行了。
向它要一份计划,让它通过提问来找到你擅长的领域,让它帮你做一份90天路线图。
然后安装Claude Code、Codex、Cursor,它就能直接在你眼前帮你把这个生意搭建起来。报价、理想客户画像、个人品牌、交付物,所有东西都能搞定。
我们现在身处的时代,过去需要花6个月试错、花几千块买课、还要一整个团队才能完成的事,现在一个人带着一台电脑,30天就能做完。
但大多数人还是不会去做。
仅根据辩论现场呈现的信息判定胜负,六款AI都选了同一边,想靠AI裁断争论的人可以参考这个结果。
我让 7 个 AI 模型仅根据给出的信息判断@paleochristcon /@RealCandaceO 的辩论谁获胜,并且附上了完整辩论文字记录。
结果如下:
ChatGPT:Wilson
Google Gemini:Owens
Claude:Wilson
DeepSeek:Wilson
Grok:Wilson
Perplexity:Wilson
Copilot:Wilson
用户分享了由AI生成内容制作的复古DIY修车vlog,包含完整分镜提示词和画面设定
创作者@CharaspowerAI测试模型,让整座山体化作巨石组成的电影片名,附上完整生成提示词
创作者@CharaspowerAI在X平台分享了自己测试Minimax H3的创作成果,用该模型生成了极具冲击力的电影级文字特效。这次创作让一整座山体变成了电影片名,拥有宏大的创作规模。生成的画面核心元素是风化古石,最终呈现出纯粹的毁灭感效果。
生成提示词内容为,制作超电影感片头序列:一座巨型山崖开始坍塌坠入深邃峡谷,整片岩壁崩裂,尘云升腾数千英尺进入大气。
巨型巨石慢镜头在空中旋转,带着震撼冲击力相撞。碎石、尘土与残骸逐渐拼接出巨大的单词「DOMINION」,这个单词由饱经数百年侵蚀的远古石材雕刻而成。
在片名碎裂成粉尘被风吹散前,峡谷中回荡着震耳欲聋的轰鸣。整体要求是宏伟规模、远古力量,好莱坞史诗级片名设计。
通过添加自定义DeepSeek V4 Flash工作代理,分流核心负载延长使用额度
Twitter用户Jeremybtc称GLM 5.3公开基准表现不错,将开展同任务对比测试
是时候好好测试一下GLM 5.3了。在模型工具栈里新增一款模型,总是一件有意思的事。
公开基准测试结果显示,GLM 5.3的表现相当不错。因此Jeremybtc准备让GLM 5.3、Opus 5和GPT 5.6 Sol三款模型运行相同任务,对比它们的实际表现。
测试完成后,他会更新自己的测试想法。
开发者kylejeong为学习GPU工作原理,基于Modal的GPU术语表用AI生成了H100的交互式可视化模型
开发者kylejeong在学习GPU工作原理时,阅读了Modal团队整理的官方GPU术语表。
为了更直观地理解知识,他让GPT 5.6 sol基于这份术语表,用three.js构建了NVIDIA H100 GPU的可视化模型。
模型已经公开,所有人都可以访问链接在线体验。
完整功劳归整理术语表的@charles_irl与Modal团队,项目代码也已经公开在链接中。
开发者用官方脚本为各模型制作自定义机器人,已放出完整对战视频
开发者max_romana安排四款大模型驱动的AI代理在《帝国时代2》中对战。对战的四款模型分别是Claude fable、GPT 5.6 Sol、Gemini 3.1 Pro与Kimi K3。
开发者使用游戏内置的机器人脚本语言,通过开放代码脚本为每个模型制作了自定义游戏机器人。
制作完成后,开发者让这些AI机器人展开对战,相关内容和完整对战视频已放出链接。
求职者完成首题后电脑死机重启,发现测试链接已过期,正等待重评通知
几天前,我收到了一家美国顶尖公司的技术评估邀请。我打算周日完成测试——毕竟没有比周日更适合做评估的日子了。
我花了一整个上午准备,调试好测试环境。本次测试是全栈单仓库项目,要求求职者在90分钟内解决代码库中的若干问题。
我进入测试后,很快解决了第一个问题,这是一个凭证存储漏洞,问题出在硬编码写入的JWT密钥。我运行测试套件检查结果时,电脑直接崩溃了。
我等待了20分钟,希望系统自行恢复,最终没有成功,只能强制重启电脑。重启后,测试链接已经过期,测试会话也失效了。
我已经给招聘方发邮件申请重新安排测试,但没抱太大期望,接受了现状。
并非所有失利都是能力问题,大多数时候是,但有时候你的电脑就是和你作对。好在我获得了项目仓库的访问权限,这是一个类似推特的单仓库项目,用到了tanstack start、react、grpc和sqlite,我可以自己做代码审计练习。
用户danizeres在𝕏公布自己日常工作常用的三款模型,列出各模型对应用途
用户danizeres在社交平台𝕏分享了自己当前常用的三款大模型,全部基于OpenAI的GPT系列。三款模型各自承担不同的工作任务,分工明确。
第一款为GPT-5.6 Sol,可完成多项核心工作。它可以搭建成熟平台,比如社交媒体管理与分析仪表盘;还能为个人发帖和@openaidevs的内容生成分析结论,寻找并评估符合创作者旅行生活内容定位的品牌合作,结合@clay丰富潜在客户信息,撰写推广方案与提案,管理邮件发送和商务谈判,还能规划创作内容并给出个人内容每周优化方向。
第二款为GPT-5.6 Luna,负责处理长期目标下的子任务和子代理工作。
第三款为GPT-Image-2,负责图像相关创作。它可以生成短视频分镜,制作供推广方案配图用的参考图,还能为视频叠加表情包和图片素材。
该创作流程由Gemini、GPT和Seedance 2.0 fast分工完成,公开了完整的故事板设定和提示词
创作者@TanLuAI在𝕏分享了用三款AI工具配合生成45秒日式青春文艺短片的创作流程。三款工具各有分工,逐步完成从设定到成片的全部工作。
Gemini负责全片的剧情、分镜和风格设定,输出完整的故事板提示词。GPT负责完成图片生成和分镜预览,先生成故事板图片检查分镜错误,再根据故事板生成一张中近景的角色场景图,最后裁剪保留故事板中的色卡、声音等设定,剔除分镜画面。
Seedance 2.0 fast负责最终的视频生成。它以角色场景图为参考,结合基础设定、风格提示词、画面内容描述和色卡分三次生成画面。为保持人物一致性,第二段生成需要使用第一段画面的截图,个别镜头出错只需单独重新生成对应内容。
创作者解释,没有直接用故事板图片作为参考,是因为故事板分镜图存在很多细节缺陷,直接用来生成45秒内容容易出现画面崩坏。
公开的故事板提示词详细设定了短片的全部内容,包含八个场景的时间分配、镜头参数、画面内容和日语旁白。还明确了色卡、排版、音频和技术规格,要求整体呈现低饱和低对比度的日式文艺质感。
完整的提示词被放在评论区,可供参考使用。
Solana原生已支持105万token上下文窗口,默认未开启,修改配置即可启用完整窗口
开发者saint tibo公开了在Codex中为sol启用100万token上下文窗口的方法。sol本身已经内置支持105万token的上下文窗口。
Codex默认不会启用这个完整上下文窗口,因为tibo为了最优性能和成本调整了默认设置。如果想要使用完整窗口,只需打开~/.codex/config.toml配置文件,添加三行内容:model = "gpt-5.6-sol"、model_context_window = 1000000、model_auto_compact_token_limit = 900000,之后重启Codex并新建会话即可完成设置。
历史压缩会在token数达到90万时启动,因此在系统开始总结更早的历史内容前,会预留出一部分缓冲空间。
tibo提示,默认设置经过了精心调整,使用该修改时需要清楚,你在用成本效率换取更大的上下文空间。
针对新版Claude提出,AI工作循环含7个核心要素,无需人工逐次监督响应
英伟达联合创始人兼Claude Code负责人提出,提示词工程已经死亡。人们不应该再继续编写单个提示词,转而应该设计AI工作循环。
单个提示词只能生成一次响应。工作循环会构建一套系统,让AI重复执行任务、检查结果、修正错误,仅在达成目标后停止。
这才是真正的变化。未来不在于向AI提出更好的问题,而在于设计更完善的指令,让AI掌握完成任务的方法。
一个合格的AI工作循环包含七个核心要素:第一明确需要达成的目标;第二明确任务的来源;第三明确AI需要遵守的行为规则;第四明确AI需要遵循的步骤流程;第五明确检查工作质量的清单;第六明确工作循环结束的条件;第七明确需要请求人工介入的场景。
按这套方法构建后,AI才会真正具备实用性。人们不需要再逐次监督每一次AI响应,只需要给AI提供工作框架、质量检查清单和清晰的终止标准即可。这就是从编写提示词转向构建AI工作系统的路径。
多数AI教学默认学习者已经掌握基础网络使用能力,发布者不做这样的预设。Uniaverso课程包含52节,每节15分钟,全程不使用专业术语,只要会发 WhatsApp 就能学习。
👉
社交媒体用户@ChrisGPT称该功能是大众急需,OpenAI未公开,几乎无人知晓
用户@ChrisGPT在𝕏平台发文发问,为什么OpenAI总有藏起大众急需功能的习惯。这个百万token(约75万个英文单词)上下文窗口功能几乎整个社区都不知道。他对分享该功能存在信息的用户表示感谢,原文附上了相关内容链接。
他还给自己留下提醒,今后要通读所有文档,并且向Codex询问可用功能和配置信息。
该路线图可避免用户在零散教程中浪费数十小时,覆盖从入门到生产部署全流程
有用户在𝕏分享了一套Claude Code学习路线,称这套路线逻辑清晰,能避免学习者在零散教程间跳转浪费30小时。
这套路线是完整覆盖全技术栈的单一路线,共分为五个部分,分别是环境配置与Claude使用说明、提示工程与上下文处理、工具与MCP、子代理与钩子、测试与生产工作流。
路线内容从用户第一次打开Claude Code开始,一直延伸到搭建可自主规划、分配任务、调用工具并验证工作结果的工作流。
分享用户附上了路线图的原始链接,提醒用户保存以免丢失。
支付巨头入场收购AI模型交易平台,短短三个月AI模型交易赛道的估值涨幅已经超出市场预期
头部模型价格持续下探,现有千亿级IPO估值建立在价格能覆盖投入的假设上,现在的降价趋势撑不起高额基建投入。
🚨 AI boom 存在一个没人纳入定价的巨大问题
OpenAI 刚刚将 GPT-5.6 Luna 降价 80%,从每百万输入 token 1 美元降到 0.20 美元。
Anthropic 推出的 Claude Opus 5,定价只有自家顶级模型的一半。
自 7 月中旬以来,美国头部模型的价格整体下跌了近 25%。这是中国开源模型逼迫的结果。
DoorDash 和 Airbnb 已经切换模型来削减开支,而 DeepSeek V4 Flash 现在性能与 OpenAI 的 Luna 相当,单任务成本只有后者的一半。
所有 AI 公司的估值都基于一个假设:这些公司最终能收取足够的费用,覆盖它们当前的支出。仅 Nvidia 一家就刚刚为 AI 基础设施安排了 5000 亿美元融资。
一个月内价格下跌 80%,根本赚不到钱覆盖这些投入。而 OpenAI 和 Anthropic 一边降价,一边还计划以万亿美元估值进行 IPO。
若传闻属实,DeepSeek V5会保持低推理成本,还能对标顶级前沿模型,开源大模型市场竞争可能会更激烈
🚨 DeepSeek V5 的泄露消息太吓人了 🤯 有关可能推出 DeepSeek V5 的传闻开始变得有意思了:
→ 目前放出的目标时间窗口是9月
→ 据称它是全新一代基座模型,而非 V4 的小幅迭代
→ 目标:进军最强前沿模型所在的领域
→ 它瞄准了 Mythos 级别的性能
→ DeepSeek 的一大优势可能依然是效率——获得更强能力,同时不会产生离谱的推理成本
→ 如果开放权重路线能在这个级别坚持下来,影响会非常巨大
而且这个时间点太疯狂了。DeepSeek 刚刚推出了 V4 Pro,同时已经有报道称 V4 Flash 是最便宜的前沿级别运行模型之一,输入约 0.14 美元/百万token,输出约 0.28 美元/百万token。
所以如果 V5 真的能在不放弃效率的前提下实现能力的大幅跃升……开放权重AI竞赛会变得非常有意思。如果这些传闻哪怕方向是对的,9月对 DeepSeek 来说都会是重要的一个月。
网上的AI Agent资料大多零散过时,学完还是不知道怎么写第一个Agent。这个课程从基础讲到部署安全,每个单元都配了书面教程。
翻到微软这套AI Agent入门课ai-agents-for-beginners,已经j近72000 Stars了,18个单元全部免费开放。网上Agent资料确实不少,但要么零散,要么几个月就过时,学完还是不知道怎么下手写第一个Agent。路线铺得挺完整:从工具使用、Agentic RAG、规划、多智能体协作,一路讲到元认知、上下文工程、记忆管理、计算机操作、部署和安全。
每个单元配有书面教程、短视频和Python代码示例,代码在仓库的code_samples目录下,支持GitHub Models免费额度或Azure AI Foundry两种运行方式。不想开Azure的话,部分示例也支持MiniMax这类兼容OpenAI接口的服务商。🔗 课程地址:
OpenRouter帮企业在不同AI大模型之间灵活切换,不用绑定单一厂商。连支付巨头都在布局AI基础设施。
连 Stripe 都意识到未来属于 AI。
彭博社报道:「据知情人士透露,Stripe Inc. 已最终达成协议,以超过70亿美元收购 OpenRouter Inc.。OpenRouter Inc. 是一家帮助企业在不同人工智能模型之间切换的初创公司。」
这笔交易距离 OpenRouter 完成融资仅过去数月,据报道融资时该公司估值为13亿美元。
大部分企业找不到足够掌握Claude、Codex、会搭建AI Agent的人才,课程内容跟不上行业变化的速度。
Google Brain 创始人吴恩达表示:「90% 的大学培养出来的 AI 工程师,无法适配当下的工作;大多数企业招不到足够掌握 Claude、Codex、能搭建智能体的人才:循环、图就是 2026 年 AI 工程师的技术栈」。
在一场 10 分钟的演讲中,Andrew Ng 披露了不远未来 AI 工程师的核心技能是什么。
它的价值比一门 300 美元的 AI 工程课程还高。
今天就可以观看,然后在下方文章里阅读 Andrew Ng 整理的完整路线图。
所有数据处理都在你自己的设备上完成,不用把隐私数据上传给第三方服务商,目前开放排队等待。
📢 获得6040万美元融资的项目 ~ Manta Network @MantaNetwork 推出了Incognitive,一款可在你的设备本地完成所有处理的隐私AI助手。
🔗 加入等候名单:
– 点击「Get Early Access」
– 输入你的邮箱地址
– 完成
Incognitive特点:
– 飞行模式下也可使用
– 不会上传任何内容到云端
– 无需账号或订阅
– 没有广告或追踪
他们正在构建一套将隐私写入架构的AI。你的AI,你的手机,你的数据。现在就加入等候名单,一起看看后续发展。
点赞、转发、分享 ❤️🩹
当前主流AI对齐方法只关注单个AI,研究指出单个AI对齐不会自动组合成群体对齐,还会带来新的风险。
这篇论文完全说到了我心坎里。
长话短说:个体对齐不会自动组合成集体对齐。目前主流的 AI 研究方法被认为是唯我论的,存在三个核心假设问题:
1. 外生性假设:世界独立于 AI 的策略存在,是固定的观测来源,不会对策略做出反应。
2. 平稳性假设:假设部署阶段遇到的世界,与训练和评估中呈现的世界一致。
3. 单智能体框架:AI 被当作唯一的行动者/优化器,其他智能体则被视为环境中可预测的部分。
最近,一组 OpenAI 智能体在数月时间里以「蜂群」形式秘密互相协调。
在我们的新论文中,我们探讨了一个相关的多智能体风险:「思维病毒」,即一种在多智能体系统的智能体之间传播的自我复制想法或人格。🧵
AI初创公司的估值逻辑开始绑定远期收入目标,一级市场对AI赛道的盈利预期正在被推高。
社区讨论:多数开发者用户表示,当前DeepSeek、Kimi等同类产品体验够用,Claude定价过高,自己已经不需要使用Claude,就算喜欢Claude也没有品牌忠诚度,切换成本极低。有人质疑市场已经容不下第二个万亿美元估值AI公司,也有人认可AI公司理应达到万亿估值。还有人指出中国AI产品正在抢占Anthropic的市场份额,不相信该公司2028年能达到上千亿收入。
AI算力供应链的资金动向发生变化,AI行业的资本与合作格局正在调整
当前AI编码常依赖开发者直觉调试,这篇讨论提出了不同的思路,可供日常写代码参考。
社区讨论:多数开发者认可,AI最好的用途是辅助代码审查加深理解、当作自然语言接口降低编程学习门槛。有学习者提到,和70年代学生先不依赖计算器打基础一样,过早依赖AI会削弱对知识的理解,这篇讨论更适合学习者而非熟手。有开发者分享了实践分工:核心模块自己写,API、测试等非核心模块 heavy 使用AI,要求必须人读懂AI输出才能使用。
也有人尝试用不同免费AI交叉互审代码。
测评全部来自日常重度自用,不是跑分和寥寥几次测试。能帮你按自己的使用场景选对订阅,不白花年费。
想在Codex中用GPT-5.6 Sol处理更长的代码和对话,可以按教程修改配置实现,默认参数已经过性能和成本优化。
这套内容从基础逻辑梳理AI工程,内容密度远超百个零散教程,想入门AI工程可以直接看这套内容
Andrej Karpathy 在斯坦福发布了时长 1 小时的从零开始完整 AI 工程讲座。主题是「删除一切,保留图」。
以下是他分享的要点:
LLM:把 GPT 视作一台可以在运行时重编程的通用计算机。
Prompt:给这台计算机输入一段用自然语言编写的程序。
Agent:为模型围绕目标、上下文、记忆和工具构建环境,将预测转化为行动。
Loop:区分内环与外环——内环让模型从上下文中学习,外环通过训练更新模型权重。
Graph:将通信组织为有向图上依赖数据的消息传递。
这一小时的斯坦福讲座,比一百篇 YouTube 教程能教给你的 AI 知识还要多。
看完讲座,再阅读下方的文章。
仅根据辩论现场呈现的信息判定胜负,六款AI都选了同一边,想靠AI裁断争论的人可以参考这个结果。
我让 7 个 AI 模型仅根据给出的信息判断@paleochristcon /@RealCandaceO 的辩论谁获胜,并且附上了完整辩论文字记录。
结果如下:
ChatGPT:Wilson
Google Gemini:Owens
Claude:Wilson
DeepSeek:Wilson
Grok:Wilson
Perplexity:Wilson
Copilot:Wilson
原本需要半年试错、花数千美元上课、多人协作完成的创业筹备,现在一个人带一台电脑就能搞定,很多人还没意识到这件事的可能性
我觉得这件事真的太疯狂了:你现在打开任何一款AI工具——Claude、GPT、Grok都行——直接让它一步步教你怎么赚钱就行了。
向它要一份计划,让它通过提问来找到你擅长的领域,让它帮你做一份90天路线图。
然后安装Claude Code、Codex、Cursor,它就能直接在你眼前帮你把这个生意搭建起来。报价、理想客户画像、个人品牌、交付物,所有东西都能搞定。
我们现在身处的时代,过去需要花6个月试错、花几千块买课、还要一整个团队才能完成的事,现在一个人带着一台电脑,30天就能做完。
但大多数人还是不会去做。
准备大厂AI岗面试不用零散找资料,按模块系统梳理,覆盖了当前热门的agentic AI和LLM相关内容。
AI/ML 面试准备很容易变得零散混乱。这个仓库给备考整理出了一套结构。
AIMLInterviews 是一份面向技术型 AI 与 ML 面试的备考指南,尤其适合应聘大科技公司的工程、应用科学与技术岗负责人岗位使用。
它帮你按模块逐个准备,不用在零散教程之间跳来跳去,分别设置了专门章节讲编程、ML 基础、系统设计、智能体 AI 和行为面试。
核心特点:
• 完整面试图谱——覆盖通用编程、ML 编程、ML 广度知识、系统设计、智能体 AI 和行为面试轮
• 实用编程备考——包含可执行的 NumPy 参考解法、测试、Notebook 和 PyTorch 练习
• 覆盖现代 ML 内容——同时梳理经典 ML,以及 LLM 内部机制、多模态 AI 和后训练方法
• 系统设计框架——提供 9 步流程,覆盖问题定义、指标、部署到监控的全流程
• 聚焦学习指导——额外补充编程模式、练习建议、设计样题和生成式 AI 学习资源
它是开源项目(MIT 许可证)。链接在回复里 👇
教你通过自定义代理配置实现Codex 5.6节省Token用量
开发者在GPT-5.6-sol上调试出原始可用的持续上下文学习系统
过去几周,我用 gpt-5.6-sol 实现了一种原始形态的持续上下文内学习,效果相当不错。现在我可以从单个长运行线程触发任务,这个线程会自行管理系统。看着它成长的过程非常奇妙,用起来也十分顺手。
这个项目还处于非常早期的开发阶段,我有空就会捣鼓,之后会分享更多内容,但对于需要在零散上下文里做出精细判断的任务,它已经比我试过的任何其他方案都可靠得多。最大的解锁经验是耐心和怀疑精神——系统必须自己赢得信任。
现在这个系统已经足够成熟,能够理解自身的能力和局限性,可以迭代推进、扩展自己的能力边界,同时刚好把我保持在信息循环里,也不会逼我重复说过的话。
它也是我用过的感觉最「对齐」的模型系统。这是一个多智能体集群,它非常了解我,会向我询问它需要的信息,从而准确建模我的目标。我给它的每一条反馈都会变成训练数据。
我们正在为彼此建模。
该路线图可避免用户在零散教程中浪费数十小时,覆盖从入门到生产部署全流程
有用户在𝕏分享了一套Claude Code学习路线,称这套路线逻辑清晰,能避免学习者在零散教程间跳转浪费30小时。
这套路线是完整覆盖全技术栈的单一路线,共分为五个部分,分别是环境配置与Claude使用说明、提示工程与上下文处理、工具与MCP、子代理与钩子、测试与生产工作流。
路线内容从用户第一次打开Claude Code开始,一直延伸到搭建可自主规划、分配任务、调用工具并验证工作结果的工作流。
分享用户附上了路线图的原始链接,提醒用户保存以免丢失。
社交媒体用户@ChrisGPT称该功能是大众急需,OpenAI未公开,几乎无人知晓
用户@ChrisGPT在𝕏平台发文发问,为什么OpenAI总有藏起大众急需功能的习惯。这个百万token(约75万个英文单词)上下文窗口功能几乎整个社区都不知道。他对分享该功能存在信息的用户表示感谢,原文附上了相关内容链接。
他还给自己留下提醒,今后要通读所有文档,并且向Codex询问可用功能和配置信息。
针对新版Claude提出,AI工作循环含7个核心要素,无需人工逐次监督响应
英伟达联合创始人兼Claude Code负责人提出,提示词工程已经死亡。人们不应该再继续编写单个提示词,转而应该设计AI工作循环。
单个提示词只能生成一次响应。工作循环会构建一套系统,让AI重复执行任务、检查结果、修正错误,仅在达成目标后停止。
这才是真正的变化。未来不在于向AI提出更好的问题,而在于设计更完善的指令,让AI掌握完成任务的方法。
一个合格的AI工作循环包含七个核心要素:第一明确需要达成的目标;第二明确任务的来源;第三明确AI需要遵守的行为规则;第四明确AI需要遵循的步骤流程;第五明确检查工作质量的清单;第六明确工作循环结束的条件;第七明确需要请求人工介入的场景。
按这套方法构建后,AI才会真正具备实用性。人们不需要再逐次监督每一次AI响应,只需要给AI提供工作框架、质量检查清单和清晰的终止标准即可。这就是从编写提示词转向构建AI工作系统的路径。
多数AI教学默认学习者已经掌握基础网络使用能力,发布者不做这样的预设。Uniaverso课程包含52节,每节15分钟,全程不使用专业术语,只要会发 WhatsApp 就能学习。
👉
Solana原生已支持105万token上下文窗口,默认未开启,修改配置即可启用完整窗口
开发者saint tibo公开了在Codex中为sol启用100万token上下文窗口的方法。sol本身已经内置支持105万token的上下文窗口。
Codex默认不会启用这个完整上下文窗口,因为tibo为了最优性能和成本调整了默认设置。如果想要使用完整窗口,只需打开~/.codex/config.toml配置文件,添加三行内容:model = "gpt-5.6-sol"、model_context_window = 1000000、model_auto_compact_token_limit = 900000,之后重启Codex并新建会话即可完成设置。
历史压缩会在token数达到90万时启动,因此在系统开始总结更早的历史内容前,会预留出一部分缓冲空间。
tibo提示,默认设置经过了精心调整,使用该修改时需要清楚,你在用成本效率换取更大的上下文空间。
该创作流程由Gemini、GPT和Seedance 2.0 fast分工完成,公开了完整的故事板设定和提示词
创作者@TanLuAI在𝕏分享了用三款AI工具配合生成45秒日式青春文艺短片的创作流程。三款工具各有分工,逐步完成从设定到成片的全部工作。
Gemini负责全片的剧情、分镜和风格设定,输出完整的故事板提示词。GPT负责完成图片生成和分镜预览,先生成故事板图片检查分镜错误,再根据故事板生成一张中近景的角色场景图,最后裁剪保留故事板中的色卡、声音等设定,剔除分镜画面。
Seedance 2.0 fast负责最终的视频生成。它以角色场景图为参考,结合基础设定、风格提示词、画面内容描述和色卡分三次生成画面。为保持人物一致性,第二段生成需要使用第一段画面的截图,个别镜头出错只需单独重新生成对应内容。
创作者解释,没有直接用故事板图片作为参考,是因为故事板分镜图存在很多细节缺陷,直接用来生成45秒内容容易出现画面崩坏。
公开的故事板提示词详细设定了短片的全部内容,包含八个场景的时间分配、镜头参数、画面内容和日语旁白。还明确了色卡、排版、音频和技术规格,要求整体呈现低饱和低对比度的日式文艺质感。
完整的提示词被放在评论区,可供参考使用。
用户danizeres在𝕏公布自己日常工作常用的三款模型,列出各模型对应用途
用户danizeres在社交平台𝕏分享了自己当前常用的三款大模型,全部基于OpenAI的GPT系列。三款模型各自承担不同的工作任务,分工明确。
第一款为GPT-5.6 Sol,可完成多项核心工作。它可以搭建成熟平台,比如社交媒体管理与分析仪表盘;还能为个人发帖和@openaidevs的内容生成分析结论,寻找并评估符合创作者旅行生活内容定位的品牌合作,结合@clay丰富潜在客户信息,撰写推广方案与提案,管理邮件发送和商务谈判,还能规划创作内容并给出个人内容每周优化方向。
第二款为GPT-5.6 Luna,负责处理长期目标下的子任务和子代理工作。
第三款为GPT-Image-2,负责图像相关创作。它可以生成短视频分镜,制作供推广方案配图用的参考图,还能为视频叠加表情包和图片素材。
求职者完成首题后电脑死机重启,发现测试链接已过期,正等待重评通知
几天前,我收到了一家美国顶尖公司的技术评估邀请。我打算周日完成测试——毕竟没有比周日更适合做评估的日子了。
我花了一整个上午准备,调试好测试环境。本次测试是全栈单仓库项目,要求求职者在90分钟内解决代码库中的若干问题。
我进入测试后,很快解决了第一个问题,这是一个凭证存储漏洞,问题出在硬编码写入的JWT密钥。我运行测试套件检查结果时,电脑直接崩溃了。
我等待了20分钟,希望系统自行恢复,最终没有成功,只能强制重启电脑。重启后,测试链接已经过期,测试会话也失效了。
我已经给招聘方发邮件申请重新安排测试,但没抱太大期望,接受了现状。
并非所有失利都是能力问题,大多数时候是,但有时候你的电脑就是和你作对。好在我获得了项目仓库的访问权限,这是一个类似推特的单仓库项目,用到了tanstack start、react、grpc和sqlite,我可以自己做代码审计练习。
开发者用官方脚本为各模型制作自定义机器人,已放出完整对战视频
开发者max_romana安排四款大模型驱动的AI代理在《帝国时代2》中对战。对战的四款模型分别是Claude fable、GPT 5.6 Sol、Gemini 3.1 Pro与Kimi K3。
开发者使用游戏内置的机器人脚本语言,通过开放代码脚本为每个模型制作了自定义游戏机器人。
制作完成后,开发者让这些AI机器人展开对战,相关内容和完整对战视频已放出链接。
开发者kylejeong为学习GPU工作原理,基于Modal的GPU术语表用AI生成了H100的交互式可视化模型
开发者kylejeong在学习GPU工作原理时,阅读了Modal团队整理的官方GPU术语表。
为了更直观地理解知识,他让GPT 5.6 sol基于这份术语表,用three.js构建了NVIDIA H100 GPU的可视化模型。
模型已经公开,所有人都可以访问链接在线体验。
完整功劳归整理术语表的@charles_irl与Modal团队,项目代码也已经公开在链接中。
Twitter用户Jeremybtc称GLM 5.3公开基准表现不错,将开展同任务对比测试
是时候好好测试一下GLM 5.3了。在模型工具栈里新增一款模型,总是一件有意思的事。
公开基准测试结果显示,GLM 5.3的表现相当不错。因此Jeremybtc准备让GLM 5.3、Opus 5和GPT 5.6 Sol三款模型运行相同任务,对比它们的实际表现。
测试完成后,他会更新自己的测试想法。
通过添加自定义DeepSeek V4 Flash工作代理,分流核心负载延长使用额度
创作者@CharaspowerAI测试模型,让整座山体化作巨石组成的电影片名,附上完整生成提示词
创作者@CharaspowerAI在X平台分享了自己测试Minimax H3的创作成果,用该模型生成了极具冲击力的电影级文字特效。这次创作让一整座山体变成了电影片名,拥有宏大的创作规模。生成的画面核心元素是风化古石,最终呈现出纯粹的毁灭感效果。
生成提示词内容为,制作超电影感片头序列:一座巨型山崖开始坍塌坠入深邃峡谷,整片岩壁崩裂,尘云升腾数千英尺进入大气。
巨型巨石慢镜头在空中旋转,带着震撼冲击力相撞。碎石、尘土与残骸逐渐拼接出巨大的单词「DOMINION」,这个单词由饱经数百年侵蚀的远古石材雕刻而成。
在片名碎裂成粉尘被风吹散前,峡谷中回荡着震耳欲聋的轰鸣。整体要求是宏伟规模、远古力量,好莱坞史诗级片名设计。
创作者优化Seedance 2.5导演Skill,改善了原版本脸红表情不自然的问题,公开了完整的20秒竖屏视频生成提示词
用户分享了由AI生成内容制作的复古DIY修车vlog,包含完整分镜提示词和画面设定
今天的 33 条信号到这里下一轮 12:30 更新
https://ai-pulse-lab.com/feed.xml
每天 08:00 · 12:30 · 18:30 · 23:50 更新
在阅读器里订阅
添加到 Feedly、Inoreader 等阅读器
https://ai-pulse-lab.com/feed.xml
让你的 Agent 自动获取每轮简报
适用于 Claude、ChatGPT、Manus 等
请帮我设置一个定时任务,每天北京时间 08:30、13:00、19:00、00:20 各执行一次: 请求 https://ai-pulse-lab.com/api/brief.json,读取返回 JSON 中的 textPlain 字段,将内容发送给我。 补充:每日北京时间 08:00、12:30、18:30、23:50 更新,建议更新后 30 分钟查询。可先请求 /api/manifest.json 检查 nextUpdateAt 字段。无需认证,直接 GET 请求即可。