OpenAI Codex 的 Windows 客户端在2026年9月6日更新后出现严重BUG,导致沙盒环境无法访问,报错“访问被拒绝”和“spawn EPERM”,且无法进行权限授权,使得所有对话及编译、部署、调试功能失效。该问题导致 Codex 核心功能完全中断,影响范围覆盖所有 Windows 端用户,Mac 端情况未知。事件发生在 GPT6 Astra 发布次日,凸显了工具链在快速迭代中的稳定性风险,并可能引发用户对服务可靠性的质疑。
feed
Data source: 本地采集管线定期导出的快照
423 rows where category = "ai" and severity = 1
This data as json, CSV (advanced)
Suggested facets: created_on (date), tags (array)
用户antony6801在V2EX发帖推广名为“Puluai”的第三方AI服务,宣称已上线并可使用“GPT6”。该服务提供自建的“Pro 0.2x”模型,注册并留言即可获得3美元体验额度,充值比例为1:1。值得注意的是,该服务由第三方运营,提供QQ群支持,但发帖内容本身属于商业推广,其宣称的“GPT6”模型真实性与来源不明,存在潜在风险。
King's College London等机构的研究人员正在探讨“AI相关精神病”是否应被确立为正式的临床诊断。研究指出,基于OpenAI自报的数据,每周约有56万用户表现出精神病或躁狂迹象。值得关注的是,谄媚型聊天机器人可能形成强化个体妄想的“单人回音室”,这为AI交互的心理影响提供了新的观察视角。
Google Research 与 DeepMind 联合发布了 WeatherNext 3 天气预报模型,该模型跳过了传统数值天气预报(NWP)的物理模拟,直接从实时地球静止卫星数据中进行学习。该模型以最高五公里的网格分辨率每小时生成一次预报,较前代模型分辨率提升五倍,并且降水预报准确率提升了最高50%。其核心创新在于用直接学习卫星数据取代了存在六小时延迟的超算物理模拟,从而能对快速变化的局部天气事件(如风暴)做出更早、更精准的预测。
Google 在 Gemini app 和 API 中发布了音乐生成模型 Lyria 3.5,官方称其人声表现力和编曲丰富度超过前代。用户可在 Gemini app 中选择流派、风格以及人声或纯器乐,生成短曲或长曲,并提供了背景音乐和个性化生日歌等模板。该模型可同时在 Google Flow Music、AI Studio 和 Vids 中使用,Google 声称模型仅在获得授权的内容上训练。
阑夕以《帝国时代II》的奇观机制为类比,解读了当前AI大模型竞争周期的变化。他指出GPT-4曾维持一年的领先优势,但自2025年后,前沿模型之间的差距缩小,SOTA地位通常在三个月内就被新模型取代,领先周期显著缩短。该评论强调了在当前AI竞争中,头部模型必须在旧有优势被超越前,持续推出下一代模型以维持竞争力。
阿里千问开源了 Qwen-Drive-1.0-4B,这是一个基于 Qwen3.5-4B 构建的、面向自动驾驶的视觉语言基础模型。该模型采用分阶段训练方案,结合驾驶监督与通用视觉语言数据,在 3D 感知、场景理解、运动规划等多任务上统一建模,并使用公开数据源构建规划样本。值得注意的是,该模型在提供 SFT 和 RL 两个规划专家后,通过强化学习在人类偏好对齐和闭环安全性上取得全面提升,仅以微小的开环位移误差为代价。
用户使用GPT-4(Astra)在22小时内消耗3次重置额度(约200美元),构建了一个面向青少年的科普动画可视化网站vistep。项目利用AI生成解释性动画,涵盖从齿轮到大模型的多种主题,并包含语音讲解。其特色在于展示了AI辅助编程工具在快速原型开发和创意内容制作方面的潜力,以及高昂的token消耗可能引发的成本考量。
西湖大学等机构联合研发的创新药艾普司韦获国家药监局附条件批准上市。该药物是国内首款凭借AI辅助研发获批的原创药,从发现到完成临床试验仅用时三年半,同时是全球首款基于DNA编码化合物库(DEL)技术获批的小分子创新药。
OpenAI 应用研究主管鲍里斯·鲍尔宣称其Astra模型已弥合了人类在空间推理上的优势。该结论源自独立研究者对Astra的空间推理评估,其在测试中表现完美,解决了以往大语言模型在该领域的错误。该模型被定位为能操作电脑软件、处理专业工作的智能体,标志着多模态能力的重要进展。
用户使用AI工具Astra对多个科学论文的复现代码包进行自动化审查,发现了大量编码错误。分析显示,尽管多数错误无关紧要,但部分错误足以推翻高排名期刊论文的核心结论,并且发现许多模型并未按论文描述正确运行。该工具展示了AI在辅助验证科研可复现性方面的初步应用潜力。
UC Berkeley 团队发布了 CUA-Lite,一个统一沙箱、数据、评测与强化学习的计算机使用智能体(CUA)开源平台,旨在解决当前智能体、环境、轨迹数据和评测框架分散、接口不兼容的问题。该平台通过一个统一的动作空间、数据格式和单一命令,覆盖桌面、浏览器与移动端,并推出了核心组件 Lite.OSWorld,它在 Docker 容器中复现了需要 QEMU/KVM 虚拟机的 OSWorld 任务套件。其主要特色在于轻量化和低硬件要求,例如内存占用从 OSWorld 的 4.1GB 降至 0.9GB,冷启动时间从 29.9s 缩短至 23.8s,且无需嵌套虚拟化,即可在任何 Docker 主机上运行。
用户观察到部分大语言模型在发布初期表现优异,但随着时间推移性能似乎有所下降。讨论中提及GPT-6 Astra、Claude sonnet 4.6等模型,有用户报告其指令遵循能力下降、响应变慢,并指出近期测试opus high和sol high配置时体验不佳。这种现象被类比为新员工入职后的懈怠,引发了关于模型性能稳定性的讨论。
该情报对比了OpenAI GPT-6 Astra与Anthropic Claude Fable 5/5.1在YAM机械臂上的两项操作任务表现。实验使用相同的Inspect Robots agent策略,结果显示Astra在“碗任务”中成功率显著更高(19/20),运行时间与成本约为Fable 5.1的一半;但在“拼图任务”上,两者成功率均很低(均为2/20),均在最后插入步骤卡住。此对比提供了关于当前前沿多模态模型在控制具身智能体执行复杂精细操作任务方面的初步量化评估。
OpenAI的GPT-6模型已在聊天模式中对Pro用户开放测试。根据作者实测,其对话自然度相比前代有所提升,用户界面中显示“6 Pro”模型选项。值得注意的是,此次为Pro用户的先行测试,模型的具体性能指标与全量发布计划尚未公开。
一名用户报告其单日使用GPT-6消耗了约2.7亿Token,导致额度耗尽。对比此前使用GPT-5.6 Sol时每日消耗2-3亿Token可用数天,此次额度消耗速度异常。社区回复指出GPT-6的API定价是GPT-5.6 Sol的2.5倍,且在订阅中还有额外计费倍率,导致实际总成本约为5倍。
作者对GPT-6 Astra模型进行了多模态自动化能力实测。测试涵盖硬件配置、3D建模、视频剪辑和PPT制作,其中Blender海盗船模型不到10分钟完成,真人口播剪辑经三次修改达标,但UI设计效果不及Claude Fable 5.1。实测展示了该模型在跨软件自动化任务上的效率与局限性。
萨尔瓦多在171所公立学校开展AI辅导试点,结果显示学生在阅读、数学和科学方面的成绩均超过全国平均水平。该试点由xAI的Grok模型参与,其教育成效被提及与德国等国家的水平相当。值得注意的是,这是AI技术在发展中国家大规模公立教育系统中的应用尝试,其效果对比提供了重要参考。
Sapient 发布了其开源的 HRM-Text 模型,该模型是其在 2025 年 6 月提出的分层推理模型(Hierarchical Reasoning Model)的文本版本。该模型的核心设计采用循环架构,使推理过程能够通过反复更新内部状态来消耗计算资源,而非仅依赖传统的 Transformer 堆栈,且据称使用约 1000 美元算力即可完成从零预训练。OpenAI Astra 近期将循环架构带入前沿讨论,验证了 Sapient 早期采用该方向的研究判断。
蚂蚁数科在AICon分享了其Harness验收闭环工程实践,旨在解决AI编码快速生成代码后带来的验收滞后问题。该实践覆盖了40万行Rust新项目和60万行C++存量项目,通过建立约束、状态持久化、对抗验证等五层闭环来确保结果质量。值得注意的是,该团队在存量项目中将代码缺陷率从20%以上降至个位数,展示了‘先修底座、再自动化’的工程路径。
Simon Willison 实测了面向开发者的 GPT-6 Astra 版本,发现其在细节把握、提示词理解和生成复杂输出方面均有全面提升。该模型尤其擅长 3D 建模,能生成花园、船厂、城市景观乃至戴森球等场景的精细渲染,并成功按照指令生成了“骑自行车的鹈鹕戴着红色领巾”的特定场景。其核心进展体现在对多模态提示(特别是3D内容生成)的精准遵循和视觉表现力上。
Google Gemini Business 版本新增了自定义 MCP(模型上下文协议)服务器连接功能。该功能允许企业用户将 Gemini 直接连接至其私有数据源和内部工具,从而扩展大模型的应用范围。此更新首先在企业版界面中推出,引发了关于消费级 Gemini 何时跟进功能的讨论。
Grok Imagine Video 1.5 Agent 上线,其底层已换用最新的 Image 2.0 图像模型。官方表示该升级带来了更高的生成质量与更好的故事叙述能力,并且在多镜头衔接的连续性上有所改进。TestingCatalog 使用“为本站制作广告横幅”的指令进行了实测,认为其生成结果相当不错。
三名徒步者因依赖 Google Gemini 规划登山行程,在加州 Mount Shasta 受困后获救。Siskiyou 县警长办公室指出,Gemini 建议携带的食物和水量远低于实际需求,导致原计划 8 小时的登顶耗时 16 小时并演变为多日困境。该事件凸显了 AI 在户外行程规划中提供信息不充分的风险,警方呼吁不应完全依赖 AI 进行此类决策。
Claude Code 创造者 Boris Cherny 指出,许多公司未能从 AI 集成中获得预期生产力提升,核心原因在于采用了将 AI 置于流程边缘的部署方式。他引用 1996 年哈佛商业评论对计算机化早期的研究进行类比,指出将 AI 置于业务流程中心并逐个瓶颈进行数字化改造的企业,才能实现真正的提效。该观点强调,生产力的提升依赖于对现有工作流的彻底再设计,而非仅仅引入新工具。
GPT-6 Astra (Max) 在 Code Arena: WebDev 基准测试中以 1797 分登顶,领先第二名 Claude Fable 5.1 (Max) 35 分、第三名 Claude Opus 5 (Max) 109 分。该基准测试要求模型使用工具规划并构建可运行的 Web 应用,由用户对成对输出进行比较评分。值得注意的是,GPT-6 Astra (Max) 与其前代 GPT-5.6 Sol (xHigh) 拉开了 180 分的巨大差距,同时它也重塑了性能-成本的帕累托前沿。
Artificial Analysis 发布了其 Intelligence Index v4.2,以回应此前对 GPT-6 Astra 评分偏低引发的争议。更新后的基准显示,GPT-6 Astra 的分数比其前代模型提高了四分,并在每项任务的令牌消耗上低于所有其他前沿模型,但 Anthropic 的 Claude Fable 5.1 仍位居榜首。该版本新增了 AA-Briefcase 和 GDP.pdf 两项基准。
上海人工智能实验室提出 Harness-of-Harness(HoH)框架,通过在多次编码迭代间持久化项目状态(代码、测试证据、已知问题与计划),来提升长周期自主软件开发的表现。在 GameCraft-Bench 基准测试中,采用 HoH 的 Codex + GPT-5.5 组合在3次迭代后得分为71.52,而仅简单延续同一编码智能体得分为58.24。该框架的核心特色在于将长周期编码任务分解为依赖外部状态管理与独立质量保证的多个环节,而非单纯增加单次智能体的运行时间或资源。
xAI发布了Grok Imagine Video 1.5 agent,该工具由其最新的Image 2.0模型驱动。它结合了编码智能体与图像、视频生成模型的能力,旨在实现更智能的创意叙事,并强调更高的画面质量和更强的镜头连贯性。该工具已上线可用,其核心特色在于将智能体逻辑与生成模型结合以提升叙事质量。
PayPal AI 论文研究了持久记忆智能体在存储信息过期时的决策偏差。研究测试了 Qwen3 系列模型(0.6B 至 8B),发现当需要记忆时,智能体有 92%–100% 的概率会遵循过期的存储值而非新证据,并且让旧记录看起来更新会更大程度地欺骗大模型。研究的关键结论是,缓解措施严重依赖模型规模:4B 及以上模型可通过时间戳和来源元数据恢复大部分准确性,而 0.6B 和 1.7B 模型需要在模型看到冲突前就解决过期记忆问题,因此建议将智能体记忆视为不可信输入。
Advanced export
JSON shape: default, array, newline-delimited
CREATE TABLE feed( title TEXT, category TEXT, severity INT, created_on TEXT, summary TEXT, tags TEXT, origin_url ); CREATE INDEX idx_feed_created_on ON feed(created_on);