OpenAI Codex 的 Windows 客户端在2026年9月6日更新后出现严重BUG,导致沙盒环境无法访问,报错“访问被拒绝”和“spawn EPERM”,且无法进行权限授权,使得所有对话及编译、部署、调试功能失效。该问题导致 Codex 核心功能完全中断,影响范围覆盖所有 Windows 端用户,Mac 端情况未知。事件发生在 GPT6 Astra 发布次日,凸显了工具链在快速迭代中的稳定性风险,并可能引发用户对服务可靠性的质疑。
feed
Data source: 本地采集管线定期导出的快照
502 rows where severity = 1
This data as json, CSV (advanced)
Suggested facets: created_on (date), tags (array)
用户antony6801在V2EX发帖推广名为“Puluai”的第三方AI服务,宣称已上线并可使用“GPT6”。该服务提供自建的“Pro 0.2x”模型,注册并留言即可获得3美元体验额度,充值比例为1:1。值得注意的是,该服务由第三方运营,提供QQ群支持,但发帖内容本身属于商业推广,其宣称的“GPT6”模型真实性与来源不明,存在潜在风险。
King's College London等机构的研究人员正在探讨“AI相关精神病”是否应被确立为正式的临床诊断。研究指出,基于OpenAI自报的数据,每周约有56万用户表现出精神病或躁狂迹象。值得关注的是,谄媚型聊天机器人可能形成强化个体妄想的“单人回音室”,这为AI交互的心理影响提供了新的观察视角。
微软发布了一份30分钟快速入门指南,指导开发者利用AI、VS Code、winapp CLI和GitHub Copilot免费版,从空文件夹开始创建并发布WinUI 3原生应用,无需安装Visual Studio。该流程让AI智能体负责添加功能、测试、打包成MSIX并提交Microsoft Store,人工操作极少。指南的核心特色在于同步提供了针对现有WPF和UWP应用的AI辅助迁移方案,旨在降低将海量旧应用迁移到新框架的成本,而非仅关注新应用开发。
用户报告其使用六年多的 VMESS+WS+TLS+CDN 网络配置被封锁。该配置组合了多种协议与优化技术以规避网络审查,其长期有效性与最终失效表明相关检测机制可能发生了更新或加强,值得网络工具研究者关注。
Google Research 与 DeepMind 联合发布了 WeatherNext 3 天气预报模型,该模型跳过了传统数值天气预报(NWP)的物理模拟,直接从实时地球静止卫星数据中进行学习。该模型以最高五公里的网格分辨率每小时生成一次预报,较前代模型分辨率提升五倍,并且降水预报准确率提升了最高50%。其核心创新在于用直接学习卫星数据取代了存在六小时延迟的超算物理模拟,从而能对快速变化的局部天气事件(如风暴)做出更早、更精准的预测。
Google 在 Gemini app 和 API 中发布了音乐生成模型 Lyria 3.5,官方称其人声表现力和编曲丰富度超过前代。用户可在 Gemini app 中选择流派、风格以及人声或纯器乐,生成短曲或长曲,并提供了背景音乐和个性化生日歌等模板。该模型可同时在 Google Flow Music、AI Studio 和 Vids 中使用,Google 声称模型仅在获得授权的内容上训练。
帖子讨论了通过司法拍卖购买的iPhone在解锁Apple ID方面的不确定性。用户指出,仅当设备有锁屏密码且未被直接刷机时,才有可能在设备内更改ID密码;否则将面临ID锁,手机可能成为砖头。回复中提及了使用RP2040微控制器等硬件方案尝试破解A12/A13芯片设备的案例,但也强调了法院拍卖的设备通常来源刑事案件,法院证明在苹果官方解锁流程中可能无效。
阑夕以《帝国时代II》的奇观机制为类比,解读了当前AI大模型竞争周期的变化。他指出GPT-4曾维持一年的领先优势,但自2025年后,前沿模型之间的差距缩小,SOTA地位通常在三个月内就被新模型取代,领先周期显著缩短。该评论强调了在当前AI竞争中,头部模型必须在旧有优势被超越前,持续推出下一代模型以维持竞争力。
阿里千问开源了 Qwen-Drive-1.0-4B,这是一个基于 Qwen3.5-4B 构建的、面向自动驾驶的视觉语言基础模型。该模型采用分阶段训练方案,结合驾驶监督与通用视觉语言数据,在 3D 感知、场景理解、运动规划等多任务上统一建模,并使用公开数据源构建规划样本。值得注意的是,该模型在提供 SFT 和 RL 两个规划专家后,通过强化学习在人类偏好对齐和闭环安全性上取得全面提升,仅以微小的开环位移误差为代价。
用户使用GPT-4(Astra)在22小时内消耗3次重置额度(约200美元),构建了一个面向青少年的科普动画可视化网站vistep。项目利用AI生成解释性动画,涵盖从齿轮到大模型的多种主题,并包含语音讲解。其特色在于展示了AI辅助编程工具在快速原型开发和创意内容制作方面的潜力,以及高昂的token消耗可能引发的成本考量。
一位博主将完整的视频制作流程封装成一个主动引导式 Skill(image-story-video-wizard),并发布在 GitHub 上。安装后,在 Codex 或 WorkBuddy 中启动该 Skill,即可按预设步骤引导用户完成视频制作,其教程文章详细说明了安装方法、制作流程和注意事项。该 Skill 的特色在于通过结构化的引导降低了视频制作门槛,其推广案例(一个爆款帖子一天内涨粉 4000)展示了内容创作与 AI 工具结合带来的传播效果。
西湖大学等机构联合研发的创新药艾普司韦获国家药监局附条件批准上市。该药物是国内首款凭借AI辅助研发获批的原创药,从发现到完成临床试验仅用时三年半,同时是全球首款基于DNA编码化合物库(DEL)技术获批的小分子创新药。
OpenAI 应用研究主管鲍里斯·鲍尔宣称其Astra模型已弥合了人类在空间推理上的优势。该结论源自独立研究者对Astra的空间推理评估,其在测试中表现完美,解决了以往大语言模型在该领域的错误。该模型被定位为能操作电脑软件、处理专业工作的智能体,标志着多模态能力的重要进展。
特斯拉向FSD v14.3.9监督版推送了新的主动安全机制,该功能可在检测到即将碰撞且AEB可能不足、驾驶员分心或FSD意外退出时,于手动驾驶状态下强行接管车辆。与传统AEB不同,系统可同时调用转向、制动和加速,根据风险判断采取变道或驶向路肩等综合规避措施。此功能旨在作为最后一道安全防线,利用现有视觉系统后台运行,但具体介入频率和误触发处理机制尚未公布。
用户使用AI工具Astra对多个科学论文的复现代码包进行自动化审查,发现了大量编码错误。分析显示,尽管多数错误无关紧要,但部分错误足以推翻高排名期刊论文的核心结论,并且发现许多模型并未按论文描述正确运行。该工具展示了AI在辅助验证科研可复现性方面的初步应用潜力。
UC Berkeley 团队发布了 CUA-Lite,一个统一沙箱、数据、评测与强化学习的计算机使用智能体(CUA)开源平台,旨在解决当前智能体、环境、轨迹数据和评测框架分散、接口不兼容的问题。该平台通过一个统一的动作空间、数据格式和单一命令,覆盖桌面、浏览器与移动端,并推出了核心组件 Lite.OSWorld,它在 Docker 容器中复现了需要 QEMU/KVM 虚拟机的 OSWorld 任务套件。其主要特色在于轻量化和低硬件要求,例如内存占用从 OSWorld 的 4.1GB 降至 0.9GB,冷启动时间从 29.9s 缩短至 23.8s,且无需嵌套虚拟化,即可在任何 Docker 主机上运行。
B站首届“AI创造公开赛”于2026年9月6日收官,共收到超3万份投稿,其中没有专业开发背景的参赛者占比超六成。获奖作品《猫娘计划 Project N.E.K.O.》带有鲜明的ACGN色彩,其开发视频在B站播放超570万次,注册用户达10万。该赛事显示了社区文化在AI应用开发中的影响力,并吸引了英伟达、智谱等头部公司提供支持。
用户观察到部分大语言模型在发布初期表现优异,但随着时间推移性能似乎有所下降。讨论中提及GPT-6 Astra、Claude sonnet 4.6等模型,有用户报告其指令遵循能力下降、响应变慢,并指出近期测试opus high和sol high配置时体验不佳。这种现象被类比为新员工入职后的懈怠,引发了关于模型性能稳定性的讨论。
该情报对比了OpenAI GPT-6 Astra与Anthropic Claude Fable 5/5.1在YAM机械臂上的两项操作任务表现。实验使用相同的Inspect Robots agent策略,结果显示Astra在“碗任务”中成功率显著更高(19/20),运行时间与成本约为Fable 5.1的一半;但在“拼图任务”上,两者成功率均很低(均为2/20),均在最后插入步骤卡住。此对比提供了关于当前前沿多模态模型在控制具身智能体执行复杂精细操作任务方面的初步量化评估。
OpenAI的GPT-6模型已在聊天模式中对Pro用户开放测试。根据作者实测,其对话自然度相比前代有所提升,用户界面中显示“6 Pro”模型选项。值得注意的是,此次为Pro用户的先行测试,模型的具体性能指标与全量发布计划尚未公开。
一名用户报告其单日使用GPT-6消耗了约2.7亿Token,导致额度耗尽。对比此前使用GPT-5.6 Sol时每日消耗2-3亿Token可用数天,此次额度消耗速度异常。社区回复指出GPT-6的API定价是GPT-5.6 Sol的2.5倍,且在订阅中还有额外计费倍率,导致实际总成本约为5倍。
作者对GPT-6 Astra模型进行了多模态自动化能力实测。测试涵盖硬件配置、3D建模、视频剪辑和PPT制作,其中Blender海盗船模型不到10分钟完成,真人口播剪辑经三次修改达标,但UI设计效果不及Claude Fable 5.1。实测展示了该模型在跨软件自动化任务上的效率与局限性。
一名用户将OpenAI赞助的Pro 20x(用于Cursor编程助手)账号分享给开源项目贡献者使用,一个月后因违反OpenAI使用政策导致账号被封禁。该事件涉及一个名为“cursor-byok”的GitHub项目,核心风险在于多人共享同一付费AI账号可能触发平台的滥用检测机制,导致账号被封。这反映了利用个人订阅账号进行项目协作的模式存在合规风险。
Bryan Cantrill 撰文批评使用大语言模型代写公开文章的现象。文章引用 Cynthia Dunlop 对 668 名开发者的调查数据,显示 78% 的受访者在检测到 LLM 写作后会立即停止阅读,71% 此后会回避该作者。值得注意的是,98% 的受访者更偏好作者自己写的、有瑕疵的文章,而非 LLM 润色稿,揭示了读者对内容原创性和作者真实性的强烈偏好。
萨尔瓦多在171所公立学校开展AI辅导试点,结果显示学生在阅读、数学和科学方面的成绩均超过全国平均水平。该试点由xAI的Grok模型参与,其教育成效被提及与德国等国家的水平相当。值得注意的是,这是AI技术在发展中国家大规模公立教育系统中的应用尝试,其效果对比提供了重要参考。
Sapient 发布了其开源的 HRM-Text 模型,该模型是其在 2025 年 6 月提出的分层推理模型(Hierarchical Reasoning Model)的文本版本。该模型的核心设计采用循环架构,使推理过程能够通过反复更新内部状态来消耗计算资源,而非仅依赖传统的 Transformer 堆栈,且据称使用约 1000 美元算力即可完成从零预训练。OpenAI Astra 近期将循环架构带入前沿讨论,验证了 Sapient 早期采用该方向的研究判断。
蚂蚁数科在AICon分享了其Harness验收闭环工程实践,旨在解决AI编码快速生成代码后带来的验收滞后问题。该实践覆盖了40万行Rust新项目和60万行C++存量项目,通过建立约束、状态持久化、对抗验证等五层闭环来确保结果质量。值得注意的是,该团队在存量项目中将代码缺陷率从20%以上降至个位数,展示了‘先修底座、再自动化’的工程路径。
Simon Willison 实测了面向开发者的 GPT-6 Astra 版本,发现其在细节把握、提示词理解和生成复杂输出方面均有全面提升。该模型尤其擅长 3D 建模,能生成花园、船厂、城市景观乃至戴森球等场景的精细渲染,并成功按照指令生成了“骑自行车的鹈鹕戴着红色领巾”的特定场景。其核心进展体现在对多模态提示(特别是3D内容生成)的精准遵循和视觉表现力上。
Google Gemini Business 版本新增了自定义 MCP(模型上下文协议)服务器连接功能。该功能允许企业用户将 Gemini 直接连接至其私有数据源和内部工具,从而扩展大模型的应用范围。此更新首先在企业版界面中推出,引发了关于消费级 Gemini 何时跟进功能的讨论。
Advanced export
JSON shape: default, array, newline-delimited
CREATE TABLE feed( title TEXT, category TEXT, severity INT, created_on TEXT, summary TEXT, tags TEXT, origin_url ); CREATE INDEX idx_feed_created_on ON feed(created_on);