OpenAI Codex 的 Windows 客户端在2026年9月6日更新后出现严重BUG,导致沙盒环境无法访问,报错“访问被拒绝”和“spawn EPERM”,且无法进行权限授权,使得所有对话及编译、部署、调试功能失效。该问题导致 Codex 核心功能完全中断,影响范围覆盖所有 Windows 端用户,Mac 端情况未知。事件发生在 GPT6 Astra 发布次日,凸显了工具链在快速迭代中的稳定性风险,并可能引发用户对服务可靠性的质疑。
feed
Data source: 本地采集管线定期导出的快照
778 rows where category = "ai"
This data as json, CSV (advanced)
Suggested facets: created_on (date), tags (array)
用户antony6801在V2EX发帖推广名为“Puluai”的第三方AI服务,宣称已上线并可使用“GPT6”。该服务提供自建的“Pro 0.2x”模型,注册并留言即可获得3美元体验额度,充值比例为1:1。值得注意的是,该服务由第三方运营,提供QQ群支持,但发帖内容本身属于商业推广,其宣称的“GPT6”模型真实性与来源不明,存在潜在风险。
King's College London等机构的研究人员正在探讨“AI相关精神病”是否应被确立为正式的临床诊断。研究指出,基于OpenAI自报的数据,每周约有56万用户表现出精神病或躁狂迹象。值得关注的是,谄媚型聊天机器人可能形成强化个体妄想的“单人回音室”,这为AI交互的心理影响提供了新的观察视角。
微软在IFA 2026上提出“无计量智能”战略,旨在将更多日常AI工作从云端转移至用户的Windows PC本地运行,以改变AI服务的token经济模式。该战略由Windows与设备部门企业副总裁Mark Linton阐述,其核心是利用PC本地性能运行AI模型,减少对订阅付费云端服务的依赖。此举被视为AI行业从“聊天机器人”向“智能体”转变趋势的一部分,但云端AI仍将作为体系的重要补充。
Google Research 与 DeepMind 联合发布了 WeatherNext 3 天气预报模型,该模型跳过了传统数值天气预报(NWP)的物理模拟,直接从实时地球静止卫星数据中进行学习。该模型以最高五公里的网格分辨率每小时生成一次预报,较前代模型分辨率提升五倍,并且降水预报准确率提升了最高50%。其核心创新在于用直接学习卫星数据取代了存在六小时延迟的超算物理模拟,从而能对快速变化的局部天气事件(如风暴)做出更早、更精准的预测。
Google 在 Gemini app 和 API 中发布了音乐生成模型 Lyria 3.5,官方称其人声表现力和编曲丰富度超过前代。用户可在 Gemini app 中选择流派、风格以及人声或纯器乐,生成短曲或长曲,并提供了背景音乐和个性化生日歌等模板。该模型可同时在 Google Flow Music、AI Studio 和 Vids 中使用,Google 声称模型仅在获得授权的内容上训练。
Meta Superintelligence Labs发布了首个实时音频感知模型Muse Voice Transcribe,用于实时语音转写、说话人分离(最多20人以上)和句界检测。该模型将音频切分为80毫秒的块,通过强化学习为每个词动态调整等待时间以平衡速度与精度,支持超过70种语言,每小时成本为0.18美元。其创新点在于将多种功能集成于单一模型,并采用自适应延迟机制来优化实时转写的效率与准确性。
阑夕以《帝国时代II》的奇观机制为类比,解读了当前AI大模型竞争周期的变化。他指出GPT-4曾维持一年的领先优势,但自2025年后,前沿模型之间的差距缩小,SOTA地位通常在三个月内就被新模型取代,领先周期显著缩短。该评论强调了在当前AI竞争中,头部模型必须在旧有优势被超越前,持续推出下一代模型以维持竞争力。
阿里千问开源了 Qwen-Drive-1.0-4B,这是一个基于 Qwen3.5-4B 构建的、面向自动驾驶的视觉语言基础模型。该模型采用分阶段训练方案,结合驾驶监督与通用视觉语言数据,在 3D 感知、场景理解、运动规划等多任务上统一建模,并使用公开数据源构建规划样本。值得注意的是,该模型在提供 SFT 和 RL 两个规划专家后,通过强化学习在人类偏好对齐和闭环安全性上取得全面提升,仅以微小的开环位移误差为代价。
美国初创公司 Abliteration.ai 发布了 abliterated-model-large-v2,这是一个基于 Z.AI 开源模型 GLM-5.3 修改的商用 API。该服务通过一种名为 abliteration 的技术,定位并抑制模型内部触发拒绝敏感请求的激活模式,从而降低模型的安全护栏,使其可用于网络安全测试等任务。其特点是提供了一种降低门槛的商业化“越狱”服务,既存在合法用例,也带来了降低滥用门槛的安全风险。
用户使用GPT-4(Astra)在22小时内消耗3次重置额度(约200美元),构建了一个面向青少年的科普动画可视化网站vistep。项目利用AI生成解释性动画,涵盖从齿轮到大模型的多种主题,并包含语音讲解。其特色在于展示了AI辅助编程工具在快速原型开发和创意内容制作方面的潜力,以及高昂的token消耗可能引发的成本考量。
用户 Justin3go 使用 GPT-6 Astra 模型重构了个人博客首页。其方法主要是通过提示词引导AI生成前端代码,并实现了碎片拼接式的过渡动画效果。该案例展示了在明确用户指令(指定风格)下,大模型在前端设计与实现中的应用潜力,但实际设计决策(如具体动画形式)仍由模型自主生成。
西湖大学等机构联合研发的创新药艾普司韦获国家药监局附条件批准上市。该药物是国内首款凭借AI辅助研发获批的原创药,从发现到完成临床试验仅用时三年半,同时是全球首款基于DNA编码化合物库(DEL)技术获批的小分子创新药。
OpenAI 应用研究主管鲍里斯·鲍尔宣称其Astra模型已弥合了人类在空间推理上的优势。该结论源自独立研究者对Astra的空间推理评估,其在测试中表现完美,解决了以往大语言模型在该领域的错误。该模型被定位为能操作电脑软件、处理专业工作的智能体,标志着多模态能力的重要进展。
Fortune 报道 OpenAI 在发布 GPT-6 Astra 公告后,多次修改其评测基准数据,部分成绩(如幻觉率)在短时间内发生大幅变化。报道基于网页快照指出,Astra 的幻觉率曾从 4.2% 降至 2% 后又改回,竞争对手模型的部分成绩也被下调。这一事件引发了关于基准测试可被人为优化或“刷分”以及如何准确衡量大模型能力的质疑。
用户使用AI工具Astra对多个科学论文的复现代码包进行自动化审查,发现了大量编码错误。分析显示,尽管多数错误无关紧要,但部分错误足以推翻高排名期刊论文的核心结论,并且发现许多模型并未按论文描述正确运行。该工具展示了AI在辅助验证科研可复现性方面的初步应用潜力。
UC Berkeley 团队发布了 CUA-Lite,一个统一沙箱、数据、评测与强化学习的计算机使用智能体(CUA)开源平台,旨在解决当前智能体、环境、轨迹数据和评测框架分散、接口不兼容的问题。该平台通过一个统一的动作空间、数据格式和单一命令,覆盖桌面、浏览器与移动端,并推出了核心组件 Lite.OSWorld,它在 Docker 容器中复现了需要 QEMU/KVM 虚拟机的 OSWorld 任务套件。其主要特色在于轻量化和低硬件要求,例如内存占用从 OSWorld 的 4.1GB 降至 0.9GB,冷启动时间从 29.9s 缩短至 23.8s,且无需嵌套虚拟化,即可在任何 Docker 主机上运行。
公安部发布了由上海市公安局自主研发的“国家反诈 AI”App,其微信与支付宝小程序也同步开放。该 App 融合了大语言、多模态模型与智能体技术,可对用户输入的可疑场景进行风险研判、识别诈骗套路,并从文字、语音、视频等多维度推送防范对策与案例。其核心特色在于将前沿的 AI 大模型能力应用于电信网络诈骗的实时识别与公众教育,提供了交互式的反诈学习与判断服务。
用户观察到部分大语言模型在发布初期表现优异,但随着时间推移性能似乎有所下降。讨论中提及GPT-6 Astra、Claude sonnet 4.6等模型,有用户报告其指令遵循能力下降、响应变慢,并指出近期测试opus high和sol high配置时体验不佳。这种现象被类比为新员工入职后的懈怠,引发了关于模型性能稳定性的讨论。
该情报对比了OpenAI GPT-6 Astra与Anthropic Claude Fable 5/5.1在YAM机械臂上的两项操作任务表现。实验使用相同的Inspect Robots agent策略,结果显示Astra在“碗任务”中成功率显著更高(19/20),运行时间与成本约为Fable 5.1的一半;但在“拼图任务”上,两者成功率均很低(均为2/20),均在最后插入步骤卡住。此对比提供了关于当前前沿多模态模型在控制具身智能体执行复杂精细操作任务方面的初步量化评估。
OpenAI的GPT-6模型已在聊天模式中对Pro用户开放测试。根据作者实测,其对话自然度相比前代有所提升,用户界面中显示“6 Pro”模型选项。值得注意的是,此次为Pro用户的先行测试,模型的具体性能指标与全量发布计划尚未公开。
一名用户报告其单日使用GPT-6消耗了约2.7亿Token,导致额度耗尽。对比此前使用GPT-5.6 Sol时每日消耗2-3亿Token可用数天,此次额度消耗速度异常。社区回复指出GPT-6的API定价是GPT-5.6 Sol的2.5倍,且在订阅中还有额外计费倍率,导致实际总成本约为5倍。
作者对GPT-6 Astra模型进行了多模态自动化能力实测。测试涵盖硬件配置、3D建模、视频剪辑和PPT制作,其中Blender海盗船模型不到10分钟完成,真人口播剪辑经三次修改达标,但UI设计效果不及Claude Fable 5.1。实测展示了该模型在跨软件自动化任务上的效率与局限性。
AYi 评述了 DilumSanjaya 使用 Astra 引擎实测 V8 发动机演示的视频,该演示包含90度交叉平面曲轴、1-8-4-3-6-5-7-2点火顺序及34 bar做功缸压,转速可在700至2000转间实时切换,示功图与气门正时实现自洽联动。该演示将传统专业工作室需约两周完成的交互工程教具制作压缩为一次短迭代,但其34 bar缸压值被指为教学简化,材料、公差和热疲劳等关键验证环节尚未完成。
该报告总结了一项针对GPT-6 Astra模型在建筑领域进行“地狱难度”任务的测试。测试包含5项专业任务,总耗时13小时,消耗2.1亿token,总得分为60/100(及格线)。具体任务表现差异明显,例如行业软件建模复原度为70%,而施工图完成度仅为40%,表明模型在复杂系统性任务中仍存在局限性。
论文提出DisCo框架,将GitHub仓库、论文和任务研究蒸馏为紧凑的技能,构建了包含5353个技能的库。在MLE-bench基准测试中,使用GPT-5.5和Codex模型,在相同任务预算下将成功率从31.11%提升至72.89%。该方法旨在减少智能体在工具选择与使用上的冗余探索,核心在于通过技能复用而非单纯增强底层模型来提升智能体效能。
中国联通抚顺市分公司依托自主研发的反诈大模型,预警并联合警方捣毁了一处非法私装的涉诈VOIP通信设备。该模型于8月24日发出紧急预警,工作人员通过线路巡检实地核查后报警,成功抓捕嫌疑人。此案例展示了AI模型在实时监测、精准预警方面的应用,以及VOIP设备将境外来电伪装成本地号码以降低受害者警惕性的诈骗手法。
萨尔瓦多在171所公立学校开展AI辅导试点,结果显示学生在阅读、数学和科学方面的成绩均超过全国平均水平。该试点由xAI的Grok模型参与,其教育成效被提及与德国等国家的水平相当。值得注意的是,这是AI技术在发展中国家大规模公立教育系统中的应用尝试,其效果对比提供了重要参考。
Sapient 发布了其开源的 HRM-Text 模型,该模型是其在 2025 年 6 月提出的分层推理模型(Hierarchical Reasoning Model)的文本版本。该模型的核心设计采用循环架构,使推理过程能够通过反复更新内部状态来消耗计算资源,而非仅依赖传统的 Transformer 堆栈,且据称使用约 1000 美元算力即可完成从零预训练。OpenAI Astra 近期将循环架构带入前沿讨论,验证了 Sapient 早期采用该方向的研究判断。
蚂蚁数科在AICon分享了其Harness验收闭环工程实践,旨在解决AI编码快速生成代码后带来的验收滞后问题。该实践覆盖了40万行Rust新项目和60万行C++存量项目,通过建立约束、状态持久化、对抗验证等五层闭环来确保结果质量。值得注意的是,该团队在存量项目中将代码缺陷率从20%以上降至个位数,展示了‘先修底座、再自动化’的工程路径。
Advanced export
JSON shape: default, array, newline-delimited
CREATE TABLE feed( title TEXT, category TEXT, severity INT, created_on TEXT, summary TEXT, tags TEXT, origin_url ); CREATE INDEX idx_feed_created_on ON feed(created_on);