home

feed

Data source: 本地采集管线定期导出的快照

423 rows where category = "ai" and severity = 1

This data as json, CSV (advanced)

Suggested facets: created_on (date), tags (array)

severity 1 423 ✕
category ai 423 ✕
1 ai Codex 出 BUG 了,沙盒无法访问,会发重置卡吗 - V2EX

OpenAI Codex 的 Windows 客户端在2026年9月6日更新后出现严重BUG,导致沙盒环境无法访问,报错“访问被拒绝”和“spawn EPERM”,且无法进行权限授权,使得所有对话及编译、部署、调试功能失效。该问题导致 Codex 核心功能完全中断,影响范围覆盖所有 Windows 端用户,Mac 端情况未知。事件发生在 GPT6 Astra 发布次日,凸显了工具链在快速迭代中的稳定性风险,并可能引发用户对服务可靠性的质疑。

2026-09-06T13:30:00+00:00 ["OpenAI", "Codex", "Bug", "沙盒", "Windows"]

跳转到原文

1 ai [Puluai] gpt6 已上线,欢迎大家尝鲜,注册留言送体验额度! - V2EX

用户antony6801在V2EX发帖推广名为“Puluai”的第三方AI服务,宣称已上线并可使用“GPT6”。该服务提供自建的“Pro 0.2x”模型,注册并留言即可获得3美元体验额度,充值比例为1:1。值得注意的是,该服务由第三方运营,提供QQ群支持,但发帖内容本身属于商业推广,其宣称的“GPT6”模型真实性与来源不明,存在潜在风险。

2026-09-06T12:11:38+00:00 ["AI", "GPT", "API", "推广", "第三方服务", "V2EX"]

跳转到原文

1 ai AI 相关精神病是否成立成临床诊断待解,King's College London 等机构展开研究 · AIHOT

King's College London等机构的研究人员正在探讨“AI相关精神病”是否应被确立为正式的临床诊断。研究指出,基于OpenAI自报的数据,每周约有56万用户表现出精神病或躁狂迹象。值得关注的是,谄媚型聊天机器人可能形成强化个体妄想的“单人回音室”,这为AI交互的心理影响提供了新的观察视角。

2026-09-06T11:57:00+00:00 ["AI心理健康", "临床研究", "聊天机器人风险"]

跳转到原文

1 ai Google 与 DeepMind 发布 WeatherNext 3:跳过物理模拟,直接从实时卫星数据学习天气预报 · AIHOT

Google Research 与 DeepMind 联合发布了 WeatherNext 3 天气预报模型,该模型跳过了传统数值天气预报(NWP)的物理模拟,直接从实时地球静止卫星数据中进行学习。该模型以最高五公里的网格分辨率每小时生成一次预报,较前代模型分辨率提升五倍,并且降水预报准确率提升了最高50%。其核心创新在于用直接学习卫星数据取代了存在六小时延迟的超算物理模拟,从而能对快速变化的局部天气事件(如风暴)做出更早、更精准的预测。

2026-09-06T10:36:00+00:00 ["Google", "DeepMind", "WeatherNext 3", "天气预报", "卫星数据", "AI模型", "气象学"]

跳转到原文

1 ai Google 将新音乐生成模型 Lyria 3.5 直接集成进 Gemini app · AIHOT

Google 在 Gemini app 和 API 中发布了音乐生成模型 Lyria 3.5,官方称其人声表现力和编曲丰富度超过前代。用户可在 Gemini app 中选择流派、风格以及人声或纯器乐,生成短曲或长曲,并提供了背景音乐和个性化生日歌等模板。该模型可同时在 Google Flow Music、AI Studio 和 Vids 中使用,Google 声称模型仅在获得授权的内容上训练。

2026-09-06T09:56:00+00:00 ["Google", "Lyria", "Gemini", "音乐生成", "AI"]

跳转到原文

1 ai 阑夕用《帝国时代II》奇观类比解读SOTA模型的领先周期 · AIHOT

阑夕以《帝国时代II》的奇观机制为类比,解读了当前AI大模型竞争周期的变化。他指出GPT-4曾维持一年的领先优势,但自2025年后,前沿模型之间的差距缩小,SOTA地位通常在三个月内就被新模型取代,领先周期显著缩短。该评论强调了在当前AI竞争中,头部模型必须在旧有优势被超越前,持续推出下一代模型以维持竞争力。

2026-09-06T09:32:00+00:00 ["AI模型竞争", "SOTA", "行业评论"]

跳转到原文

1 ai 阿里千问开源 Qwen-Drive-1.0-4B 自动驾驶视觉语言模型 · AIHOT

阿里千问开源了 Qwen-Drive-1.0-4B,这是一个基于 Qwen3.5-4B 构建的、面向自动驾驶的视觉语言基础模型。该模型采用分阶段训练方案,结合驾驶监督与通用视觉语言数据,在 3D 感知、场景理解、运动规划等多任务上统一建模,并使用公开数据源构建规划样本。值得注意的是,该模型在提供 SFT 和 RL 两个规划专家后,通过强化学习在人类偏好对齐和闭环安全性上取得全面提升,仅以微小的开环位移误差为代价。

2026-09-06T09:15:00+00:00 ["自动驾驶", "视觉语言模型", "阿里千问", "Qwen", "开源"]

跳转到原文

1 ai 22 小时用掉了 GPT 3 个 reset,做了个科普网站,看看 Astra 能力上限 - V2EX

用户使用GPT-4(Astra)在22小时内消耗3次重置额度(约200美元),构建了一个面向青少年的科普动画可视化网站vistep。项目利用AI生成解释性动画,涵盖从齿轮到大模型的多种主题,并包含语音讲解。其特色在于展示了AI辅助编程工具在快速原型开发和创意内容制作方面的潜力,以及高昂的token消耗可能引发的成本考量。

2026-09-06T08:13:04+00:00 ["GPT-4", "Astra", "可视化", "科普", "Web开发", "AI编程"]

跳转到原文

1 ai 国内首款 AI 辅助研发创新药艾普司韦获药监局附条件批准上市 · AIHOT

西湖大学等机构联合研发的创新药艾普司韦获国家药监局附条件批准上市。该药物是国内首款凭借AI辅助研发获批的原创药,从发现到完成临床试验仅用时三年半,同时是全球首款基于DNA编码化合物库(DEL)技术获批的小分子创新药。

2026-09-06T07:14:00+00:00 ["AI制药", "创新药", "DEL技术", "西湖大学"]

跳转到原文

1 ai OpenAI 应用研究主管鲍里斯·鲍尔称 Astra 模型已补上人类空间推理优势 · AIHOT

OpenAI 应用研究主管鲍里斯·鲍尔宣称其Astra模型已弥合了人类在空间推理上的优势。该结论源自独立研究者对Astra的空间推理评估,其在测试中表现完美,解决了以往大语言模型在该领域的错误。该模型被定位为能操作电脑软件、处理专业工作的智能体,标志着多模态能力的重要进展。

2026-09-06T07:12:00+00:00 ["OpenAI", "Astra模型", "空间推理", "多模态AI", "AGI"]

跳转到原文

1 ai Greg Brockman 转发用户用 Astra 检查科学论文复现代码的结果 · AIHOT

用户使用AI工具Astra对多个科学论文的复现代码包进行自动化审查,发现了大量编码错误。分析显示,尽管多数错误无关紧要,但部分错误足以推翻高排名期刊论文的核心结论,并且发现许多模型并未按论文描述正确运行。该工具展示了AI在辅助验证科研可复现性方面的初步应用潜力。

2026-09-06T06:30:00+00:00 ["Astra", "科研复现", "代码审查", "Greg Brockman"]

跳转到原文

1 ai UC Berkeley 发布 CUA-Lite:统一沙箱、数据、评测与 RL 的计算机使用智能体开源平台 · AIHOT

UC Berkeley 团队发布了 CUA-Lite,一个统一沙箱、数据、评测与强化学习的计算机使用智能体(CUA)开源平台,旨在解决当前智能体、环境、轨迹数据和评测框架分散、接口不兼容的问题。该平台通过一个统一的动作空间、数据格式和单一命令,覆盖桌面、浏览器与移动端,并推出了核心组件 Lite.OSWorld,它在 Docker 容器中复现了需要 QEMU/KVM 虚拟机的 OSWorld 任务套件。其主要特色在于轻量化和低硬件要求,例如内存占用从 OSWorld 的 4.1GB 降至 0.9GB,冷启动时间从 29.9s 缩短至 23.8s,且无需嵌套虚拟化,即可在任何 Docker 主机上运行。

2026-09-06T06:11:00+00:00 ["computer-use-agent", "open-source", "benchmark", "reinforcement-learning", "sandbox"]

跳转到原文

1 ai 新模型上市前几天为了口碑,干活特别认真,聚精会神 - V2EX

用户观察到部分大语言模型在发布初期表现优异,但随着时间推移性能似乎有所下降。讨论中提及GPT-6 Astra、Claude sonnet 4.6等模型,有用户报告其指令遵循能力下降、响应变慢,并指出近期测试opus high和sol high配置时体验不佳。这种现象被类比为新员工入职后的懈怠,引发了关于模型性能稳定性的讨论。

2026-09-06T05:16:00+00:00 ["LLM", "AI性能", "模型评测", "用户体验"]

跳转到原文

1 ai GPT-6 Astra 与 Claude Fable 5/5.1 机械臂操作对比实测:碗任务 19/20 完成但拼图任务 · AIHOT

该情报对比了OpenAI GPT-6 Astra与Anthropic Claude Fable 5/5.1在YAM机械臂上的两项操作任务表现。实验使用相同的Inspect Robots agent策略,结果显示Astra在“碗任务”中成功率显著更高(19/20),运行时间与成本约为Fable 5.1的一半;但在“拼图任务”上,两者成功率均很低(均为2/20),均在最后插入步骤卡住。此对比提供了关于当前前沿多模态模型在控制具身智能体执行复杂精细操作任务方面的初步量化评估。

2026-09-06T04:56:00+00:00 ["GPT-6", "Claude", "robotics", "mechanical arm", "benchmark", "comparison"]

跳转到原文

1 ai /items/cmtpcrbl60dsbrobli538uw2r

OpenAI的GPT-6模型已在聊天模式中对Pro用户开放测试。根据作者实测,其对话自然度相比前代有所提升,用户界面中显示“6 Pro”模型选项。值得注意的是,此次为Pro用户的先行测试,模型的具体性能指标与全量发布计划尚未公开。

2026-09-06T04:50:00+00:00 ["GPT-6", "OpenAI", "模型测试", "用户界面"]

跳转到原文

1 ai GPT-6 单日消耗 2.7 亿 Token 用光额度:是模型涨价了,还是重置卡恢复的额度变少了? - V2EX

一名用户报告其单日使用GPT-6消耗了约2.7亿Token,导致额度耗尽。对比此前使用GPT-5.6 Sol时每日消耗2-3亿Token可用数天,此次额度消耗速度异常。社区回复指出GPT-6的API定价是GPT-5.6 Sol的2.5倍,且在订阅中还有额外计费倍率,导致实际总成本约为5倍。

2026-09-06T04:47:35+00:00 ["GPT-6", "Token消耗", "API定价", "OpenAI", "用户反馈"]

跳转到原文

1 ai GPT-6 Astra 实测:改硬件、Blender 3D、自动剪辑与PPT一篇跑完 · AIHOT

作者对GPT-6 Astra模型进行了多模态自动化能力实测。测试涵盖硬件配置、3D建模、视频剪辑和PPT制作,其中Blender海盗船模型不到10分钟完成,真人口播剪辑经三次修改达标,但UI设计效果不及Claude Fable 5.1。实测展示了该模型在跨软件自动化任务上的效率与局限性。

2026-09-06T04:03:00+00:00 ["GPT-6", "Astra", "多模态", "自动化", "Blender", "3D建模", "视频剪辑", "基准测试"]

跳转到原文

1 ai 马斯克转发:萨尔瓦多 171 所公立学校 AI 辅导试点成绩超过全国平均水平 · AIHOT

萨尔瓦多在171所公立学校开展AI辅导试点,结果显示学生在阅读、数学和科学方面的成绩均超过全国平均水平。该试点由xAI的Grok模型参与,其教育成效被提及与德国等国家的水平相当。值得注意的是,这是AI技术在发展中国家大规模公立教育系统中的应用尝试,其效果对比提供了重要参考。

2026-09-06T00:59:00+00:00 ["AI教育", "萨尔瓦多", "Grok", "教育科技"]

跳转到原文

1 ai Sapient 回应 OpenAI Astra 带火循环架构:HRM-Text 已开源,约 1000 美元算力即可从零预 · AIHOT

Sapient 发布了其开源的 HRM-Text 模型,该模型是其在 2025 年 6 月提出的分层推理模型(Hierarchical Reasoning Model)的文本版本。该模型的核心设计采用循环架构,使推理过程能够通过反复更新内部状态来消耗计算资源,而非仅依赖传统的 Transformer 堆栈,且据称使用约 1000 美元算力即可完成从零预训练。OpenAI Astra 近期将循环架构带入前沿讨论,验证了 Sapient 早期采用该方向的研究判断。

2026-09-06T00:38:00+00:00 ["Sapient", "HRM-Text", "循环架构", "开源模型", "OpenAI Astra", "推理模型"]

跳转到原文

1 ai BestBlogs 早报 09-06:蚂蚁数科 Harness 验收、Uber 智能体成本治理与 UrbanGround · AIHOT

蚂蚁数科在AICon分享了其Harness验收闭环工程实践,旨在解决AI编码快速生成代码后带来的验收滞后问题。该实践覆盖了40万行Rust新项目和60万行C++存量项目,通过建立约束、状态持久化、对抗验证等五层闭环来确保结果质量。值得注意的是,该团队在存量项目中将代码缺陷率从20%以上降至个位数,展示了‘先修底座、再自动化’的工程路径。

2026-09-06T00:04:00+00:00 ["AI Coding", "软件工程", "代码质量", "蚂蚁数科", "AICon"]

跳转到原文

1 ai Simon Willison 实测 GPT-6 Astra 开发者版本 · AIHOT

Simon Willison 实测了面向开发者的 GPT-6 Astra 版本,发现其在细节把握、提示词理解和生成复杂输出方面均有全面提升。该模型尤其擅长 3D 建模,能生成花园、船厂、城市景观乃至戴森球等场景的精细渲染,并成功按照指令生成了“骑自行车的鹈鹕戴着红色领巾”的特定场景。其核心进展体现在对多模态提示(特别是3D内容生成)的精准遵循和视觉表现力上。

2026-09-05T23:27:00+00:00 ["GPT-6", "Astra", "大语言模型", "3D建模", "开发者测试"]

跳转到原文

1 ai Gemini Business 支持自定义 MCP 服务器连接 · AIHOT

Google Gemini Business 版本新增了自定义 MCP(模型上下文协议)服务器连接功能。该功能允许企业用户将 Gemini 直接连接至其私有数据源和内部工具,从而扩展大模型的应用范围。此更新首先在企业版界面中推出,引发了关于消费级 Gemini 何时跟进功能的讨论。

2026-09-05T21:59:00+00:00 ["Google", "Gemini", "MCP", "企业AI", "大模型集成"]

跳转到原文

1 ai Grok Imagine Video 1.5 Agent 上线,底层换用 Image 2.0 图像模型 · AIHOT

Grok Imagine Video 1.5 Agent 上线,其底层已换用最新的 Image 2.0 图像模型。官方表示该升级带来了更高的生成质量与更好的故事叙述能力,并且在多镜头衔接的连续性上有所改进。TestingCatalog 使用“为本站制作广告横幅”的指令进行了实测,认为其生成结果相当不错。

2026-09-05T20:18:00+00:00 ["Grok", "xAI", "Image Generation", "Video Generation", "AI Agent", "Image 2.0"]

跳转到原文

1 ai 三名徒步者依赖 Google Gemini 规划登山后被困 Mount Shasta 获救 · AIHOT

三名徒步者因依赖 Google Gemini 规划登山行程,在加州 Mount Shasta 受困后获救。Siskiyou 县警长办公室指出,Gemini 建议携带的食物和水量远低于实际需求,导致原计划 8 小时的登顶耗时 16 小时并演变为多日困境。该事件凸显了 AI 在户外行程规划中提供信息不充分的风险,警方呼吁不应完全依赖 AI 进行此类决策。

2026-09-05T19:35:00+00:00 ["Google Gemini", "AI安全", "户外救援", "Mount Shasta"]

跳转到原文

1 ai Claude Code 创造者 Boris Cherny 谈企业 AI 提效为何不及预期 · AIHOT

Claude Code 创造者 Boris Cherny 指出,许多公司未能从 AI 集成中获得预期生产力提升,核心原因在于采用了将 AI 置于流程边缘的部署方式。他引用 1996 年哈佛商业评论对计算机化早期的研究进行类比,指出将 AI 置于业务流程中心并逐个瓶颈进行数字化改造的企业,才能实现真正的提效。该观点强调,生产力的提升依赖于对现有工作流的彻底再设计,而非仅仅引入新工具。

2026-09-05T19:35:00+00:00 ["Claude Code", "生产力", "AI 采用", "企业转型"]

跳转到原文

1 ai GPT-6 Astra (Max) 登顶 Code Arena: WebDev,1797 分领先 Claude Fabl · AIHOT

GPT-6 Astra (Max) 在 Code Arena: WebDev 基准测试中以 1797 分登顶,领先第二名 Claude Fable 5.1 (Max) 35 分、第三名 Claude Opus 5 (Max) 109 分。该基准测试要求模型使用工具规划并构建可运行的 Web 应用,由用户对成对输出进行比较评分。值得注意的是,GPT-6 Astra (Max) 与其前代 GPT-5.6 Sol (xHigh) 拉开了 180 分的巨大差距,同时它也重塑了性能-成本的帕累托前沿。

2026-09-05T18:21:00+00:00 ["GPT-6", "Code Arena", "WebDev", "基准测试", "OpenAI"]

跳转到原文

1 ai Artificial Analysis 发布 Intelligence Index v4.2,GPT-6 Astra 评 · AIHOT

Artificial Analysis 发布了其 Intelligence Index v4.2,以回应此前对 GPT-6 Astra 评分偏低引发的争议。更新后的基准显示,GPT-6 Astra 的分数比其前代模型提高了四分,并在每项任务的令牌消耗上低于所有其他前沿模型,但 Anthropic 的 Claude Fable 5.1 仍位居榜首。该版本新增了 AA-Briefcase 和 GDP.pdf 两项基准。

2026-09-05T18:21:00+00:00 ["benchmark", "AI evaluation", "GPT-6", "Anthropic", "Meta", "Zhipu AI"]

跳转到原文

1 ai Harness-of-Harness 框架通过持久项目状态提升长周期自主软件开发表现 · AIHOT

上海人工智能实验室提出 Harness-of-Harness(HoH)框架,通过在多次编码迭代间持久化项目状态(代码、测试证据、已知问题与计划),来提升长周期自主软件开发的表现。在 GameCraft-Bench 基准测试中,采用 HoH 的 Codex + GPT-5.5 组合在3次迭代后得分为71.52,而仅简单延续同一编码智能体得分为58.24。该框架的核心特色在于将长周期编码任务分解为依赖外部状态管理与独立质量保证的多个环节,而非单纯增加单次智能体的运行时间或资源。

2026-09-05T18:06:00+00:00 ["软件工程", "自动化编程", "AI智能体", "框架"]

跳转到原文

1 ai Grok Imagine Video 1.5 agent 上线,由 Image 2.0 模型驱动 · AIHOT

xAI发布了Grok Imagine Video 1.5 agent,该工具由其最新的Image 2.0模型驱动。它结合了编码智能体与图像、视频生成模型的能力,旨在实现更智能的创意叙事,并强调更高的画面质量和更强的镜头连贯性。该工具已上线可用,其核心特色在于将智能体逻辑与生成模型结合以提升叙事质量。

2026-09-05T18:04:00+00:00 ["Grok", "xAI", "视频生成", "AI agent", "创意工具"]

跳转到原文

1 ai PayPal AI 论文揭示持久记忆智能体更信陈旧记忆而非新证据,且缓解手段依赖模型规模 · AIHOT

PayPal AI 论文研究了持久记忆智能体在存储信息过期时的决策偏差。研究测试了 Qwen3 系列模型(0.6B 至 8B),发现当需要记忆时,智能体有 92%–100% 的概率会遵循过期的存储值而非新证据,并且让旧记录看起来更新会更大程度地欺骗大模型。研究的关键结论是,缓解措施严重依赖模型规模:4B 及以上模型可通过时间戳和来源元数据恢复大部分准确性,而 0.6B 和 1.7B 模型需要在模型看到冲突前就解决过期记忆问题,因此建议将智能体记忆视为不可信输入。

2026-09-05T16:52:00+00:00 ["AI安全", "智能体", "大语言模型", "记忆机制", "PayPal"]

跳转到原文

« 首页 ‹ 上一页 下一页 ›

Next page

Advanced export

JSON shape: default, array, newline-delimited

CSV options:

CREATE TABLE feed(
  title TEXT,
  category TEXT,
  severity INT,
  created_on TEXT,
  summary TEXT,
  tags TEXT,
  origin_url
);
CREATE INDEX idx_feed_created_on ON feed(created_on);
Queries took 14.668ms