AI 与科技
Codex 的第二天:自动审批改为免费,审的是权限请求
Tibo · @thsottiaux
Tibo 在北京时间10月6日15:13宣布:通过 ChatGPT 账户登录的用户可免费使用 Auto-review,且不消耗套餐额度。这是他28天改进承诺的接续;费用与开放范围来自他的公告,尚未逐账户验证。
Auto-review 处理的是编程助手申请越出沙箱边界时的权限请求。独立审查代理查看具体动作及其与用户任务的关系,允许符合要求的请求,拒绝有问题的请求;被拒后,执行代理可以改用更安全的方法或交给人确认。它不等于替用户审查每份代码,也不会因为开启而自动放宽沙箱。
这套机制早已有前情:OpenAI 的4月30日研究介绍已说明自动审查。10月6日的新消息是 Tibo 宣布免收这部分使用额度。他随后补充的入口是 Settings → General → Permissions → Auto-review。官方文档说明,这项机制需要仍存在审批边界;在不请求审批或完全访问模式下,没有相同的越界请求可交给它审核。
它要缓解的是反复点批准造成的判断疲劳。能否改善用户体验,仍应看中断减少多少,以及错误批准和错误拒绝如何处理;自动化不构成每个动作都安全的保证。本期确认公告与机制的区别,未做账户计费或操作成功率测试。
主编加工 · 来源与限制见正文
金融与商业
美国服务业仍扩张,成本压力与招聘同时回升
Liz Ann Sonders · @LizAnnSonders
Liz Ann Sonders 在10月6日并列展示9月美国制造业与服务业调查。ISM 的服务业综合指数为54.9,低于8月55.4;制造业54.5,低于54.6。两者仍在50以上。报告反映9月,服务业报告于10月5日发布。
服务业新订单从60.9降至59.8,业务活动从61.7降至56.5;就业从47.8升至50.1,三个月来首次回到扩张区间。价格指数却由72.6升至74,交付指数由51.3升至53.2。交付指数越高表示交付越慢,不能当成供应效率提高。
这些是企业回答改善、持平或恶化后形成的扩散指数。54.9不是产出增长54.9%,74也不是通胀率74%。订单仍较广泛地增加、招聘改善,能够与需求和成本增速放缓或加快同时发生。读数组合支持“扩张仍在,成本与交付压力未消失”,不能单靠这份调查确定降息或资产价格方向。
主编加工 · 来源与限制见正文
AI 与科技
物理学奖授予哈尔岑:用南极冰层寻找宇宙信使
华尔街日报中文网 · @ChineseWSJ
诺贝尔奖官方10月6日公告,将2026年物理学奖授予 Francis Halzen,表彰他对 IceCube 中微子天文台及高能天体物理中微子研究的关键贡献。关注名单中的华尔街日报中文网随后报道此事。
IceCube 把约一立方公里的南极冰作为探测介质,传感器记录中微子罕见地与物质相互作用后产生的光。中微子难以被物质拦住,因而需要极大的探测体积;这种特性也让它们能携带来自高能宇宙过程的信息,补充用光观测天空的方法。
哈尔岑1988年提出相关构想,天文台于2011年完成。10月6日的新变化是授奖,不是探测器刚建成或每个中微子的来源已被确定。它表彰的是把难以捕获的粒子变成天文学观测工具的长期工作。
主编加工 · 来源与限制见正文
政策与国际
巴西首轮无人过半,10月25日进入总统决选
华尔街日报中文网 · @ChineseWSJ
巴西最高选举法院(TSE)公告确认:Flávio Bolsonaro 与 Luiz Inácio Lula da Silva 将在10月25日争夺总统职位。北京时间10月5日已捕获的几条选举消息,本轮合并为结果接续;领先首轮不等于当选总统。
TSE 页面记录,在当地10月5日00:11、99.99%投票箱完成汇总时,Bolsonaro 获有效票47.03%,Lula 获45.16%。两人均未获得首轮直接当选所需的有效票过半多数。这里保留的是公告的时间点,不冒充最终计票读回或新民调。
官方页面另列的“有效票总数”与候选人比例及空白、无效票数据存在不一致,本稿不采用该总数。晨间再次读到同一公告时间点;结果门户仅返回应用入口,未取得最终计票,故不更新为最终结果。关于舞弊或外部组织影响选举的转帖缺少足够证据,没有并入报道。
主编加工 · 来源与限制见正文
生物医药
纽约麻疹应急令扩大接种与检测能力
unusual_whales · @unusual_whales
纽约州长10月5日签署第65号行政令,全州灾害紧急状态持续至11月4日。unusual_whales 在10月6日转述。命令援引截至10月3日的全年108例麻疹,其中92例自7月15日起出现在18个县接种不足的农村社区;这些不是当天新增病例。
措施的重点是扩大应对能力:满足卫生主管条件的部分急救人员可依非患者特定医嘱接种 MMR;药剂师可在该类医嘱下为两岁及以上儿童接种;助产士需符合监督和资格条件。注册护士获得命令所列采样、送检权限。
行政令还要求相关接种在72小时内登记,并明确登记规则的变化不授权未经本人或法定代理人同意的接种。紧急状态描述的是政府资源和权限安排,不能把全州适用范围当成每个地区都有相同的感染风险。
主编加工 · 来源与限制见正文
金融与商业
CFO 均值背后,大企业与受约束小企业分化
Liz Ann Sonders · @LizAnnSonders
Liz Ann Sonders 10月6日重提第三季度 CFO Survey:对美国经济和自身企业的乐观度均略降,大企业改善被小企业和资金受限企业的下降抵消。调查由杜克大学与里士满、亚特兰大联储合作,9月23日发布,517名财务主管于8月17日至9月4日回答。
对整体经济的乐观度从第二季度60.6降至60.3,对自身企业从70.7降至69.7,刻度为0至100。新闻稿同时称约20%的小企业、约10%的大企业面临覆盖费用或追求新机会的融资约束。因此均值小幅变化不能说明各类企业感受相同。
数据表中,企业对2026年销售价格增幅的预测从上季度4.7%升至5.3%。这项预测按销售额加权,并对极端值作缩尾处理;乐观度则是不加权平均。预测不是已实现通胀,调查也不是10月新测量。它可为正面的9月ISM读数提供不同观察角度,不能把不同时间和人群的调查串成一条因果链。
主编加工 · 来源与限制见正文
AI 与科技
把加法写成英文:准确率改善伴随更长推理
Simon Willison · @simonw
Simon Willison 在北京时间10月6日转发自己10月4日的实验:让本地 Qwen3.8-27B 的四位量化版本,把两个整数的和只写成英文单词。任务检验数值正确性,格式合规不能替代算对。
非推理大测试在1至13位数的169种位数组合上各做30题,共5,070题,正确1,195题,约23.57%。另一个中等推理测试的169题正确167题,约98.82%。两组题量与抽样不同,不能直接把23.57%到98.82%当成严格对照。
他随后对固定的同一组169题作配对比较:非推理45题正确,推理167题正确。但配置不只改变推理强度:非推理最多输出128 token,推理允许更长输出;执行顺序也不同。配对结果证明两套配置表现不同,尚不能单独量出推理模式的因果作用。
代价同样具体:配对实验中位延迟从1.50秒升至27.62秒,中位完成token从14升至313。实验运行于 DGX Spark,使用 Qwen3.8-27B-Q4_K_M 文件。它说明更大计算预算可能换来这组加法任务的改善,不代表所有模型、任务或硬件都能得到同样收益;本报没有重跑实验。
主编加工 · 来源与限制见正文
AI 与科技
12GB 显存跑125B,条件藏在内存与模型版本里
Gorden Sun · @Gorden_Sun
Gorden Sun 10月4日介绍 Strata:用显卡、内存和固态硬盘协同运行 Qwen3.8-Flash-Next。原帖是此前未结材料,本轮补读项目说明后作为使用条件背景,不能当作10月6日新发布。
125B 是参数规模,12GB 是最低显存要求,二者之间靠分工衔接:常用专家留在GPU,全量压缩专家放在内存,CPU也参与计算;磁盘承担模型存储和部分表数据。项目同时要求至少32GB系统内存、约80GB磁盘空间,并推荐SSD。
32GB内存对应的 Coder 版本移除约一半专家,项目提醒代码以外和中日韩语言表现较弱;48GB对应更小压缩文件,64GB可容纳更广泛的压缩版本。它不是任何12GB显卡电脑都能无条件运行同一个完整模型。
README 提醒首次载入可能花1至3分钟,锁定大量内存时电脑可能暂时反应不佳。项目公布的吞吐测试还绑定GPU、CPU、内存、量化和引擎版本。本报未安装测评,也不把跨版本速度差视为独立对照。决定是否试用,先核对模型文件、系统内存和工作负载,比只看显存标题更有用。
本轮说明固定在10月6日提交82f46a8c;它是晨间所读版本,不能倒推为10月4日原帖发布时的配置。
主编加工 · 来源与限制见正文
AI 与科技
不逐个审 PR,宝玉列出四个前提
宝玉 · @dotey
宝玉在10月4日转述一场AI编程访谈后,接着讨论“不审每个PR”能否复制。这篇是他的条件分析:我们读完两帖,但未审看原访谈,因此不把转述中的产出数量或公司经历当成已核实的采访事实。
第一是模型能力和预算:他认为强模型及足够token是基础,自己的多账号经验是个人做法,不等于团队都应照购。第二是验收:AI可以参与验证,程序能重复检查的交给脚本,仍需有人观察产品表现和判断结果,不能把自动执行当作通过。
第三是人的工程判断。他用商城举例:商品展示、浏览、注册角色、支付和安全应分成小里程碑,逐步验收,再增加规模;把整个商城一次交给模型,仍缺少方向和质量控制。第四是技能来源:回看自己的对话,找反复纠正和人工介入的步骤,再做工具或技能,不能以照搬别人的配置代替诊断。
四项合起来,减少逐行审查并没有消除人的责任,而是把责任移到任务拆解、可重复验证和产品验收。这个论证是作者的实践建议,不是“不审PR更安全”的对照实验;不同代码的风险与可验证程度,仍会影响审核方式。
主编加工 · 来源与限制见正文
AI 与科技
订阅“值几倍”,先问 token 是怎样用的
Dylan Patel · @dylan522p
Dylan Patel 引用 SemiAnalysis 的订阅额度分析。公开正文介绍了怎样从用量表估计限额:把套餐、模型和token类型拆开,再以API标价换算可用额度的等价价值。它衡量的是一种成本口径,不是任务质量、现金余额或退款金额。
团队分开测试新输入、缓存写入、缓存读取和输出。长文本加随机标记用于避免命中同一个缓存;固定文本重复调用观察缓存读取,长篇输出用于估计输出成本。用量表通常按台阶变化,测试舍去开头结尾不完整台阶,扣除其他token的估计成本,积累多个完整台阶。
五小时限额、周限额和特定模型限额也要分别处理。团队用自己9月的代理工作负载混合比例作换算:缓存多或长输出多的用户可能得到不同排序。API降价即使不改变订阅可用token,也会降低同一额度的API等价价值。
文章所说约五倍价值绑定具体模型和负载,不能扩大成所有用户都能多完成五倍工作。其公开部分还报告同一套餐账户间出现约20%的差异,并称供应商承认小范围测试;这不是所有账户的固定差别。最后的第三方完整比较需要付费,本报尚未读到,也没有重做测试,本稿只呈现公开方法与可判断的条件。
主编加工 · 来源与限制见正文
AI 与科技
dots 上线一周:先修审批、连接和等待,跨电脑仍在后续清单
Rohan Varma · @TheRohanVarma
ChatGPT 转发
北京时间10月7日07:26,Rohan Varma 发布 dots 的一周修复清单,ChatGPT 账号转帖。dots 是 OpenAI 此前介绍的常驻代理;这次更新集中在实际使用中的中断、显示和连接问题,不是新模型发布。
作者列出的已交付改进包括:云端浏览提速,使用 ChatGPT 时不再额外推送手机通知,网页代码块与附件更清楚,回复等待与侧栏加载更顺畅;Safari、Firefox 字符显示和 Outlook 配置卡住也得到修复。审批按钮被裁切、大 Gmail 预览遮住批准操作、企业网页与语音启动访问问题,均列入修复项。
后续计划是另一组事项:提高语音可靠性,让 dot 管理 Codex 项目文件夹、获得完整线程上下文并重命名线程,展示正在处理的任务,连接多台电脑,以及改善 Windows 本地控制。它们不能读成全部已经可用。清单说明团队正补齐代理工作的交接环节;“更快”是作者报告,本报未做性能或逐平台复测。
主编加工 · 来源与限制见正文
AI 与科技
数学稿件公开了,但“发布”还不等于“证明成立”
OpenAI · @OpenAI
OpenAI 在北京时间10月7日06:19宣布公开内部模型产生的数学成果。其仓库当前列出722份稿件、372个关联问题族;约4000是模型尝试的问题数,不能写成4000项已经证明的定理。
同一个问题族可以包含主结果、补充论证、推论或替代证明,因此稿件数也不等于独立突破数。公司同时公开部分 Lean 形式化证明、10份推理摘要与计算用量说明;Lean 让计算机检查形式化证明,仍须看具体命题和假设。
仓库明确说核验阶段不同,未形式化的结果可能有问题,后续修订会保留旧版本。模型尚未公开;平均每项结果约相当于三小时 ChatGPT Pro 思考计算量,是其披露口径。本报核对的是目录和发布规则,未逐篇检查证明,不能据此宣布黎曼假设等难题已获解决。
主编加工 · 来源与限制见正文
生物医药
他汀与青光眼风险较低相关,距离预防结论仍有一步
Eric Topol · @EricTopol
Eric Topol 在北京时间10月7日07:34问“他汀能预防青光眼吗”,链接至《英国眼科学杂志》研究。论文采用 TriNetX 既有病历做回顾性比较,并没有随机让人服药。它发现的是关联,不能据此把降脂药改成青光眼预防药。
新发开角型青光眼分析在匹配后,两组各210701人,均超过40岁并有眼科就诊记录。五年观察中,用药组新增诊断4771例(2.3%),对照5491例(2.6%);HR为0.85,95%置信区间0.82至0.89。15%是模型估计的相对风险关联,不能当成减少15个百分点;病例粗比例相差约0.3个百分点。
匹配只能处理病历中可见的差异,仍可能漏掉依从性、剂量等混杂。数据库也缺乏眼压、视野和视神经影像等细节;另一分析的手术或治疗升级不等于直接测量病情恶化。作者要求前瞻性随机试验。本期报道的是晨间讨论及原论文的证据边界,没有新增用药建议。
主编加工 · 来源与限制见正文
金融与商业
Valon融资:签约年化收入,还不是到账收入
a16z · @a16z
a16z 在10月7日晨间介绍 Valon。公司10月5日已公告融资1.5亿美元、估值23亿美元;Ribbit 是新投资方,a16z 继续参与。这是融资接续,不是今晨刚完成的交易。
ValonOS 管理房贷数据、还款与合规流程。公司称开放软件六个月内签下超过2亿美元的年化经常性收入合同,美国六分之一未偿房贷已签约接入;签约金额不等于已确认营收,签约贷款也不等于全部完成迁移。公告另列 ServiceMac、Carrington 两家大型服务商已经上线。数字是公司披露,尚无独立审计。
主编加工 · 来源与限制见正文