AI 與科技
Codex 的第二天:自動審批改為免費,審的是權限請求
Tibo · @thsottiaux
Tibo 在北京時間10月6日15:13宣佈:通過 ChatGPT 賬戶登錄的用戶可免費使用 Auto-review,且不消耗套餐額度。這是他28天改進承諾的接續;費用與開放範圍來自他的公告,尚未逐賬戶驗證。
Auto-review 處理的是編程助手申請越出沙箱邊界時的權限請求。獨立審查代理查看具體動作及其與用戶任務的關係,允許符合要求的請求,拒絕有問題的請求;被拒後,執行代理可以改用更安全的方法或交給人確認。它不等於替用戶審查每份代碼,也不會因為開啟而自動放寬沙箱。
這套機制早已有前情:OpenAI 的4月30日研究介紹已說明自動審查。10月6日的新消息是 Tibo 宣佈免收這部分使用額度。他隨後補充的入口是 Settings → General → Permissions → Auto-review。官方文檔說明,這項機制需要仍存在審批邊界;在不請求審批或完全訪問模式下,沒有相同的越界請求可交給它審核。
它要緩解的是反覆點批准造成的判斷疲勞。能否改善用戶體驗,仍應看中斷減少多少,以及錯誤批准和錯誤拒絕如何處理;自動化不構成每個動作都安全的保證。本期確認公告與機制的區別,未做賬戶計費或操作成功率測試。
主編加工 · 來源與限制見正文
金融與商業
美國服務業仍擴張,成本壓力與招聘同時回升
Liz Ann Sonders · @LizAnnSonders
Liz Ann Sonders 在10月6日並列展示9月美國製造業與服務業調查。ISM 的服務業綜合指數為54.9,低於8月55.4;製造業54.5,低於54.6。兩者仍在50以上。報告反映9月,服務業報告於10月5日發佈。
服務業新訂單從60.9降至59.8,業務活動從61.7降至56.5;就業從47.8升至50.1,三個月來首次回到擴張區間。價格指數卻由72.6升至74,交付指數由51.3升至53.2。交付指數越高表示交付越慢,不能當成供應效率提高。
這些是企業回答改善、持平或惡化後形成的擴散指數。54.9不是產出增長54.9%,74也不是通脹率74%。訂單仍較廣泛地增加、招聘改善,能夠與需求和成本增速放緩或加快同時發生。讀數組合支持“擴張仍在,成本與交付壓力未消失”,不能單靠這份調查確定降息或資產價格方向。
主編加工 · 來源與限制見正文
AI 與科技
物理學獎授予哈爾岑:用南極冰層尋找宇宙信使
華爾街日報中文網 · @ChineseWSJ
諾貝爾獎官方10月6日公告,將2026年物理學獎授予 Francis Halzen,表彰他對 IceCube 中微子天文臺及高能天體物理中微子研究的關鍵貢獻。關註名單中的華爾街日報中文網隨後報道此事。
IceCube 把約一立方公里的南極冰作為探測介質,傳感器記錄中微子罕見地與物質相互作用後產生的光。中微子難以被物質攔住,因而需要極大的探測體積;這種特性也讓它們能攜帶來自高能宇宙過程的信息,補充用光觀測天空的方法。
哈爾岑1988年提出相關構想,天文臺於2011年完成。10月6日的新變化是授獎,不是探測器剛建成或每個中微子的來源已被確定。它表彰的是把難以捕獲的粒子變成天文學觀測工具的長期工作。
主編加工 · 來源與限制見正文
政策與國際
巴西首輪無人過半,10月25日進入總統決選
華爾街日報中文網 · @ChineseWSJ
巴西最高選舉法院(TSE)公告確認:Flávio Bolsonaro 與 Luiz Inácio Lula da Silva 將在10月25日爭奪總統職位。北京時間10月5日已捕獲的幾條選舉消息,本輪合併為結果接續;領先首輪不等於當選總統。
TSE 頁面記錄,在當地10月5日00:11、99.99%投票箱完成彙總時,Bolsonaro 獲有效票47.03%,Lula 獲45.16%。兩人均未獲得首輪直接當選所需的有效票過半多數。這裡保留的是公告的時間點,不冒充最終計票讀回或新民調。
官方頁面另列的“有效票總數”與候選人比例及空白、無效票數據存在不一致,本稿不採用該總數。晨間再次讀到同一公告時間點;結果門戶僅返回應用入口,未取得最終計票,故不更新為最終結果。關於舞弊或外部組織影響選舉的轉帖缺少足夠證據,沒有併入報道。
主編加工 · 來源與限制見正文
生物醫藥
紐約麻疹應急令擴大接種與檢測能力
unusual_whales · @unusual_whales
紐約州長10月5日簽署第65號行政令,全州災害緊急狀態持續至11月4日。unusual_whales 在10月6日轉述。命令援引截至10月3日的全年108例麻疹,其中92例自7月15日起出現在18個縣接種不足的農村社區;這些不是當天新增病例。
措施的重點是擴大應對能力:滿足衛生主管條件的部分急救人員可依非患者特定醫囑接種 MMR;藥劑師可在該類醫囑下為兩歲及以上兒童接種;助產士需符合監督和資格條件。註冊護士獲得命令所列採樣、送檢權限。
行政令還要求相關接種在72小時內登記,並明確登記規則的變化不授權未經本人或法定代理人同意的接種。緊急狀態描述的是政府資源和權限安排,不能把全州適用範圍當成每個地區都有相同的感染風險。
主編加工 · 來源與限制見正文
金融與商業
CFO 均值背後,大企業與受約束小企業分化
Liz Ann Sonders · @LizAnnSonders
Liz Ann Sonders 10月6日重提第三季度 CFO Survey:對美國經濟和自身企業的樂觀度均略降,大企業改善被小企業和資金受限企業的下降抵消。調查由杜克大學與裡士滿、亞特蘭大聯儲合作,9月23日發佈,517名財務主管於8月17日至9月4日回答。
對整體經濟的樂觀度從第二季度60.6降至60.3,對自身企業從70.7降至69.7,刻度為0至100。新聞稿同時稱約20%的小企業、約10%的大企業面臨覆蓋費用或追求新機會的融資約束。因此均值小幅變化不能說明各類企業感受相同。
數據表中,企業對2026年銷售價格增幅的預測從上季度4.7%升至5.3%。這項預測按銷售額加權,並對極端值作縮尾處理;樂觀度則是不加權平均。預測不是已實現通脹,調查也不是10月新測量。它可為正面的9月ISM讀數提供不同觀察角度,不能把不同時間和人群的調查串成一條因果鏈。
主編加工 · 來源與限制見正文
AI 與科技
把加法寫成英文:準確率改善伴隨更長推理
Simon Willison · @simonw
Simon Willison 在北京時間10月6日轉發自己10月4日的實驗:讓本地 Qwen3.8-27B 的四位量化版本,把兩個整數的和只寫成英文單詞。任務檢驗數值正確性,格式合規不能替代算對。
非推理大測試在1至13位數的169種位數組合上各做30題,共5,070題,正確1,195題,約23.57%。另一箇中等推理測試的169題正確167題,約98.82%。兩組題量與抽樣不同,不能直接把23.57%到98.82%當成嚴格對照。
他隨後對固定的同一組169題作配對比較:非推理45題正確,推理167題正確。但配置不只改變推理強度:非推理最多輸出128 token,推理允許更長輸出;執行順序也不同。配對結果證明兩套配置表現不同,尚不能單獨量出推理模式的因果作用。
代價同樣具體:配對實驗中位延遲從1.50秒升至27.62秒,中位完成token從14升至313。實驗運行於 DGX Spark,使用 Qwen3.8-27B-Q4_K_M 文件。它說明更大計算預算可能換來這組加法任務的改善,不代表所有模型、任務或硬件都能得到同樣收益;本報沒有重跑實驗。
主編加工 · 來源與限制見正文
AI 與科技
12GB 顯存跑125B,條件藏在內存與模型版本里
Gorden Sun · @Gorden_Sun
Gorden Sun 10月4日介紹 Strata:用顯卡、內存和固態硬盤協同運行 Qwen3.8-Flash-Next。原帖是此前未結材料,本輪補讀項目說明後作為使用條件背景,不能當作10月6日新發布。
125B 是參數規模,12GB 是最低顯存要求,二者之間靠分工銜接:常用專家留在GPU,全量壓縮專家放在內存,CPU也參與計算;磁盤承擔模型存儲和部分表數據。項目同時要求至少32GB系統內存、約80GB磁盤空間,並推薦SSD。
32GB內存對應的 Coder 版本移除約一半專家,項目提醒代碼以外和中日韓語言表現較弱;48GB對應更小壓縮文件,64GB可容納更廣泛的壓縮版本。它不是任何12GB顯卡電腦都能無條件運行同一個完整模型。
README 提醒首次載入可能花1至3分鐘,鎖定大量內存時電腦可能暫時反應不佳。項目公佈的吞吐測試還綁定GPU、CPU、內存、量化和引擎版本。本報未安裝測評,也不把跨版本速度差視為獨立對照。決定是否試用,先核對模型文件、系統內存和工作負載,比只看顯存標題更有用。
本輪說明固定在10月6日提交82f46a8c;它是晨間所讀版本,不能倒推為10月4日原帖發佈時的配置。
主編加工 · 來源與限制見正文
AI 與科技
不逐個審 PR,寶玉列出四個前提
寶玉 · @dotey
寶玉在10月4日轉述一場AI編程訪談後,接著討論“不審每個PR”能否複製。這篇是他的條件分析:我們讀完兩帖,但未審看原訪談,因此不把轉述中的產出數量或公司經歷當成已核實的採訪事實。
第一是模型能力和預算:他認為強模型及足夠token是基礎,自己的多賬號經驗是個人做法,不等於團隊都應照購。第二是驗收:AI可以參與驗證,程序能重複檢查的交給腳本,仍需有人觀察產品表現和判斷結果,不能把自動執行當作通過。
第三是人的工程判斷。他用商城舉例:商品展示、瀏覽、註冊角色、支付和安全應分成小里程碑,逐步驗收,再增加規模;把整個商城一次交給模型,仍缺少方向和質量控制。第四是技能來源:回看自己的對話,找反覆糾正和人工介入的步驟,再做工具或技能,不能以照搬別人的配置代替診斷。
四項合起來,減少逐行審查並沒有消除人的責任,而是把責任移到任務拆解、可重複驗證和產品驗收。這個論證是作者的實踐建議,不是“不審PR更安全”的對照實驗;不同代碼的風險與可驗證程度,仍會影響審核方式。
主編加工 · 來源與限制見正文
AI 與科技
訂閱“值幾倍”,先問 token 是怎樣用的
Dylan Patel · @dylan522p
Dylan Patel 引用 SemiAnalysis 的訂閱額度分析。公開正文介紹了怎樣從用量表估計限額:把套餐、模型和token類型拆開,再以API標價換算可用額度的等價價值。它衡量的是一種成本口徑,不是任務質量、現金餘額或退款金額。
團隊分開測試新輸入、緩存寫入、緩存讀取和輸出。長文本加隨機標記用於避免命中同一個緩存;固定文本重複調用觀察緩存讀取,長篇輸出用於估計輸出成本。用量表通常按臺階變化,測試捨去開頭結尾不完整臺階,扣除其他token的估計成本,積累多個完整臺階。
五小時限額、周限額和特定模型限額也要分別處理。團隊用自己9月的代理工作負載混合比例作換算:緩存多或長輸出多的用戶可能得到不同排序。API降價即使不改變訂閱可用token,也會降低同一額度的API等價價值。
文章所說約五倍價值綁定具體模型和負載,不能擴大成所有用戶都能多完成五倍工作。其公開部分還報告同一套餐賬戶間出現約20%的差異,並稱供應商承認小範圍測試;這不是所有賬戶的固定差別。最後的第三方完整比較需要付費,本報尚未讀到,也沒有重做測試,本稿只呈現公開方法與可判斷的條件。
主編加工 · 來源與限制見正文
AI 與科技
dots 上線一週:先修審批、連接和等待,跨電腦仍在後續清單
Rohan Varma · @TheRohanVarma
ChatGPT 轉發
北京時間10月7日07:26,Rohan Varma 發佈 dots 的一週修復清單,ChatGPT 賬號轉帖。dots 是 OpenAI 此前介紹的常駐代理;這次更新集中在實際使用中的中斷、顯示和連接問題,不是新模型發佈。
作者列出的已交付改進包括:雲端瀏覽提速,使用 ChatGPT 時不再額外推送手機通知,網頁代碼塊與附件更清楚,回覆等待與側欄加載更順暢;Safari、Firefox 字符顯示和 Outlook 配置卡住也得到修復。審批按鈕被裁切、大 Gmail 預覽遮住批准操作、企業網頁與語音啟動訪問問題,均列入修復項。
後續計劃是另一組事項:提高語音可靠性,讓 dot 管理 Codex 項目文件夾、獲得完整線程上下文並重命名線程,展示正在處理的任務,連接多臺電腦,以及改善 Windows 本地控制。它們不能讀成全部已經可用。清單說明團隊正補齊代理工作的交接環節;“更快”是作者報告,本報未做性能或逐平臺複測。
主編加工 · 來源與限制見正文
AI 與科技
數學稿件公開了,但“發佈”還不等於“證明成立”
OpenAI · @OpenAI
OpenAI 在北京時間10月7日06:19宣佈公開內部模型產生的數學成果。其倉庫當前列出722份稿件、372個關聯問題族;約4000是模型嘗試的問題數,不能寫成4000項已經證明的定理。
同一個問題族可以包含主結果、補充論證、推論或替代證明,因此稿件數也不等於獨立突破數。公司同時公開部分 Lean 形式化證明、10份推理摘要與計算用量說明;Lean 讓計算機檢查形式化證明,仍須看具體命題和假設。
倉庫明確說核驗階段不同,未形式化的結果可能有問題,後續修訂會保留舊版本。模型尚未公開;平均每項結果約相當於三小時 ChatGPT Pro 思考計算量,是其披露口徑。本報核對的是目錄和發佈規則,未逐篇檢查證明,不能據此宣佈黎曼假設等難題已獲解決。
主編加工 · 來源與限制見正文
生物醫藥
他汀與青光眼風險較低相關,距離預防結論仍有一步
Eric Topol · @EricTopol
Eric Topol 在北京時間10月7日07:34問“他汀能預防青光眼嗎”,鏈接至《英國眼科學雜誌》研究。論文采用 TriNetX 既有病歷做回顧性比較,並沒有隨機讓人服藥。它發現的是關聯,不能據此把降脂藥改成青光眼預防藥。
新發開角型青光眼分析在匹配後,兩組各210701人,均超過40歲並有眼科就診記錄。五年觀察中,用藥組新增診斷4771例(2.3%),對照5491例(2.6%);HR為0.85,95%置信區間0.82至0.89。15%是模型估計的相對風險關聯,不能當成減少15個百分點;病例粗比例相差約0.3個百分點。
匹配只能處理病歷中可見的差異,仍可能漏掉依從性、劑量等混雜。數據庫也缺乏眼壓、視野和視神經影像等細節;另一分析的手術或治療升級不等於直接測量病情惡化。作者要求前瞻性隨機試驗。本期報道的是晨間討論及原論文的證據邊界,沒有新增用藥建議。
主編加工 · 來源與限制見正文
金融與商業
Valon融資:簽約年化收入,還不是到賬收入
a16z · @a16z
a16z 在10月7日晨間介紹 Valon。公司10月5日已公告融資1.5億美元、估值23億美元;Ribbit 是新投資方,a16z 繼續參與。這是融資接續,不是今晨剛完成的交易。
ValonOS 管理房貸數據、還款與合規流程。公司稱開放軟件六個月內簽下超過2億美元的年化經常性收入合同,美國六分之一未償房貸已簽約接入;簽約金額不等於已確認營收,簽約貸款也不等於全部完成遷移。公告另列 ServiceMac、Carrington 兩家大型服務商已經上線。數字是公司披露,尚無獨立審計。
主編加工 · 來源與限制見正文