AI 與科技 10/05 04:33
28 天承諾之後,Codex 要回答什麼算“改進”
Tibo · @thsottiaux
在 OpenAI 從事 Codex 與 ChatGPT 工作的 Tibo(@thsottiaux)承諾:接下來 28 天,每天要麼交付對多數 Codex/Work 用戶有用的明顯改進,要麼全面重置。用戶隨即追問:什麼才算改進,誰來判定?
這不是一條孤立的促銷口號。10 月 4 日,Tibo 先把正在做的工作收攏為四個方向:簡化、提高效率以支持更多使用、開創性功能或新模型。他承認用戶反饋很明確——希望事情更簡單。到了北京時間 10 月 5 日凌晨,他引用這條回應,給出了 28 天的期限。
他給出的條件不是隻要有發佈,而是改進必須明顯,並與多數 Codex/Work 用戶相關。Codex 是面向編程任務的 AI 工具;Work 是他在承諾中使用的產品稱謂。寶玉將承諾轉述為每天上新,否則重置額度;Gorden Sun 則追問由誰判定有效、是否會把一項功能拆成多天發佈,並表示自己更希望得到額度和模型改善。原帖沒有在這條承諾裡解釋全面重置涉及哪些額度、賬戶與執行時間。
兌現問題已經有前情。10 月 3 日,Tibo 發帖稱部分被他稱為“Pro 500”的訂閱用戶此前沒有得到預期重置,正在調查;之後又稱問題已修復。這裡只能確認他報告了調查和修復,不能替所有賬戶確認結果。但這使“重置”成為需要檢查執行的事項,而不只是公告裡的一個詞。
承諾與質疑之間的差別,是發佈動作和使用收益能否對應:公告可以逐日出現,但額度是否恢復、功能是否解決原有問題,需要檢查實際結果。此前重置問題說明這不是純粹的措辭之爭。本期能確認的是承諾、用戶回應和 Tibo 自述的修復;28 天的兌現情況尚未形成。
原帖、前情與補充來源已複審
AI 與科技 10/02 04:27
Claude Mods:把上下文、工具調用和下一步動作放進界面
Boris Cherny · @bcherny
Boris Cherny 介紹的 Mods,讓 Claude Code 用戶改造編程助手的界面與行為:不僅增加提示,還能在工具執行前插入處理步驟,並把這些改造作為插件分享。
普通技能主要向模型提供說明,外部工具向模型提供能力;Mods 則以 JavaScript 或 TypeScript 代碼在 Claude Code 內響應事件。提交提示、準備調用工具、繪製界面時,它可以觀察事件、修改事件,或接管處理。因此,它既能增加面板,也能改變一次操作如何繼續。
官方示例 blast-radius 展示了完整用途:遇到刪除文件或強制推送等命令時,先暫停調用,顯示預計影響,再給用戶繼續或取消的按鈕。另一個示例 token-weather 在輸入區上方顯示上下文窗口的使用情況——也就是模型這一輪能容納的信息用了多少。replay-theater 則用 /replay 逐步回放上一輪的文件修改。ClaudeDevs 的接續示例進一步說明:token-weather 除了顯示用量,還畫出過去十二輪的變化,讓用戶看見上下文如何被逐步填滿。
Thariq 展示的 next-steps 會建議接下來可選的技能與命令;ClaudeDevs 的 You should Know 則提示輸出中可能被忽略的信息。這些例子分別處理做什麼、注意什麼以及執行前看清什麼,把原本需要用戶自己記住的步驟放到使用現場。
用戶可以向 Claude 描述想要的改造,讓它生成 Mod,或安裝已有插件。官方文檔說明,界面擴展可用於終端版與 Claude Desktop 的 Code 標籤頁;各使用環境的支持範圍並不相同。Mod 運行代碼並擁有用戶權限,所以選擇插件時也要考慮其作者與來源。這裡報告的是已公佈的能力和示例,並非本報安裝後的效果評測。
原帖、前情與補充來源已複審
生物醫藥 10/01 01:27
蛋白質水印如何留下 AI 設計的痕跡
Demis Hassabis · @demishassabis
DeepMind 的 SynthID Bio 嘗試把來源標記寫進蛋白質序列或預測的三維結構。Hassabis 與 Pichai 介紹的進展,是一項保留生物功能的概念驗證,還不是識別所有 AI 生物設計的通用檢測器。
水印不只是附在文件旁的標籤。對序列,方法輕微引導氨基酸的選擇;對預測結構,則調整原子的三維座標,讓結果攜帶可檢測的信號。序列標記的目標是讓設計被合成為真實蛋白質後,仍保有可核驗的來源線索。
團隊用 AlphaProteo 與加入水印的 ProteinMPNN 設計能與特定目標結合的蛋白質。在 VEGF-A、SARS-CoV-2 刺突蛋白的受體結合域和 PD-L1 三個目標的實驗中,團隊報告帶水印與無水印設計的成功率、結合強度和序列多樣性相近。檢驗的是這些設計能否結合目標,並不等於證明所有功能都不受水印影響。
對結構預測,團隊微調了 AlphaFold 3 的部分擴散網絡,使輸出座標自帶信號;報告稱預測準確性得到保留,檢測可承受數字噪聲或小幅座標修改。抵抗有意篡改仍是後續難題。
這項工作的用途,是給合成審核和生物數據庫增加來源線索:陌生序列可能是自然發現,也可能由 AI 設計;誤標的合成結構又可能影響後續研究。水印幫助區分來源,卻不能獨自判斷設計是否危險。此次公佈的是研究方法與實驗結果,實際採用和更強的抗篡改能力仍待推進。
Google DeepMind 的播客進一步解釋了檢測邊界:文字水印依賴可選擇的詞語,極短且答案固定的句子可能無法標記;不同系統要檢測彼此的輸出,需要共享相應密鑰。生物設計的實際部署還需要模型提供者與合成機構協調。水印未檢出,不能反過來證明來源天然或內容安全。本報讀完了該期文字稿,未獨立審聽音頻。
原帖、前情與補充來源已複審
AI 與科技 10/02 10:36
工具能替你造,眼光仍要自己練
Thariq · @trq212
Thariq 的遊戲原型展示了一種具體合作方式:讓 Claude 找參考、教自己,再造一個可以反覆修改跳躍動作的編輯器。成果之後,他坦言自己已經到了判斷力的邊界。
前一天介紹這個個人項目時,他已提出自己的邊界:做遊戲本身令人滿足,不要把創作整個外包,要用 AI 一起實現自己的願景。到了動畫更新,他不是要求模型一次交出成品,而是讓它搭出能持續試驗的工具。
隨後接在同一串裡的回覆,讓這次展示比單純的成果視頻多了一層信息。他相信作品還有很多問題和改進空間,但自己的技能已不足以繼續判斷,需要培養更好的眼光。
這段實踐把兩種能力分開了:工具能幫助搭建編輯器、擴大試驗範圍,創作者仍要判斷怎樣的動作更好。當一次生成達不到預期時,先建立比較、修改和練習的環境,是他提供的一種工作方法;但擴大試驗能力並不自動產生質量標準。
原帖、前情與補充來源已複審
金融與商業 10/05 11:03
2025 年美國車齡 12.8 年:更耐用,還是換車更貴?
Charlie Bilello · @charliebilello
Charlie Bilello 重提美國汽車越來越老。追到統計來源,12.8 年是 2025 年乘用車與輕型卡車的合計均值:其中乘用車已達 14.5 年,輕型卡車為 11.9 年。
Bilello 給出兩種解釋:車更耐用,換車也更貴。兩者可以同時成立,卻不是同一種消費信號。一種是現有產品仍能滿足需要,另一種是更換成本讓人延後購買。
美國交通統計局列出的近年來源為 S&P Global Mobility;後者的 2025 年分析確認了 12.8 年及車型差異。因此,不能把合計均值直接當作每類車主都經歷了同樣的變化,也不能把這份舊年度數據寫成今年剛出現的新紀錄。
因此,這張圖首先說明車輛使用年限的變化。更耐用與更昂貴是 Bilello 提出的解釋,圖表本身沒有測量兩種因素各自的貢獻;從平均車齡也不能直接推出某家汽車或維修公司的盈利變化。
原帖、前情與補充來源已複審
政策與國際 10/03 05:39
最高法院的新任期,始於持續低迷的公眾評價
Ian Bremmer · @ianbremmer
Bremmer 提醒關注最高法院信任下滑。追查 Gallup 9 月調查,司法信任為 46%,最高法院工作認可度為 34%;兩項都處低位,但不能混作一個數字。
Gallup 於 9 月 1—17 日進行年度治理調查,9 月 30 日公佈結果,Bremmer 隨後轉述。46% 是對以最高法院為首的聯邦司法部門表示高度或相當信任的人數比例;34% 則是認可最高法院工作表現的比例。它們問的是不同問題。
工作認可度與七月的 33% 基本持平,61% 不認可。司法信任為連續第五年低於一半,略低於 2022—2025 年的 47%—49%。所以此次結果應理解為評價持續低迷,不能把 34% 寫成剛剛再次刷新的最低點。
政黨差異比總體均值更鮮明:民主黨人、獨立人士與共和黨人的司法信任分別為 23%、42% 和 79%;工作認可度分別為 12%、31% 和 65%。新任期面對的不是統一的負面評價,而是明顯分化的公眾。
Gallup 把長期變化與法院轉向保守派多數、此後推翻聯邦墮胎權保障的裁決聯繫起來。不過這項調查沒有把每項裁決的因果貢獻單獨量化,也不是發帖當天事件引發的即時反應。
原帖、前情與補充來源已複審
AI 與科技 10/05 13:06
歸藏展示 Muse 固件界面,聯網功能待演示
歸藏 · @op7418
10 月 3 日,歸藏介紹可連接 ESP32 設備的 Muse Gadgets SDK;兩天後,他稱已把固件刷入 M5 Stack 的 Stop Watch Meta,並曬出圓形屏幕照片。
SDK 是供開發者使用的軟件工具包;這裡的固件是寫入設備、讓設備運行的程序。歸藏說工具包已內置數種常見 ESP32 設備的固件,因此不必從零寫程序。他的前帖描述的目標,是讓小設備連接 Muse、獲取有關 Muse 的信息,再製作自己的周邊。
照片中,圓屏已經顯示像素角色和 SET UP WI-FI 提示。這能看到程序界面已運行,但照片沒有展示聯網後的信息更新,也沒有演示語音或雙向交互。對這一實踐,目前可確認的進展是刷機與界面展示;具體能做什麼、如何與 Muse 交互,仍需後續演示。
實踐進展;聯網後的功能尚待演示
文化與生活 10/02 21:30
唱片與巡演:音樂賬號這周有哪些新消息
The Beatles · @thebeatles
The Beatles 發佈 Rubber Soul 特別版;Red Hot Chili Peppers 公佈 Stadium Arcadium 二十週年限量黑膠。Muse 則預告 2027 年 1 月重返歐洲,並開放藝人預售登記。
The Beatles 在 10 月 2 日公告 Rubber Soul 特別版已發佈。Red Hot Chili Peppers 的消息針對 Stadium Arcadium 二十週年限量黑膠,購買入口為樂隊官網。
Muse 預告 2027 年 1 月重返歐洲,並提供藝人預售登記入口。登記屬於購票前的步驟,不能當作已經購得門票;具體場次與售票信息需以樂隊公告為準。
原帖、前情與補充來源已複審
AI 與科技 10/02 08:30
把計算搬到太空,Pichai 報告原型衛星發射
Sundar Pichai · @sundarpichai
Pichai 回憶團隊最初提出太空計算的設想,並在 10 月 2 日報告與 Planet 合作的原型衛星已成功發射。
他在發言中向 SpaceX 致謝,強調項目既展示了已有進展,也仍有很長的路要走。
這條消息確認的是他報告的原型階段進展,尚未提供衛星算力、運行成本或面向用戶的服務時間。
公告與作者發言摘讀
AI 與科技 10/05 00:59
閒置十五年的 PSP,成為 Muse 的語音入口
Alexandr Wang · @alexandr_wang
Wang 轉發 Robert Soriano 的實踐:把 Muse 小工具客戶端移植到 C 語言,讓一臺閒置超過十五年的 PSP 成為語音入口。
Soriano 說,按住 R 鍵對內置麥克風講話,Muse 會回答,聲音由 OpenAI 提供;移植過程中使用了自己的代理。
公告與作者發言摘讀
AI 與科技 10/02 04:06
Thariq 向公司領導者徵集 AI 編碼問題
Thariq · @trq212
平時面向開發者寫作的 Thariq,準備把下一篇文章寫給正在應對 AI 編碼代理變化的公司領導者。
他向讀者徵集兩個方向的問題:希望領導層理解代理的哪些事情;經營公司時遇到了什麼困難。
公告與作者發言摘讀
AI 與科技 10/01 04:17
Claude.dev 集中工程文章與開發指南
Claude Developers · @ClaudeDevs
ClaudeDevs 在 10 月 1 日介紹 Claude.dev,作為面向使用 Claude 構建產品的開發者的新入口。
公告列出的內容包括工程深度解析、Claude Code 與 API 指南,以及構建 Claude 的團隊提供的提示。
公告與作者發言摘讀
AI 與科技 10/05 13:13
歸藏做了摺疊屏屏保,是否開源還在徵詢
歸藏 · @op7418
歸藏說自己做了一個安卓摺疊屏屏保應用,模仿 iPhone Duo 半折狀態下的屏保。
因為認為使用者可能不多,他暫時沒有發佈,並表示如果有人需要,可以開源。
公告與作者發言摘讀
AI 與科技 10/04 12:30
Tibo 把收件箱清零交給 dot,報告首次完成
Tibo · @thsottiaux
Tibo 在 10 月 4 日報告,給 dot 設定主動幫助清理郵件的目標後,自己第一次實現了收件箱清零。
他引用兩天前的記錄:未讀郵件從超過 9,000 封降到 6,110 封,並提出在隨後 48 小時內通過過濾清理到零。他同時表示,還要看看清零狀態能持續多久。
公告與作者發言摘讀
AI 與科技 10/03 22:18
Altman 對把判斷力交給 AI 表示不安
Sam Altman · @sama
Sam Altman 在 10 月 3 日表示,對人們把宗教力量賦予 AI 模型,或放棄人類自身判斷力的傾向感到非常不安。
公告與作者發言摘讀
AI 與科技 10/03 06:19
Altman 回應 Cerebras 合作猜測
Sam Altman · @sama
針對外界對 OpenAI 與 Cerebras 合作的猜測,Altman 在 10 月 3 日稱 Cerebras 是密切合作夥伴,雙方在速度前沿有深入合作。
這條回應沒有公佈合同規模、算力採購數量、合作期限或具體上線產品。
公告與作者發言摘讀
AI 與科技 10/01 03:04
OpenAI 與 ASBDC 合作,為小企業提供 AI 指導
OpenAI · @OpenAI
OpenAI 在 10 月 1 日介紹一份小企業使用 AI 代理的報告,並宣佈與 ASBDC 合作提供實操培訓和本地指導。
公告把尋找客戶、構建產品和管理財務列為小團隊使用 AI 的任務方向。
公告與作者發言摘讀
政策與國際 10/04 23:00
Cato 文章獎公佈五萬美元獎金與徵稿時間
Cato Institute · @CatoInstitute
Cato Institute 宣佈,自由願景獎將為最佳自由意志主義文章提供 50,000 美元獎金,投稿於 2027 年 3 月 1 日開放。
公告稱歡迎任何人申請,當前提供的是登記接收更新的入口。
登記提醒和正式投稿是兩個步驟;具體篇幅、評審與提交要求仍需以完整徵稿規則為準。
公告與作者發言摘讀
政策與國際 10/02 00:31
Obama 轉發律師投票權志願招募
Barack Obama · @BarackObama
Obama 在 10 月 2 日為 We The Action 的招募發聲,呼籲律師志願投入時間維護投票權。
他把律師稱為保護民主制度鬥爭的前線力量,並附上 wetheaction.us/guide 指南入口。
公告與作者發言摘讀
文化與生活 10/03 06:34
OneRepublic 預告十二月 Jingle Ball 演出
OneRepublic · @OneRepublic
OneRepublic 在 10 月 3 日預告參加今年十二月的 iHeart Jingle Ball,並稱門票已開售。
公告沒有在這條短帖中列出具體城市、日期與票價。
公告與作者發言摘讀
金融與商業 10/02 23:37
指數在高位,倉位為何仍被判斷為中性?
Liz Ann Sonders · @LizAnnSonders
Liz Ann Sonders 的最新播客討論上漲背後的分化:Vanda 的 Eric Liu 轉為看多美股,但他看的是倉位,並非所有股票都已轉強。
Liu 稱,Vanda 自 2010 年起追蹤的美股倉位接近歷史均值,債券多頭也已大幅退出;他因此傾向大型科技股。倉位描述資金已有的市場敞口,與指數價格是兩回事。這是他的模型判斷,節目沒有披露可供復算的完整數據。他還把近期衝突中的反應不對稱作為看多理由:利率回落時的股市反彈較強。但少量歷史情形不能當作未來漲幅規律。
另一把尺子是市場廣度:有多少股票參與上漲,常用上漲與下跌家數、站上均線的比例衡量。少數權重股就能拉高指數;若多數股票落後,上漲便更依賴領漲者。
廣度窄不直接推翻倉位偏中性的判斷,二者回答的問題不同。讀這次轉向,既要看資金是否擁擠,也要看上漲是否擴散;單憑指數高點,無法回答這兩個問題。
播客相關段落與指標定義已複核;倉位模型未獨立驗證
生物醫藥 10/05 01:18
手錶的恢復分數,離健康結論還有多遠
Eric Topol · @EricTopol
Eric Topol 再次分享 9 月的長文,質疑可穿戴設備的 HRV 與恢復分數:測到信號、解釋身體狀況、證明改善健康,是三個不同環節。
HRV 是相鄰心跳間隔的變化。傳統研究用心電圖記錄電信號;多數消費設備用光學傳感器記錄脈搏,再推算變異性。Topol 指出,低 HRV 與疾病風險的關聯,不等於把讀數提高就能改善健康;恢復分數與健康結局的聯繫仍缺少驗證。
他引用的一項 2025 年研究,在單一醫療機構對 931 人靜坐測量 5—7 分鐘。同一上臂設備的光學 RMSSD 均值為 37.49 毫秒,心電值為 43.14 毫秒;RMSSD 表示相鄰正常心跳間隔差異的大小。兩種方法的讀數不能直接視為相同。
這項研究沒有測試 Apple Watch,也沒有追蹤使用分數後是否更健康;四名作者受僱於設備商 Tiger Tech。它提示測量方法存在差異,不能據此判定每款手錶的誤差。
Topol 的批評針對把指標包裝成健康結論,不是否定所有可穿戴功能。不同品牌的恢復分數不能直接比較;看到一個低分,也不能僅憑它判斷身體變差。
長文及所引研究的方法、表格、限制和利益關係已複核
政策與國際 10/04 15:14
租戶獲返家協議,西班牙住房抗議為何仍繼續
BBC News 中文 · @bbcchinese
一位 87 歲租戶被驅逐後,已達成低租金返家的協議;但面向更多租戶的住房法令遭否決,個案轉機沒有終結抗議。
瑪麗卡門·阿巴斯卡爾在馬德里居住數十年,因無法承擔漲租被驅逐,隨後住院。她的律師 9 月 29 日告訴美聯社,返家協議把租金限制在收入的 30%,不超過原來的每月 500 歐元。這是達成協議,不能寫成已確認搬回家。
BBC 10 月 4 日報道,政府提出的兩項住房法令於此前星期五遭議會否決。措施包括把弱勢租戶的驅逐暫停期延至 2030 年,以及租約延長、自動續簽等安排;這些提案不能當作已經實施的保護。
第二天,約 50 場遊行在馬德里等城市舉行。BBC 轉述西班牙銀行估計,住房需求與新建供給之間缺口約 70 萬套。返家協議處理了一個人的處境,抗議爭取的租賃保障與住房供給問題仍未解決。
BBC 全文與美聯社律師採訪已核對;未確認實際返家
金融與商業 10/04 21:28
牛的項圈,把圍欄變成軟件
Gorden Sun · @Gorden_Sun
Gorden Sun 用“牛工智能”介紹新西蘭公司 Halter:給牛戴上智能項圈,在手機上劃定放牧邊界。原始公告還補上了時間和連接方式:2.2 億美元融資在三月完成,四月已宣佈衛星直連方案。
這套系統把兩件事合在一起:GPS 定位告訴牧場主牛在哪裡,聲音和輕微振動則引導牛留在虛擬邊界內、移動到下一塊草場。太陽能項圈配合手機上的牧場地圖,讓輪換放牧不用每次重拉鐵絲網。公司的後續產品還包括行為監測、發情識別和草量信息。
Gorden 描述的是依靠牧場信號塔的連接方式。Halter 4 月 28 日公告稱,新項圈可直接連衛星,取消牧場內的通信塔;當時公佈面向美國和新西蘭肉牛業務,澳大利亞、加拿大隨後推出。這裡確認的是產品公告,不能據此認定每個牧場已換用衛星版。
3 月 25 日的 E 輪由 Founders Fund 領投,融資 2.2 億美元、估值 20 億美元。Halter 當時自報服務超過兩千家農牧場,已售出一百萬個項圈;“售出”不等於一百萬頭牛同時在線。資金計劃投向現場服務、健康監測和國際擴張。
這是一條十月重新引起討論的農業數字化案例,並非本週新融資。軟件能否替代多少人工和圍欄,還取決於牧場地形、部署及牛群訓練;融資金額和公司案例沒有給出可通用的成本回收期。
原帖與補充依據已讀
AI 與科技 10/02 22:51
同一模型,換個框架就從 62% 變成 33%
Hugging Face · @huggingface
Hugging Face 發佈多框架強化學習實驗:同一組 LFM2.5-2.6B 權重,在 Mini-SWE-Agent 的成功率為 62.1%,在 Claude Code 為 33.2%。這衡量的是 250 道留出的數據分析任務,不是通用編程榜單。
模型之外,框架決定上下文如何組織、工具如何呈現、失敗如何重試以及何時停止。因此,把模型權重保持不變,也沒有把整個代理系統保持不變。研究用捕獲代理記錄準確的生成 token 與概率,再通過 OpenEnv、Harbor 和 TRL 接上環境、任務與訓練。
在 OpenCode、Claude Code、Codex、Mini-SWE-Agent 四種框架混合訓練後,平均成功率從基礎模型的 42.2% 升至 54.2%。只在 OpenCode 訓練的版本平均為 52.3%,而在 OpenCode 自身達到 58%;多框架版本在 Claude Code 和 Codex 上更好。平均差距僅 1.9 個百分點,作者明確說在噪聲範圍內。
“少用 31.1% 工具調用”的分母,是基礎版和訓練版都做對的任務,不是全部任務或全部費用。兩個訓練各只有一個隨機種子,混合版還看了更多不同任務、處理更多 token;缺少去掉效率獎勵的對照,不能把改善全歸因於某一獎勵設計。
實驗的實用啟示是:評測要連同實際框架一起做,單一環境的高分未必能遷移。代碼和模型已開放,但這組結果還不足以證明混合訓練在任何任務、每個框架或同等算力下都佔優。
原帖與補充依據已讀
AI 與科技 10/02 02:57
AI 算對了,問題就值得研究嗎?
Anthropic · @AnthropicAI
Anthropic 刊出哈佛物理學家 Matthew Schwartz 的客座文章:他用自己的 BootLoops 項目,在三個月內與 19 位合作者做出涉及 18 個領域的 36 份研究手稿。手稿數量不是同行評審通過的論文數量。
他的做法是尋找適合 Claude 的問題:讓模型編程、計算、遷移跨領域的方法,研究者負責提問和判斷。項目從約四百個候選方向篩選,使用並行會話、持續更新的計劃,以及互相挑錯的審稿代理。Schwartz 同時是 Anthropic 的訪問研究員,文章是參與者自述。
生態學案例解釋了判斷為什麼不能省。模型發現巴拿馬一處森林的物種組成變化比中性理論預測快約 4.5 倍;生態學家 James O’Dwyer 指出,定性現象早已知道,單是發現偏差還不夠。研究隨後轉向扣除隨機預測,解釋餘下變化的生物機制,並把人口統計模型擴展到更多樣地。
遺傳學項目也經歷類似轉折:一個罕見變異積分雖算得有趣,卻未回答足夠重要的生物問題。Schwartz 還記錄了模型過早宣佈完成、把未證明引理當公理等失敗。專家反饋、圖表檢查和重新選題,比讓代理無限重試更關鍵。
這份經驗說明 AI 可以擴大計算和試錯的範圍,科學價值仍需要領域專家審查。本報讀過客座全文,未逐項復現這 36 份手稿;文章也沒有給出統一的算力成本或獨立驗證的科研產出回報率。
原帖與補充依據已讀
AI 與科技 10/02 08:37
當 AI 做得更多,人怎麼更快看懂?
Andrej Karpathy · @karpathy
Karpathy 認為,模型越能獨立完成工作,人越要花時間監督和理解結果。他最近嘗試把輸出改成受控語言、示意圖、交互網頁和定製講解視頻,減少閱讀一大段文字的負擔。
文字方面,他要求模型參考 ASD-STE100——原為航空航天維修手冊制定的簡化技術英語規範;自己常要求約八成嚴格度。目的在於減少歧義和冗長表達,這只是個人提示方式,並非對模型準確率的實驗結果。
對空間關係和結構,他用圖像解釋;需要逐步觀察變化時,讓模型製作 HTML 交互頁面;複雜主題則嘗試類似 3Blue1Brown 的講解視頻與配音。這幾種形式分別調動視覺、操作和聽覺,不必每個問題都做成同一種輸出。
過去,為一個問題編寫專用軟件成本太高;如果模型能快速生成,它就可以只服務這一場解釋。Karpathy 描述的是自己如何理解模型產物,尚未提供學習效果對照。形式更容易讀,也仍需檢查圖、網頁和視頻中的事實是否正確。
原帖全文已讀
金融與商業 10/02 20:34
九月就業增 2.9 萬,修訂還改了什麼?
外匯交易員 · @fxtrader
FXTrader 關注美國九月就業數據:非農崗位增加 2.9 萬,失業率從 4.1% 升至 4.2%。BLS 10 月 2 日發佈的原始統計,還把七、八月合計新增崗位下修六萬,單看當月數字會漏掉這次變化。
七月從增加 2.1 萬修訂為減少一萬,八月從增加 16.2 萬修訂為增加 13.3 萬。修訂來自更多企業報告和季節因素重算;九月數字也是初值。BLS 稱此前十二個月平均每月新增 4.5 萬,九月各主要行業變化不大。
失業率來自住戶調查,非農崗位來自機構調查,統計對象不同。九月住戶調查顯示勞動力增加 48.5 萬、就業人口增加 40.6 萬、失業人口增加 7.8 萬,參與率由 61.6% 到 61.8%。更多人進入勞動力市場時,失業率也可能上升,不能直接把兩個調查相減解釋為崗位流失。
私營部門平均時薪當月漲 0.1%、同比漲 3.0%。這份報告呈現新增崗位偏少、舊值下修與勞動力進入並存;BLS 也指出失業率自三月一直在 4.1%—4.3% 的窄幅區間。數據值得追蹤,尚不能由一個月直接判定衰退或下一次利率決定。
原帖與補充依據已讀
金融與商業 10/02 23:23
船更多,實際運力為什麼反而變少?
American Enterprise Institute · @AEI
AEI 推介的工作論文《Shipping to America》,用船舶軌跡重新衡量運力:近年來部分中斷中的利用率損失達到 20—40 個百分點,而且在港口擁堵顯眼之前就已出現。這裡的利用率不是船上集裝箱裝滿多少。
五位作者將 2016 年 1 月至 2025 年 3 月的 AIS 定位、速度記錄與船舶資料配對,記錄 58,582 次赴美航程;六條主要路線覆蓋約八至九成美國海運集裝箱進口。他們先計算部署船隊的潛在噸海里,再扣去港口等待、運河排隊、繞航和減速消耗的運力,得到有效運力及其比例。
疫情期間,更多船被調往美國:到 2022 年初,潛在運力較疫情前高逾六成,但總體利用率從約 89% 跌到不足 70%。船在等待或繞路,船隊規模不能直接代表到貨能力;改走另一港口,還可能把擁堵傳到另一條航線。
論文用這組度量建立共享船隊、擁堵和進口商調整採購的經濟模型。反事實估算認為,2021 年西海岸危機和紅海襲擊的福利損失,分別相當於產出的 0.69% 和 0.35%。這是消費者收入等價的模型結果,不是統計機構測到的 GDP 降幅。
作者還討論關稅減少需求、緩解擁堵的條件效應,不能推廣成“關稅總有利”。軌跡也看不到實際貨物起訖點,需結合提單進一步驗證。本報核對了方法、相關圖表和政策章節,未復算模型或逐項審完數學附錄。
原帖與補充依據已讀
AI 與科技 10/02 02:08
Claude“五折用量”,哪些額度沒打折?
Claude · @claudeai
Claude 公告稱,創建或修改 artifact 後的一部分工作消耗減半。條款限定 Pro、Max、Team,活動至 10 月 15 日 23:59(太平洋時間),Free 與 Enterprise 不含在內。
普通聊天創建或編輯後,接下來的十條消息在五小時額度中減計 50%,每次回覆只含前十五個工作步驟;從 Output 菜單選擇文檔、演示或設計新建聊天,首條即可適用。周額度不變,額外用量付費仍按原價,Claude Code、API 和本地 Cowork 不適用。雲端 Cowork 另按約前 45 分鐘或創建後 80 步計算。
原帖與補充依據已讀
金融與商業 10/03 02:07
ChatGPT 財務功能向美國 Free、Go 開放
ChatGPT · @ChatGPT
ChatGPT 宣佈向美國 Free 和 Go 用戶推出財務功能,通過 Plaid 和 Experian 連接賬戶,基於個人交易與信用信息回答問題。續帖列出的用途包括找遺忘訂閱和疑似重複收費、檢查上漲的賬單、做預算及債務償還方案。
它還可按周更新、查看組合集中度。公告描述的是接入後分析賬戶的能力,不是代用戶完成交易;本輪未連接賬戶驗證,也不能把“美國推出”理解為所有地區、所有計劃同時可用。
原帖與補充依據已讀
金融與商業 10/03 08:28
Unusual Whales 把市場數據入口放進 ChatGPT
Unusual Whales · @unusual_whales
Unusual Whales 10 月 3 日宣佈推出 ChatGPT 插件,讓其市場交易數據和分析在聊天中使用,並給出了插件入口。這改變的是訪問數據的工作入口。公告沒有逐項說明數據覆蓋、更新時延、所需訂閱或授權範圍;本報未安裝測試,不能據此說所有數據免費或實時可用。
原帖全文已讀
政策與國際 10/04 03:00
關稅調查:48% 認為製造業受損,36% 認為受益
Cato Institute · @CatoInstitute
Cato 10 月 4 日轉述其貿易調查:被歸為“工人階層”的受訪者中,48% 認為關稅傷害美國製造業,36% 認為有幫助,16% 認為沒影響。原文以未大學畢業的註冊選民代表這一組,並非按職業或收入劃定所有工人。
9 月 24 日文章引用 Cato/Morning Consult 三月 2,002 人和八月 4,150 人的總樣本;這兩個數字不是該分組人數。它衡量政策觀感,不是測定製造業實際損益;分組誤差及完整問卷本輪未核對,不據此推算選舉結果。
原帖與補充依據已讀
文化與生活 10/05 12:12
愛知—名古屋亞運會閉幕,中國獲 169 金
CCTV · @CCTV
CCTV 10 月 5 日報道,愛知—名古屋亞運會於前一天週日閉幕。中國獲得 169 金、89 銀、83 銅,共 341 枚獎牌,連續第十二屆居金牌榜首。CCTV 稱這是中國在海外亞運會的最佳表現;本訊依據其完整閉幕短帖,未逐項核對官方比賽成績,不展開單項賽事評價。
原帖全文已讀
AI 與科技 10/01 23:37
Hugging Face 聊天入口重新接入 MCP
Hugging Face · @huggingface
Hugging Face 宣佈可通過 MCP 把自己的數據接入其 ML Intern 聊天入口。MCP 是讓 AI 應用連接外部工具與數據的接口協議;價值在於回答可用到用戶提供的數據。公告未交代所有連接器、權限和價格,演示未實測,本訊只確認接入功能已被官方宣佈。
原帖全文已讀
AI 與科技 10/01 04:02
Argon 把輸出拉長,先交給網絡防禦者試用
Sundar Pichai · @sundarpichai
Pichai、Hassabis 與 DeepMind 公佈 Gemini 4 Argon,面向編程、企業知識工作和網絡防禦。首批開放的是 Fairwind 計劃中的受信任測試者,普通用戶還要等待。
最醒目的變化是輸出上限從 6.4 萬提高到 100 萬 token。輸出包括模型一次任務中的長篇生成,不能誤讀成新的輸入上下文容量。DeepMind 希望它能持續完成多步驟工作,早期反饋則用來改進防護。
Google 舉了兩個內部應用:代理檢查機群性能數據後,已釋放超過 300 TiB 內存;C/C++ 向 Rust 的遷移涉及從核心庫到 Fuchsia 內核的代碼。公司同時說明,大規模改寫仍需自動測試、人工審計和上線前審查。模型會寫更多,不等於省掉驗收。
公告報告 DeepSWE v1.1 得分 77.9%,該測試面向長程軟件工程任務。這是 Google 公佈的評估結果,本報沒有復現;它也不等於任意項目都能達到同樣成功率。
發佈採用分階段方式:網絡防禦者先測試,美國政府獲得發佈前訪問,之後再向付費 API 用戶與 Google AI Ultra 用戶開放。公告所列 API 首發價為每百萬輸入/輸出 token 2/10 美元,首發期後為 4/20 美元,緩存輸入優惠 95%;這仍是公佈的定價和開放計劃。
本批原帖與所用外鏈已審讀
金融與商業 10/01 14:04
財政要加快花錢,洪灝為何繼續等待新政策
Hao Hong · @HAOHONG_CFA
洪灝轉述財政部長藍佛安 10 月 1 日的文章,並預期長假後還有政策。財政部原文同時談存量落實和研究增量,兩者的執行進度不能混為一談。
文章要求督促支出偏慢地區打通堵點,統籌超長期特別國債與地方專項債資金,並擴大貼息範圍、增加經辦機構、適當提高額度。這裡關注的不只是安排了多少預算,還包括資金何時實際落地。
其中 3000 億元特別國債用於有關中央金融企業補充核心一級資本,即增強銀行等機構承受風險和服務實體經濟的資本基礎。它不是直接發給居民的消費補貼,也不能和投資支出當作同一種資金流。
使用地方政府債務結存限額的安排,原文表述為“研究出臺”。結存限額是既有債務上限中尚可使用的空間;文章沒有給出該項最終額度、落地日期或具體分配。不能把方向性表述寫成全部資金已撥付。
洪灝說上半年預算支出偏慢,並期待節後加碼;這屬於他的判斷。財政部文章列出的是政策任務,本身並未承諾節後的市場表現。後續要看的,是正式文件、實際發行與支出進度。
本批原帖與所用外鏈已審讀
金融與商業 10/01 03:38
無人卡車提醒:技術能做,不等於崗位立刻消失
American Enterprise Institute · @AEI
AEI 轉發 James Pethokoukis 的文章,借無人卡車討論 AI 替代工作的時間尺度。他的重點是商業擴張中的摩擦,而不是否認自動化會發生。
作者回看十多年前關於卡車司機即將被替代的討論,再對照 Aurora 9 月公佈的計劃:2026 年底運營 200 輛無人卡車,2030 年超過 3 萬輛。這些是公司目標,不能寫成現有車隊規模。
Pethokoukis 援引分析報告稱,即使達到後一個目標,里程仍只約佔 Aurora 所界定長途運輸市場的 1.9%;本報未取得該銀行報告全文,這個比例保留為作者轉述。
他的論證是,製造產能、保險、維護、車輛利用率和接入現有承運網絡,會共同決定商業部署速度。Aurora 公告也把擴產、交付和客戶協議列為未來目標及風險。
因此,預測就業變化需要交代採用速度和成本,不能從演示能力直接跳到失業人數。這是卡車案例帶來的提醒;軟件工作可能擴散更快,文章並未測算所有行業的崗位影響。
本批原帖與所用外鏈已審讀
生物醫藥 10/01 01:17
Petrelintide 的 9.8%:別把第 28 周和第 42 周混看
FierceBiotech · @FierceBiotech
FierceBiotech 報道 Roche 與 Zealand 合作的胰澱素類似物 petrelintide 二期數據。中間劑量的第 28 周減重最突出,不能直接拿來和此前第 42 週數字比高低。
報道據新發表論文給出第 28 周結果:5 mg 組平均減重 9.8%,安慰劑為 1.7%,兩者相差 8.1 個百分點;7 mg、9 mg 組分別為 9.3%、9.4%。這個數據沒有顯示劑量越高減重越多。
Zealand 的公告確認 ZUPREME-1 是隨機、雙盲、安慰劑對照的劑量探索試驗,配合飲食與活動幹預。主要終點設在第 28 周;公司強調的最高 10.7% 是第 42 周、持續治療假設下的結果。納入停藥等情況的另一統計口徑為最高 10.2%,安慰劑 1.4%。
FierceBiotech 報道,藥物組噁心發生率為 20%,安慰劑 6%;公司稱在最大有效劑量下未出現嘔吐或因胃腸不良事件停藥。劑量子組的描述與藥物組整體的描述不是一個分母。
項目已啟動三期,仍屬研究藥物。公司公告和報道提供了試驗框架與數字,本報未取得論文全文;二期結果也不足以確定長期效果,或憑跨試驗比較給不同藥物排療效名次。
本批原帖與所用外鏈已審讀
生物醫藥 10/01 01:18
Retatrutide 詳細數據:20.8% 的人群與代價
FierceBiotech · @FierceBiotech
Lilly 公佈 TRIUMPH-2 詳細三期結果,FierceBiotech 跟進報道。試驗針對合併二型糖尿病的肥胖或超重成年人;12 mg 組第 80 周平均減重 20.8%,安慰劑 4.0%。
1152 名受試者被隨機分到 4 mg、9 mg、12 mg 和安慰劑四組。研究藥物每週注射一次,同時作用於 GIP、GLP-1 和胰高血糖素三類受體。20.8% 採用的是假設持續接受幹預、未啟動禁用減重治療的統計口徑,不能當作所有真實用藥者都會達到的幅度。
12 mg 組有 34.9% 減重至少 25%,安慰劑為 0.8%;平均糖化血紅蛋白從基線 7.7% 下降 1.5 個百分點,安慰劑下降 0.2 個百分點。減重與血糖控制是兩個結果,不能把其中一個代替另一個。
同一高劑量組腹瀉、噁心、嘔吐發生率分別為 33.6%、28.0%、15.7%;因不良事件停藥為 7.7%,安慰劑 4.9%。Lilly 稱多數事件輕至中度,仍需要和效果一起看。
公司計劃 2027 年第一季度向美國 FDA 申報,尚未獲批。詳細結果也已發表,但本報只完成公司公告與報道補讀,未取得論文全文;不同人群、時長和統計口徑的減重數字不構成頭對頭比較。
本批原帖與所用外鏈已審讀
生物醫藥 10/01 21:34
Genentech 的 AI 改造,連實驗臺方向都要重新想
FierceBiotech · @FierceBiotech
FierceBiotech 採訪 Genentech CEO Ashley Magargee:AI 與實驗室自動化正在影響研究工具和園區規劃,但她對人才流失的回答仍是科學能力不會被取代。
具體例子是和 Anthropic 測試代理操作 BCA 蛋白定量實驗。Magargee 說,橫向實驗臺原本服務於人的操作動線;自動化後,實驗室有多少空間應改成縱向佈局,成為團隊正在研究的問題。訪談沒有提供自動化提速或新藥成功率數據。
報道同時交代 gRED 研發部門重組與多位資深科學家離職。CEO 把變化解釋為工具進步;這是一方回應,不能據此認定人員調整對研發沒有影響。
園區第一階段擬於 2027—2033 年建設集中研發中心。它納入 Roche 此前宣佈的 500 億美元美國投資,Magargee 承認其中包括原已計劃的投入,也有新投資。因此,大額承諾不能全部算作剛新增的支出,更不是已經完成的建設。
本批原帖與所用外鏈已審讀