簡短版本
2026 年版重點摘要
每個要點都連結到其標準數據列。報告的數字屬於其引用的生產者;模型結果標示為計算。
- 寫作實驗:使用 AI 協助可縮短任務時間:40%(2023 年實驗;2023 年 7 月發表)。MIT / Noy 和 Zhang
- 寫作實驗:評估的輸出品質更高:18%(2023 年實驗;2023 年 7 月發表)。MIT / Noy 和 Zhang
- 諮詢實驗:已完成的子任務增加 12.2%(研究於 2023 年首次發布;2026 年 4 月發布研究摘要)。哈佛商學院 AI 研究院 / Dell’Acqua 及同事
- 諮詢實驗:在創新練習中品質約高 32%(研究於 2023 年首次發布;2026 年 4 月發布研究摘要)。哈佛商學院 AI 研究院 / Dell’Acqua 及同事
- 策略任務:未使用 AI 時的正確答案:84.5%(研究首次發布於 2023 年;2026 年 4 月發布研究摘要)。哈佛商學院 AI 研究院 / Dell’Acqua 及同事
- 策略任務:使用 GPT-4 存取時的正確答案:70.6%(研究首次發布於 2023 年;2026 年 4 月發布研究摘要)。哈佛商學院 AI 研究院 / Dell’Acqua 及同事
- 策略任務:使用 GPT-4 和提示概覽時的正確答案:60%(研究首次發布於 2023 年;2026 年 4 月發布研究摘要)。哈佛商學院 AI 研究院 / Dell’Acqua 及同事
- Copilot 實驗:單一編碼任務的完成時間減少 55.8%(2022 年 5 月 15 日至 6 月 20 日)。Peng、Kalliamvakou、Cihon 和 Demirer
- METR 2025 年初實驗:允許使用 AI 時完成時間較長:19%(2025 年 2 月至 6 月)。METR
- METR 參與者:實驗後感知 AI 加速:20%(2025 年 2 月至 6 月)。METR
AI 是否有助於簡短的專業寫作任務?
寫作實驗發現,在有協助的情況下,花費的時間更少,評估的品質也更高。其任務不需要許多真實客戶文件所需的完整事實準確性或組織背景。
| 結果與控制組比較 | 回報的變更 |
|---|---|
| 任務時間的減少 | 40%隨機實驗 |
| 已評估品質的提升 | 18%隨機實驗 |
品質分數的提升和時間的縮短是不同的結果,不得相加。
AI 能否改善一項諮詢任務並損害另一項?
是的。該研究區分了模型可以處理的任務與其不可靠的策略問題。第一組的生產力並不代表第二組的準確性。
| 結果與條件 | 回報的百分比 |
|---|---|
| 在創新練習中完成的子任務更多 | 12.2%隨機實驗 |
| 在創新練習中品質較高,約 | 32%隨機實驗 |
| 正確策略答案:無 AI | 84.5%隨機實驗 |
| 正確策略答案:GPT-4 存取權 | 70.6%隨機實驗 |
| 正確策略答案:GPT-4 加提示概述 | 60%隨機實驗 |
品質估計是近似值。這是過去的 GPT-4 證據,並非當前模型的基準。
為什麼編碼研究報告了不同的生產力影響?
獨立的編碼任務和成熟儲存庫中的維護是不同的任務。研究還使用了不同的模型版本和招募方法。它們的結果應保持獨立,而不是平均。
| 研究與結果 | 回報的變更 |
|---|---|
| Copilot 指派:完成時間減少 | 55.8%隨機實驗 |
| METR:實際完成時間的增加 | 19%隨機實驗 |
| METR:工作前的預期加速 | 24%參與者感知 |
| METR:工作後的感知加速 | 20%參與者感知 |
METR 後續的後續報告指出嚴重的選擇和時間測量問題。其作者不將後續報告視為當前影響的可靠估計;歷史上的減速並非針對 2026 年所有開發者的說法。
主要來源: Peng、Kalliamvakou、Cihon 和 Demirer — 2023 年 2 月 13 日 · METR — 2025 年 7 月 10 日 · METR — 2026 年 2 月 24 日
每次測量的時間變化在相同的基準上意味著什麼?
基準指數使算術更容易閱讀,無需匯總研究。每個控制條件都分配相同的起始指數;結果的輔助指數仍然僅指其自身的實驗。
| 實驗 | 輔助時間指數;對照組 = 100 |
|---|---|
| 寫作實驗 | 60標準化計算 |
| Copilot 指派 | 44.2標準化計算 |
| METR 儲存庫任務 | 119標準化計算 |
Workspace369 正常化,不是新的觀察結果。較低意味著時間較少。時間的減少不等於產量的相同百分比增加,並且聲稱沒有產量估計。
主要來源: MIT / Noy 和 Zhang — 2023 年 7 月 14 日 · Peng、Kalliamvakou、Cihon 和 Demirer — 2023 年 2 月 13 日 · METR — 2025 年 7 月 10 日
團隊應如何測試 AI 的時間節省效益?
在比較輔助和非輔助工作之前,定義一個可重複的任務和一個驗收標準。包括提示準備、事實檢查、審查和返工。在比較中保持客戶數據存取權和人工批准要求不變。
同時追蹤時間和品質。請勿將寫作任務的百分比應用於整個薪資,或假設自動代理會產生相同的結果。
本報告的建置方式
方法與限制
- 這是一個選定的證據比較,而不是系統性回顧或統合分析。研究的納入是基於可識別的任務、原始生產者證據和明確定義的結果。
- 寫作和諮詢的數據使用了他們的研究機構對已發表研究的公開摘要。編碼論文和 METR 報告提供了原始實驗細節。工作論文和已發表版本不混合。
- 測量結果和感知速度提升有獨立的證據標籤。時間指數計算僅使用測量的完成時間變更;調查中的信念不包含在內。
- 模型版本和研究日期仍附加於研究結果。我們檢查了 METR 的後續報告,並保留了其關於較新估計值可靠性的警告。
這些數字無法告訴您什麼
- 選取的實驗無法確立普遍的 AI 投資回報率。不同的任務、控制條件、參與者和品質測試阻止了可辯護的總體百分比。
- 樣本量描述了研究範圍,而不是獨立的重複實驗。供應商在 Copilot 研究中的參與對解釋很重要。
- 歷史結果並不能確立當前模型的效能。標準化不包括實施成本,也不證明持續的年度節省。
時效性和更正
由 Workspace369 編輯團隊維護。每季審閱一次,以及當引用的生產者發布替換研究時。下次編輯審閱:2026 年 12 月。保留歷史模型版本和觀察日期。僅當證據或內容經過實質性審閱時,版本日期才會更改;它不會更改基礎觀察期。
第一版: 已檢查此版本的數據提取、來源歸屬和計算。不聲稱獨立的同行評審。
發現錯誤或更新的主要版本? 發送更正,包含來源和受影響的統計數據已確認的更正應在重新發佈前記錄在修訂歷史記錄中。
主要來源和出處
每個報告的數字單元格都直接連結到其生產者。下載內容包含確切的表格或工作簿位置、觀察期、存取日期、公式和輸入參考。
- MIT / Noy 和 ZhangMIT 研究公告,關於已發表的 Science 寫作實驗 ↗發布於 2023 年 7 月 14 日。存取於 2026 年 9 月 12 日。選取的實際觀察結果已附有歸屬並進行了意譯。未重新分發任何來源報告、圖表、參與者數據或專有資料庫;來源權利仍歸其生產者所有。
- 哈佛商學院 AI 研究院 / Dell’Acqua 及同事回到工作中的 AI 起源:已發布的諮詢實驗的機構審查 ↗發布於 2026 年 4 月 9 日。存取於 2026 年 9 月 12 日。選取的實際觀察結果已附有歸屬並進行了意譯。未重新分發任何來源報告、圖表、參與者數據或專有資料庫;來源權利仍歸其生產者所有。
- Peng、Kalliamvakou、Cihon 和 DemirerAI 對開發者生產力的影響:來自 GitHub Copilot 的證據,arXiv v1 ↗發布於 2023 年 2 月 13 日。存取於 2026 年 9 月 12 日。選取的實際觀察結果已附有歸屬並進行了意譯。未重新分發任何來源報告、圖表、參與者數據或專有資料庫;來源權利仍歸其生產者所有。
- METR衡量 2025 年初 AI 對經驗豐富的開源開發者生產力的影響 ↗發布於 2025 年 7 月 10 日。存取於 2026 年 9 月 12 日。選取的實際觀察結果已附有歸屬並進行了意譯。未重新分發任何來源報告、圖表、參與者數據或專有資料庫;來源權利仍歸其生產者所有。
- METR我們正在更改我們的開發者生產力實驗設計 ↗發布於 2026 年 2 月 24 日。存取於 2026 年 9 月 12 日。選取的實際觀察結果已附有歸屬並進行了意譯。未重新分發任何來源報告、圖表、參與者數據或專有資料庫;來源權利仍歸其生產者所有。
旨在供查閱和引用
如何引用本報告
對於來源報告的統計數據,請在引用我們的匯編時,註明原始發布者並連結到確切的列。對於模型結果,請引用 Workspace369 並包含假設。連結到此頁面並不代表我們是第三方數據的原始生產者。
Workspace369. (2026-09-12)。AI 生產力和節省時間基準。https://workspace369.com/research/ai-productivity-time-savings-benchmarks/. 報告中列出的主要來源和觀察期。
下載內容為英文參考資料集,包括翻譯頁面。來源權利歸其生產者所有。請註明 Workspace369 的彙編和計算;請查閱每個來源的再利用條款。