Phiên bản ngắn
ấn bản năm 2026Những điểm chính cần lưu ý
Mỗi thông tin chi tiết đều liên kết đến hàng dữ liệu gốc của nó. Các số liệu được báo cáo thuộc về nhà sản xuất được trích dẫn của chúng; kết quả được mô hình hóa được ghi nhãn là các phép tính.
- Thử nghiệm viết: thời gian nhiệm vụ thấp hơn với sự hỗ trợ của AI: 40% (thử nghiệm năm 2023; xuất bản tháng 7 năm 2023).MIT / Noy và Zhang
- Thử nghiệm viết: chất lượng đầu ra được đánh giá cao hơn: 18% (thử nghiệm năm 2023; xuất bản tháng 7 năm 2023).MIT / Noy và Zhang
- Thử nghiệm tư vấn: tăng số lượng nhiệm vụ phụ được hoàn thành: 12,2% (Nghiên cứu lần đầu xuất bản năm 2023; bản tóm tắt nghiên cứu đã xuất bản tháng 4 năm 2026).Viện AI Trường Kinh doanh Harvard / Dell’Acqua và cộng sự
- Thử nghiệm tư vấn: chất lượng cao hơn khoảng trong bài tập đổi mới: 32% (Nghiên cứu lần đầu xuất bản năm 2023; bản tóm tắt nghiên cứu đã xuất bản tháng 4 năm 2026).Viện AI Trường Kinh doanh Harvard / Dell’Acqua và cộng sự
- Tác vụ chiến lược: câu trả lời đúng mà không có AI: 84,5% (Nghiên cứu lần đầu được phát hành năm 2023; tóm tắt nghiên cứu đã xuất bản tháng 4 năm 2026).Viện AI Trường Kinh doanh Harvard / Dell’Acqua và cộng sự
- Tác vụ chiến lược: câu trả lời đúng với quyền truy cập GPT-4: 70,6% (Nghiên cứu lần đầu được phát hành năm 2023; tóm tắt nghiên cứu đã xuất bản tháng 4 năm 2026).Viện AI Trường Kinh doanh Harvard / Dell’Acqua và cộng sự
- Tác vụ chiến lược: câu trả lời đúng với GPT-4 và tổng quan về lời nhắc: 60% (Nghiên cứu lần đầu được phát hành năm 2023; tóm tắt nghiên cứu đã xuất bản tháng 4 năm 2026).Viện AI Trường Kinh doanh Harvard / Dell’Acqua và cộng sự
- Thử nghiệm Copilot: giảm thời gian hoàn thành một nhiệm vụ lập trình: 55,8% (ngày 15 tháng 5–20 tháng 6 năm 2022).Peng, Kalliamvakou, Cihon và Demirer
- Thí nghiệm METR đầu năm 2025: thời gian hoàn thành dài hơn khi cho phép AI: 19% (tháng 2–tháng 6 năm 2025).METR
- Người tham gia METR: tốc độ tăng tốc của AI cảm nhận sau thí nghiệm: 20% (tháng 2–tháng 6 năm 2025).METR
AI có giúp ích cho các nhiệm vụ viết chuyên nghiệp ngắn không?
Thử nghiệm viết lách cho thấy ít thời gian hơn và chất lượng được đánh giá cao hơn với sự hỗ trợ. Các nhiệm vụ của nó không yêu cầu độ chính xác thực tế đầy đủ hoặc ngữ cảnh tổ chức của nhiều tài liệu hướng tới khách hàng thực tế.
| Kết quả so với đối chứng | Thay đổi đã báo cáo |
|---|---|
| Giảm thời gian tác vụ | 40%Thí nghiệm ngẫu nhiên |
| Tăng chất lượng được đánh giá | 18%Thí nghiệm ngẫu nhiên |
Việc cải thiện điểm chất lượng và giảm thời gian là các kết quả khác nhau và không được cộng lại.
Nguồn chính: MIT / Noy và Zhang — ngày 14 tháng 7 năm 2023
AI có thể cải thiện một nhiệm vụ tư vấn và gây hại cho nhiệm vụ khác không?
Có. Nghiên cứu phân tách các nhiệm vụ mà mô hình có thể xử lý khỏi một vấn đề chiến lược mà nó không đáng tin cậy. Năng suất trên tập hợp đầu tiên không thiết lập tính chính xác trên tập hợp thứ hai.
| Kết quả và điều kiện | Tỷ lệ phần trăm đã báo cáo |
|---|---|
| Nhiều nhiệm vụ phụ được hoàn thành trong bài tập đổi mới | 12.2%Thí nghiệm ngẫu nhiên |
| Chất lượng cao hơn trong bài tập đổi mới, khoảng | 32%Thí nghiệm ngẫu nhiên |
| Câu trả lời chiến lược đúng: không có AI | 84.5%Thí nghiệm ngẫu nhiên |
| Câu trả lời chiến lược đúng: quyền truy cập GPT-4 | 70.6%Thí nghiệm ngẫu nhiên |
| Câu trả lời chiến lược đúng: GPT-4 cộng với tổng quan về lời nhắc | 60%Thí nghiệm ngẫu nhiên |
Ước tính chất lượng là xấp xỉ. Đây là bằng chứng lịch sử của GPT-4, không phải là tiêu chuẩn đánh giá của các mô hình hiện tại.
Nguồn chính: Viện AI Trường Kinh doanh Harvard / Dell’Acqua và cộng sự — ngày 9 tháng 4 năm 2026
Tại sao các nghiên cứu về mã hóa lại báo cáo các hiệu ứng năng suất khác nhau?
Một bài tập viết mã độc lập và bảo trì trong một kho lưu trữ trưởng thành là các nhiệm vụ khác nhau. Các nghiên cứu cũng sử dụng các thế hệ mô hình và phương pháp tuyển dụng khác nhau. Kết quả của chúng nên được giữ riêng biệt thay vì lấy trung bình.
| Nghiên cứu và kết quả | Thay đổi đã báo cáo |
|---|---|
| Copilot giao nhiệm vụ: giảm thời gian hoàn thành | 55.8%Thí nghiệm ngẫu nhiên |
| METR: tăng thời gian hoàn thành thực tế | 19%Thí nghiệm ngẫu nhiên |
| METR: dự đoán tốc độ tăng tốc trước công việc | 24%Nhận thức của người tham gia |
| METR: tốc độ tăng tốc cảm nhận sau công việc | 20%Nhận thức của người tham gia |
Cuộc khảo sát tiếp theo của METR báo cáo các vấn đề nghiêm trọng về lựa chọn và đo lường thời gian. Các tác giả của nó không coi cuộc khảo sát tiếp theo là ước tính đáng tin cậy về tác động hiện tại; sự chậm lại trong lịch sử không phải là tuyên bố về tất cả các nhà phát triển vào năm 2026.
Nguồn chính: Peng, Kalliamvakou, Cihon và Demirer — ngày 13 tháng 2 năm 2023 · METR — ngày 10 tháng 7 năm 2025 · METR — ngày 24 tháng 2 năm 2026
Sự thay đổi thời gian đo lường được có ý nghĩa gì trên cùng một đường cơ sở?
Chỉ số cơ sở giúp việc đọc phép tính dễ dàng hơn mà không cần gộp các nghiên cứu. Mỗi điều kiện kiểm soát được gán cùng một chỉ số bắt đầu; chỉ số hỗ trợ kết quả vẫn chỉ đề cập đến thử nghiệm của chính nó.
| Thử nghiệm | Chỉ số thời gian hỗ trợ; kiểm soát = 100 |
|---|---|
| Thử nghiệm viết | 60Tính toán chuẩn hóa |
| Giao nhiệm vụ Copilot | 44.2Tính toán chuẩn hóa |
| Các tác vụ kho lưu trữ METR | 119Tính toán chuẩn hóa |
Chuẩn hóa của Workspace369, không phải là một kết quả quan sát mới. Thấp hơn có nghĩa là ít thời gian hơn. Việc giảm thời gian không tương đương với việc tăng phần trăm thông lượng, và không có ước tính thông lượng nào được tuyên bố.
Nguồn chính: MIT / Noy và Zhang — ngày 14 tháng 7 năm 2023 · Peng, Kalliamvakou, Cihon và Demirer — ngày 13 tháng 2 năm 2023 · METR — ngày 10 tháng 7 năm 2025
Một doanh nghiệp nên kiểm tra việc tiết kiệm thời gian bằng AI như thế nào?
Xác định một nhiệm vụ có thể lặp lại và một tiêu chuẩn chấp nhận trước khi so sánh công việc được hỗ trợ và không được hỗ trợ. Bao gồm chuẩn bị lời nhắc, kiểm tra sự thật, xem xét và làm lại. Giữ nguyên yêu cầu truy cập dữ liệu khách hàng và phê duyệt của con người trong quá trình so sánh.
Theo dõi cả thời gian và chất lượng. Không áp dụng tỷ lệ phần trăm nhiệm vụ viết cho toàn bộ bảng lương hoặc giả định kết quả tương tự cho một tác nhân tự động.
Báo cáo này được xây dựng như thế nào
Phương pháp luận và giới hạn
- Đây là sự so sánh bằng chứng được chọn lọc, không phải là đánh giá có hệ thống hoặc phân tích tổng hợp. Các nghiên cứu đã được đưa vào cho các nhiệm vụ có thể xác định, bằng chứng của nhà sản xuất ban đầu và các định nghĩa kết quả được nêu rõ ràng.
- Các số liệu về viết lách và tư vấn sử dụng tóm tắt công khai của các tổ chức nghiên cứu của họ về các nghiên cứu đã xuất bản. Bài báo về mã hóa và báo cáo METR cung cấp chi tiết thử nghiệm ban đầu. Các phiên bản bản nháp và đã xuất bản không bị trộn lẫn.
- Các kết quả đo lường và sự tăng tốc cảm nhận có các nhãn bằng chứng riêng biệt. Phép tính chỉ số thời gian chỉ sử dụng những thay đổi về thời gian hoàn thành đã đo lường; niềm tin khảo sát bị loại trừ khỏi nó.
- Các phiên bản mô hình và ngày nghiên cứu vẫn được đính kèm với các phát hiện. Chúng tôi đã kiểm tra cuộc khảo sát tiếp theo của METR và giữ lại cảnh báo của nó về độ tin cậy của các ước tính mới hơn.
Những gì những con số này không thể cho bạn biết
- Các thí nghiệm được chọn không thể thiết lập lợi tức đầu tư AI phổ quát. Các tác vụ, điều kiện kiểm soát, người tham gia và kiểm tra chất lượng khác nhau ngăn cản một tỷ lệ phần trăm có thể bảo vệ được.
- Quy mô mẫu mô tả phạm vi nghiên cứu, không phải các lần lặp lại độc lập. Sự tham gia của nhà cung cấp trong nghiên cứu Copilot có liên quan đến việc diễn giải.
- Kết quả lịch sử không thiết lập khả năng của các mô hình hiện có. Việc chuẩn hóa không bao gồm chi phí triển khai hoặc chứng minh tiết kiệm hàng năm bền vững.
Tính mới và các bản sửa lỗi
Được duy trì bởi nhóm biên tập Workspace369. Xem xét hàng quý và khi một nhà sản xuất được trích dẫn phát hành một nghiên cứu thay thế. Lần xem xét biên tập tiếp theo: tháng 12 năm 2026. Giữ nguyên các phiên bản mô hình lịch sử và ngày quan sát. Ngày xuất bản chỉ thay đổi khi bằng chứng hoặc nội dung được xem xét về mặt thực chất; nó không thay đổi giai đoạn quan sát cơ bản.
Ấn bản đầu tiên: . Đã kiểm tra trích xuất dữ liệu, ghi nguồn và tính toán số học cho ấn bản này. Không tuyên bố đánh giá ngang hàng độc lập.
Tìm thấy lỗi hoặc bản phát hành chính mới hơn? Gửi một bản sửa lỗi kèm theo nguồn và số liệu bị ảnh hưởng. Các bản sửa lỗi đã xác nhận phải được ghi lại trong lịch sử sửa đổi trước khi xuất bản lại.
Nguồn chính và nguồn gốc
Mỗi ô số được báo cáo đều liên kết trực tiếp đến nhà sản xuất của nó. Các bản tải xuống bao gồm định vị bảng hoặc bảng tính chính xác, thời gian quan sát, ngày truy cập, công thức và tham chiếu đầu vào.
- MIT / Noy và ZhangThông báo nghiên cứu của MIT cho thí nghiệm viết trên Science đã xuất bản ↗Xuất bản ngày 14 tháng 7 năm 2023. Truy cập ngày 12 tháng 9 năm 2026.Các quan sát thực tế được chọn được diễn giải lại với sự ghi nhận. Không có báo cáo nguồn, biểu đồ, dữ liệu người tham gia hoặc cơ sở dữ liệu độc quyền nào được phân phối lại; quyền nguồn vẫn thuộc về nhà sản xuất của nó.
- Viện AI Trường Kinh doanh Harvard / Dell’Acqua và cộng sựQuay lại Khởi đầu của AI tại Nơi làm việc: đánh giá thể chế về thử nghiệm tư vấn đã xuất bản ↗Xuất bản ngày 9 tháng 4 năm 2026. Truy cập ngày 12 tháng 9 năm 2026.Các quan sát thực tế được chọn được diễn giải lại với sự ghi nhận. Không có báo cáo nguồn, biểu đồ, dữ liệu người tham gia hoặc cơ sở dữ liệu độc quyền nào được phân phối lại; quyền nguồn vẫn thuộc về nhà sản xuất của nó.
- Peng, Kalliamvakou, Cihon và DemirerTác động của AI đối với Năng suất của Nhà phát triển: Bằng chứng từ GitHub Copilot, arXiv v1 ↗Xuất bản ngày 13 tháng 2 năm 2023. Truy cập ngày 12 tháng 9 năm 2026.Các quan sát thực tế được chọn được diễn giải lại với sự ghi nhận. Không có báo cáo nguồn, biểu đồ, dữ liệu người tham gia hoặc cơ sở dữ liệu độc quyền nào được phân phối lại; quyền nguồn vẫn thuộc về nhà sản xuất của nó.
- METRĐo lường Tác động của AI đầu năm 2025 đối với Năng suất của Nhà phát triển Mã nguồn mở có Kinh nghiệm ↗Xuất bản ngày 10 tháng 7 năm 2025. Truy cập ngày 12 tháng 9 năm 2026.Các quan sát thực tế được chọn được diễn giải lại với sự ghi nhận. Không có báo cáo nguồn, biểu đồ, dữ liệu người tham gia hoặc cơ sở dữ liệu độc quyền nào được phân phối lại; quyền nguồn vẫn thuộc về nhà sản xuất của nó.
- METRChúng tôi đang Thay đổi Thiết kế Thử nghiệm Năng suất Nhà phát triển của mình ↗Xuất bản ngày 24 tháng 2 năm 2026. Truy cập ngày 12 tháng 9 năm 2026.Các quan sát thực tế được chọn được diễn giải lại với sự ghi nhận. Không có báo cáo nguồn, biểu đồ, dữ liệu người tham gia hoặc cơ sở dữ liệu độc quyền nào được phân phối lại; quyền nguồn vẫn thuộc về nhà sản xuất của nó.
Được tạo để kiểm tra, sau đó trích dẫn
Cách trích dẫn báo cáo này
Đối với một thống kê do nguồn báo cáo, hãy ghi công nhà xuất bản gốc và liên kết đến đúng hàng tại đây khi sử dụng biên soạn của chúng tôi. Đối với kết quả mô hình hóa, hãy trích dẫn Workspace369 và bao gồm các giả định. Việc liên kết đến trang này không làm cho chúng tôi trở thành nhà sản xuất gốc của dữ liệu của bên thứ ba.
Workspace369. (2026-09-12). Tiêu chuẩn Năng suất AI và Tiết kiệm Thời gian. https://workspace369.com/research/ai-productivity-time-savings-benchmarks/. Các nguồn chính và thời gian quan sát như được liệt kê trong báo cáo.
Các tệp tải xuống là các tập dữ liệu tham khảo bằng tiếng Anh, bao gồm cả trên các trang đã dịch. Quyền sở hữu nguồn thuộc về nhà sản xuất của chúng. Ghi nhận công tác biên soạn và tính toán của Workspace369; tham khảo các điều khoản tái sử dụng của từng nguồn.