每天都用 AI,為何交付速度仍只小幅變化?
想像一個醫療資訊系統測試團隊:需求一進來,AI 先產生 API 測試案例、Selenium 腳本與缺陷摘要。週報裡的使用次數快速上升,需求到驗收的週期、返工與正式環境缺陷卻只改善少許。
這種落差來自量測層級混在一起。工具被開啟,代表 AI 已接觸工作;產出一段程式或文件,代表 AI 參與某項任務;整條流程能否交付,還要經過測試資料、環境、執行、判讀、修正與驗收。
本文用四層尺來讀最新研究:職業覆蓋看 AI 到了哪裡,任務滲透看它做了多少,自動化深度看人類交出多少完成責任,組織成果再看週期、品質、收入或成本是否改變。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- AI 推論核心主張多方驗證信心:中
AI 工作採用可拆成職業覆蓋、任務滲透、完整自動化與組織成果四層;前一層擴張只能提供後一層的必要入口,單一比例無法證明整條轉換鏈已完成。
信心理由:四個發布單位從使用互動、產品介面、組織條件與企業成果呈現不同層級;四層框架屬本文綜合,權重與先後關係仍需依場景驗證。對應證據Google|Understanding the AI economyAnthropic|Anthropic Economic Index report: CadencesMicrosoft|2026 Work Trend Index: Agents, human agency, and the opportunity for every organizationFederal Reserve Bank of San Francisco|Artificial Intelligence, Productivity, and the Workforce: Evidence from Corporate Executives - AI 建議輔助主張多方驗證信心:中
團隊應以固定流程記錄 AI 接觸點、任務完成責任、人工覆核、返工與最終品質,再比較導入前後的端到端結果。
信心理由:三個來源共同顯示使用、流程與成果屬不同量測層;具體指標仍需依團隊工作與資料品質調整。
從工具使用走到組織成果
FIGURE 01 / FLOW哪些角色已出現 AI 使用
職務內有多少任務接觸 AI
AI 承擔多少端到端責任
週期、品質、成本與收入
1,500 萬筆互動讓 ATLAS 看見什麼範圍?
Google 於 2026 年 7 月 23 日發布首版 ATLAS。資料來自 Gemini App、AI Mode 與 Gemini API 的 1,500 萬筆彙總去識別互動,橫跨 150 多個國家、140 種語言、800 個職業與 4,000 項任務。
這個規模適合觀察使用分布與任務型態。Google 另外說明資料經過個資清除、切斷底層日誌連結、摘要與群組彙總,研究單位使用 OCTO 工具整理大量非結構化對話。
觀察窗也很明確:ATLAS v1.0 聚焦指定 Google 產品,Google Workspace、企業平台、代理式程式開發與其他經濟活動仍在範圍之外。這項限制會影響跨產品與跨企業推論。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- 來源事實輔助主張直接支持信心:高
Google ATLAS v1.0 以 Gemini App、AI Mode 與 Gemini API 的 1,500 萬筆彙總去識別互動為基礎,涵蓋 150 多個國家、140 種語言、800 個職業與 4,000 項任務。
信心理由:Google 官方發布頁直接列出資料來源、樣本規模與涵蓋範圍,數字可由完整頁面核對。 - 不確定性輔助主張暫定信心:低有效期限:2027-01-31
目前公開資料仍缺少同一批企業從個人互動、流程完成一路連到成本、品質與營收的跨平台長期追蹤。
信心理由:五份來源使用不同產品、樣本、觀察單位與成果定義,本文無法建立同一群體的縱向因果鏈。本項未綁定直接來源,應視為尚待確認的不確定性。
ATLAS v1.0 的觀察窗
FIGURE 02 / MATRIX| 項目 | 研究可觀察 | 研究仍留白 |
|---|---|---|
| 產品 | Gemini App、AI Mode、Gemini API | Workspace、企業平台與其他供應商 |
| 分析單位 | 彙總去識別的人機互動 | 同一企業的完整流程與財務結果 |
| 適合回答 | 使用分布、任務類型、互動方式 | 長期因果、跨平台優劣與投資報酬 |
68%、約 21% 與低於 10% 各自回答哪個問題?
ATLAS 最容易被誤讀的地方,是三組數字看起來都像「採用率」。68% 指 AI 已出現在多少職業;約 21% 指典型職務中有多少任務出現 AI;低於 10% 指工作互動中有多少完成整項任務。
第一個比例說明廣度。這 68% 的職業合計涵蓋美國約 90% 就業,因此 AI 已跨過許多產業與職類邊界。第二個比例說明職務內深度:多數工作只挑部分任務使用 AI。
第三個比例說明完成責任。工作互動多集中在構思、策略、資訊檢索與學習,完整自動化仍低於一成。把三個分母排開後,「廣泛採用、局部使用」就成為可檢驗的結論。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- 來源事實核心主張直接支持信心:高
ATLAS 觀察到工作場景中的 AI 採用橫跨 68% 職業,這些職業合計涵蓋美國 90% 就業;典型職務約有 21% 任務出現 AI 使用。
信心理由:Google 官方文章在 ATLAS v1.0 核心發現中直接列出職業覆蓋與任務占比。 - 來源事實核心主張直接支持信心:高
ATLAS 的工作互動中,完整自動化占比低於 10%,多數用途集中在構思、策略、資訊檢索與學習等協作活動。
信心理由:Google 官方文章直接描述工作互動用途,並明列完整自動化低於一成。 - AI 推論核心主張多方驗證信心:中
AI 工作採用可拆成職業覆蓋、任務滲透、完整自動化與組織成果四層;前一層擴張只能提供後一層的必要入口,單一比例無法證明整條轉換鏈已完成。
信心理由:四個發布單位從使用互動、產品介面、組織條件與企業成果呈現不同層級;四層框架屬本文綜合,權重與先後關係仍需依場景驗證。對應證據Google|Understanding the AI economyAnthropic|Anthropic Economic Index report: CadencesMicrosoft|2026 Work Trend Index: Agents, human agency, and the opportunity for every organizationFederal Reserve Bank of San Francisco|Artificial Intelligence, Productivity, and the Workforce: Evidence from Corporate Executives
三組比例的分母與含義
FIGURE 03 / MATRIX| 項目 | ATLAS 數字 | 分母 | 可回答的問題 |
|---|---|---|---|
| 職業覆蓋 | 68% | 全部職業 | AI 已進入多少職類 |
| 任務滲透 | 約 21% | 典型職務的任務 | 一份工作有多少任務使用 AI |
| 完整自動化 | 低於 10% | 工作互動 | 有多少互動完成整項任務 |
工具使用如何跨過流程與組織兩道門檻?
Anthropic 的資料補上第一道門檻:同一類產出放在不同產品介面,授權程度會改變。Claude Code 的自主程度普遍高於聊天介面;高價值工作同時需要較多模型輸出與較多使用者參與。
Microsoft 補上第二道門檻。其 2026 Work Trend Index 對近 2 萬份樣本建模,組織文化、主管支持與人才制度和自陳 AI 影響的關聯權重為 67%,個人因素為 32%。研究標示這組結果屬統計關聯。
聯準會對近 750 名企業主管的調查則看到結果端:生產力增益整體為正,產業與企業差異很大,感知改善又高於實際量測。PwC 的企業分析提供另一面,AI 曝險最高企業的生產力成長相較最低組高 40%,顯示部分企業已把採用轉成成果。
合併這些資料後,轉換鏈更清楚:介面決定可授權的深度,流程決定產出能否被驗收,組織制度決定經驗能否回流,最後才會反映到企業成果。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- 來源事實輔助主張直接支持信心:高
Anthropic 的資料顯示,高價值工作對話同時伴隨更多模型輸出與更多使用者參與;Claude Code 相較聊天介面呈現更高自主程度。
信心理由:Anthropic 完整報告直接比較輸出、互動輪次、token 使用與不同產品介面的自主程度。 - 來源事實核心主張直接支持信心:高
Microsoft 對近 2 萬份樣本的模型分析顯示,組織文化、主管支持與人才制度和自陳 AI 影響的關聯權重為 67%,個人因素為 32%;研究明確標示這是統計關聯。
信心理由:Microsoft 公開方法、樣本、模型結果與因果限制,完整頁面可直接核對。 - 來源事實核心主張直接支持信心:高
聯準會研究調查近 750 名企業主管,發現 AI 生產力增益為正但差異顯著,且感知增益高於量測增益。
信心理由:聯準會研究摘要直接說明樣本、異質性與感知增益高於量測增益的 productivity paradox。 - 來源事實輔助主張直接支持信心:高
PwC 以逾 10 億筆職缺廣告分析,報告指出 AI 曝險最高企業的生產力成長相較最低組高 40%,並觀察到技能需求加速變動。
信心理由:PwC 報告頁直接列出資料規模與主要比例;來源具有顧問業利益關係,本文保留方法外推限制。 - AI 推論核心主張多方驗證信心:中
AI 工作採用可拆成職業覆蓋、任務滲透、完整自動化與組織成果四層;前一層擴張只能提供後一層的必要入口,單一比例無法證明整條轉換鏈已完成。
信心理由:四個發布單位從使用互動、產品介面、組織條件與企業成果呈現不同層級;四層框架屬本文綜合,權重與先後關係仍需依場景驗證。對應證據Google|Understanding the AI economyAnthropic|Anthropic Economic Index report: CadencesMicrosoft|2026 Work Trend Index: Agents, human agency, and the opportunity for every organizationFederal Reserve Bank of San Francisco|Artificial Intelligence, Productivity, and the Workforce: Evidence from Corporate Executives
採用轉成成果的五個關卡
FIGURE 04 / FLOW選到 AI 擅長且有資料的工作
聊天、工具與代理提供不同自主程度
輸出進入正式工作並通過品質檢查
標準、範例與失敗被團隊重用
週期、品質、成本或收入出現變化
把四層模型套進 HIS 測試流程,瓶頸會出現在哪裡?
回到開場的 HIS 測試團隊。AI 可以迅速產生測試資料草稿、API 驗證碼、Selenium 腳本與 Jira 摘要,這些產出只涵蓋需求到上線鏈條中的部分節點。
真正的端到端流程還包含需求語意確認、測試環境與帳號、資料前置狀態、批次執行、失敗分類、缺陷修復、回歸驗證與發布判斷。任何一段需要大量人工等待或返工,生成速度就很難轉成整體週期。
量測時先把每個節點標成 AI 協助、AI 完成或人工完成,再記錄覆核時間與退回原因。最後用同一批任務比較需求到驗收週期、測試案例一次通過率、缺陷外溢與人工處理分鐘數。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- AI 推論核心主張多方驗證信心:中
AI 工作採用可拆成職業覆蓋、任務滲透、完整自動化與組織成果四層;前一層擴張只能提供後一層的必要入口,單一比例無法證明整條轉換鏈已完成。
信心理由:四個發布單位從使用互動、產品介面、組織條件與企業成果呈現不同層級;四層框架屬本文綜合,權重與先後關係仍需依場景驗證。對應證據Google|Understanding the AI economyAnthropic|Anthropic Economic Index report: CadencesMicrosoft|2026 Work Trend Index: Agents, human agency, and the opportunity for every organizationFederal Reserve Bank of San Francisco|Artificial Intelligence, Productivity, and the Workforce: Evidence from Corporate Executives - AI 建議輔助主張多方驗證信心:中
團隊應以固定流程記錄 AI 接觸點、任務完成責任、人工覆核、返工與最終品質,再比較導入前後的端到端結果。
信心理由:三個來源共同顯示使用、流程與成果屬不同量測層;具體指標仍需依團隊工作與資料品質調整。
HIS 測試的四層指標
FIGURE 05 / MATRIX| 項目 | 要記錄什麼 | 常見誤判 | 較接近成果的指標 |
|---|---|---|---|
| 職業覆蓋 | 使用 AI 的角色比例 | 把帳號啟用視為成效 | 穩定使用的角色與任務類型 |
| 任務滲透 | 流程節點中的 AI 接觸點 | 用生成檔案數代替完成度 | 任務一次通過率與人工修改 |
| 完整自動化 | 端到端無人工接手比例 | 忽略等待與失敗分類 | 完成責任、逾時與恢復結果 |
| 組織成果 | 週期、品質、成本與風險 | 只看節省的撰寫時間 | 交付週期、返工與缺陷外溢 |
目前資料支持哪些判斷,下一輪應持續量什麼?
五份研究共同支持一個穩健判斷:AI 使用已進入大量職業與任務,完整自動化與組織成果仍受產品介面、工作流程、驗收責任與管理條件影響。
外推時需要保留邊界。Google 與 Anthropic 觀察自家產品,Microsoft 主要使用自陳影響與企業產品訊號,聯準會採企業主管調查,PwC 結合職缺與企業曝險分析。它們的分母、時間窗與成果定義各自不同。
實務上可從一條穩定流程開始,連續記錄四週:AI 接觸的節點、直接完成的節點、人工覆核分鐘數、退回與返工原因,以及週期和品質結果。這組資料能讓團隊判斷應擴大自動化、改善流程介面,或把 AI 留在協作位置。
- 先固定流程與任務難度,建立導入前基線。
- 同時記錄 AI 產出與人工接手,避免把產出量當成完成量。
- 將等待、重試、資料準備與錯誤分類納入端到端週期。
- 每週檢查返工來源,將穩定做法寫入範例、規則與驗收標準。
- 當品質或風險惡化時收斂授權範圍,再處理資料、工具與責任邊界。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
- 來源事實輔助主張直接支持信心:高
Google ATLAS v1.0 以 Gemini App、AI Mode 與 Gemini API 的 1,500 萬筆彙總去識別互動為基礎,涵蓋 150 多個國家、140 種語言、800 個職業與 4,000 項任務。
信心理由:Google 官方發布頁直接列出資料來源、樣本規模與涵蓋範圍,數字可由完整頁面核對。 - 來源事實核心主張直接支持信心:高
ATLAS 觀察到工作場景中的 AI 採用橫跨 68% 職業,這些職業合計涵蓋美國 90% 就業;典型職務約有 21% 任務出現 AI 使用。
信心理由:Google 官方文章在 ATLAS v1.0 核心發現中直接列出職業覆蓋與任務占比。 - 來源事實核心主張直接支持信心:高
ATLAS 的工作互動中,完整自動化占比低於 10%,多數用途集中在構思、策略、資訊檢索與學習等協作活動。
信心理由:Google 官方文章直接描述工作互動用途,並明列完整自動化低於一成。 - 來源事實核心主張直接支持信心:高
Microsoft 對近 2 萬份樣本的模型分析顯示,組織文化、主管支持與人才制度和自陳 AI 影響的關聯權重為 67%,個人因素為 32%;研究明確標示這是統計關聯。
信心理由:Microsoft 公開方法、樣本、模型結果與因果限制,完整頁面可直接核對。 - 來源事實核心主張直接支持信心:高
聯準會研究調查近 750 名企業主管,發現 AI 生產力增益為正但差異顯著,且感知增益高於量測增益。
信心理由:聯準會研究摘要直接說明樣本、異質性與感知增益高於量測增益的 productivity paradox。 - 來源事實輔助主張直接支持信心:高
PwC 以逾 10 億筆職缺廣告分析,報告指出 AI 曝險最高企業的生產力成長相較最低組高 40%,並觀察到技能需求加速變動。
信心理由:PwC 報告頁直接列出資料規模與主要比例;來源具有顧問業利益關係,本文保留方法外推限制。 - AI 建議輔助主張多方驗證信心:中
團隊應以固定流程記錄 AI 接觸點、任務完成責任、人工覆核、返工與最終品質,再比較導入前後的端到端結果。
信心理由:三個來源共同顯示使用、流程與成果屬不同量測層;具體指標仍需依團隊工作與資料品質調整。 - 不確定性輔助主張暫定信心:低有效期限:2027-01-31
目前公開資料仍缺少同一批企業從個人互動、流程完成一路連到成本、品質與營收的跨平台長期追蹤。
信心理由:五份來源使用不同產品、樣本、觀察單位與成果定義,本文無法建立同一群體的縱向因果鏈。本項未綁定直接來源,應視為尚待確認的不確定性。