AI SYNTHESIS / MAY CONTAIN ERRORS

每天都用 AI,為何交付速度仍只小幅變化?

想像一個醫療資訊系統測試團隊:需求一進來,AI 先產生 API 測試案例、Selenium 腳本與缺陷摘要。週報裡的使用次數快速上升,需求到驗收的週期、返工與正式環境缺陷卻只改善少許。

這種落差來自量測層級混在一起。工具被開啟,代表 AI 已接觸工作;產出一段程式或文件,代表 AI 參與某項任務;整條流程能否交付,還要經過測試資料、環境、執行、判讀、修正與驗收。

本文用四層尺來讀最新研究:職業覆蓋看 AI 到了哪裡,任務滲透看它做了多少,自動化深度看人類交出多少完成責任,組織成果再看週期、品質、收入或成本是否改變。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. AI 推論核心主張多方驗證信心:

    AI 工作採用可拆成職業覆蓋、任務滲透、完整自動化與組織成果四層;前一層擴張只能提供後一層的必要入口,單一比例無法證明整條轉換鏈已完成。

    信心理由:四個發布單位從使用互動、產品介面、組織條件與企業成果呈現不同層級;四層框架屬本文綜合,權重與先後關係仍需依場景驗證。
  2. AI 建議輔助主張多方驗證信心:

    團隊應以固定流程記錄 AI 接觸點、任務完成責任、人工覆核、返工與最終品質,再比較導入前後的端到端結果。

    信心理由:三個來源共同顯示使用、流程與成果屬不同量測層;具體指標仍需依團隊工作與資料品質調整。

從工具使用走到組織成果

FIGURE 01 / FLOW
職業覆蓋

哪些角色已出現 AI 使用

任務滲透

職務內有多少任務接觸 AI

完整自動化

AI 承擔多少端到端責任

組織成果

週期、品質、成本與收入

四層使用不同分母;前一層成長只表示下一層獲得機會。

1,500 萬筆互動讓 ATLAS 看見什麼範圍?

Google 於 2026 年 7 月 23 日發布首版 ATLAS。資料來自 Gemini App、AI Mode 與 Gemini API 的 1,500 萬筆彙總去識別互動,橫跨 150 多個國家、140 種語言、800 個職業與 4,000 項任務。

這個規模適合觀察使用分布與任務型態。Google 另外說明資料經過個資清除、切斷底層日誌連結、摘要與群組彙總,研究單位使用 OCTO 工具整理大量非結構化對話。

觀察窗也很明確:ATLAS v1.0 聚焦指定 Google 產品,Google Workspace、企業平台、代理式程式開發與其他經濟活動仍在範圍之外。這項限制會影響跨產品與跨企業推論。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. 來源事實輔助主張直接支持信心:

    Google ATLAS v1.0 以 Gemini App、AI Mode 與 Gemini API 的 1,500 萬筆彙總去識別互動為基礎,涵蓋 150 多個國家、140 種語言、800 個職業與 4,000 項任務。

    信心理由:Google 官方發布頁直接列出資料來源、樣本規模與涵蓋範圍,數字可由完整頁面核對。
  2. 不確定性輔助主張暫定信心:有效期限:2027-01-31

    目前公開資料仍缺少同一批企業從個人互動、流程完成一路連到成本、品質與營收的跨平台長期追蹤。

    信心理由:五份來源使用不同產品、樣本、觀察單位與成果定義,本文無法建立同一群體的縱向因果鏈。本項未綁定直接來源,應視為尚待確認的不確定性。

ATLAS v1.0 的觀察窗

FIGURE 02 / MATRIX
ATLAS v1.0 的觀察窗
項目研究可觀察研究仍留白
產品Gemini App、AI Mode、Gemini APIWorkspace、企業平台與其他供應商
分析單位彙總去識別的人機互動同一企業的完整流程與財務結果
適合回答使用分布、任務類型、互動方式長期因果、跨平台優劣與投資報酬
樣本很大,研究邊界仍由產品範圍與分析單位決定。

68%、約 21% 與低於 10% 各自回答哪個問題?

ATLAS 最容易被誤讀的地方,是三組數字看起來都像「採用率」。68% 指 AI 已出現在多少職業;約 21% 指典型職務中有多少任務出現 AI;低於 10% 指工作互動中有多少完成整項任務。

第一個比例說明廣度。這 68% 的職業合計涵蓋美國約 90% 就業,因此 AI 已跨過許多產業與職類邊界。第二個比例說明職務內深度:多數工作只挑部分任務使用 AI。

第三個比例說明完成責任。工作互動多集中在構思、策略、資訊檢索與學習,完整自動化仍低於一成。把三個分母排開後,「廣泛採用、局部使用」就成為可檢驗的結論。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. 來源事實核心主張直接支持信心:

    ATLAS 觀察到工作場景中的 AI 採用橫跨 68% 職業,這些職業合計涵蓋美國 90% 就業;典型職務約有 21% 任務出現 AI 使用。

    信心理由:Google 官方文章在 ATLAS v1.0 核心發現中直接列出職業覆蓋與任務占比。
  2. 來源事實核心主張直接支持信心:

    ATLAS 的工作互動中,完整自動化占比低於 10%,多數用途集中在構思、策略、資訊檢索與學習等協作活動。

    信心理由:Google 官方文章直接描述工作互動用途,並明列完整自動化低於一成。
  3. AI 推論核心主張多方驗證信心:

    AI 工作採用可拆成職業覆蓋、任務滲透、完整自動化與組織成果四層;前一層擴張只能提供後一層的必要入口,單一比例無法證明整條轉換鏈已完成。

    信心理由:四個發布單位從使用互動、產品介面、組織條件與企業成果呈現不同層級;四層框架屬本文綜合,權重與先後關係仍需依場景驗證。

三組比例的分母與含義

FIGURE 03 / MATRIX
三組比例的分母與含義
項目ATLAS 數字分母可回答的問題
職業覆蓋68%全部職業AI 已進入多少職類
任務滲透約 21%典型職務的任務一份工作有多少任務使用 AI
完整自動化低於 10%工作互動有多少互動完成整項任務
三個比例描述不同層級,合併成單一採用率會失去判斷力。

工具使用如何跨過流程與組織兩道門檻?

Anthropic 的資料補上第一道門檻:同一類產出放在不同產品介面,授權程度會改變。Claude Code 的自主程度普遍高於聊天介面;高價值工作同時需要較多模型輸出與較多使用者參與。

Microsoft 補上第二道門檻。其 2026 Work Trend Index 對近 2 萬份樣本建模,組織文化、主管支持與人才制度和自陳 AI 影響的關聯權重為 67%,個人因素為 32%。研究標示這組結果屬統計關聯。

聯準會對近 750 名企業主管的調查則看到結果端:生產力增益整體為正,產業與企業差異很大,感知改善又高於實際量測。PwC 的企業分析提供另一面,AI 曝險最高企業的生產力成長相較最低組高 40%,顯示部分企業已把採用轉成成果。

合併這些資料後,轉換鏈更清楚:介面決定可授權的深度,流程決定產出能否被驗收,組織制度決定經驗能否回流,最後才會反映到企業成果。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. 來源事實輔助主張直接支持信心:

    Anthropic 的資料顯示,高價值工作對話同時伴隨更多模型輸出與更多使用者參與;Claude Code 相較聊天介面呈現更高自主程度。

    信心理由:Anthropic 完整報告直接比較輸出、互動輪次、token 使用與不同產品介面的自主程度。
  2. 來源事實核心主張直接支持信心:

    Microsoft 對近 2 萬份樣本的模型分析顯示,組織文化、主管支持與人才制度和自陳 AI 影響的關聯權重為 67%,個人因素為 32%;研究明確標示這是統計關聯。

    信心理由:Microsoft 公開方法、樣本、模型結果與因果限制,完整頁面可直接核對。
  3. 來源事實核心主張直接支持信心:

    聯準會研究調查近 750 名企業主管,發現 AI 生產力增益為正但差異顯著,且感知增益高於量測增益。

    信心理由:聯準會研究摘要直接說明樣本、異質性與感知增益高於量測增益的 productivity paradox。
  4. 來源事實輔助主張直接支持信心:

    PwC 以逾 10 億筆職缺廣告分析,報告指出 AI 曝險最高企業的生產力成長相較最低組高 40%,並觀察到技能需求加速變動。

    信心理由:PwC 報告頁直接列出資料規模與主要比例;來源具有顧問業利益關係,本文保留方法外推限制。
  5. AI 推論核心主張多方驗證信心:

    AI 工作採用可拆成職業覆蓋、任務滲透、完整自動化與組織成果四層;前一層擴張只能提供後一層的必要入口,單一比例無法證明整條轉換鏈已完成。

    信心理由:四個發布單位從使用互動、產品介面、組織條件與企業成果呈現不同層級;四層框架屬本文綜合,權重與先後關係仍需依場景驗證。

採用轉成成果的五個關卡

FIGURE 04 / FLOW
任務適配

選到 AI 擅長且有資料的工作

介面授權

聊天、工具與代理提供不同自主程度

流程驗收

輸出進入正式工作並通過品質檢查

經驗回流

標準、範例與失敗被團隊重用

成果量測

週期、品質、成本或收入出現變化

任一關卡中斷,都可能形成高使用量與低成果並存的狀態。

把四層模型套進 HIS 測試流程,瓶頸會出現在哪裡?

回到開場的 HIS 測試團隊。AI 可以迅速產生測試資料草稿、API 驗證碼、Selenium 腳本與 Jira 摘要,這些產出只涵蓋需求到上線鏈條中的部分節點。

真正的端到端流程還包含需求語意確認、測試環境與帳號、資料前置狀態、批次執行、失敗分類、缺陷修復、回歸驗證與發布判斷。任何一段需要大量人工等待或返工,生成速度就很難轉成整體週期。

量測時先把每個節點標成 AI 協助、AI 完成或人工完成,再記錄覆核時間與退回原因。最後用同一批任務比較需求到驗收週期、測試案例一次通過率、缺陷外溢與人工處理分鐘數。

CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. AI 推論核心主張多方驗證信心:

    AI 工作採用可拆成職業覆蓋、任務滲透、完整自動化與組織成果四層;前一層擴張只能提供後一層的必要入口,單一比例無法證明整條轉換鏈已完成。

    信心理由:四個發布單位從使用互動、產品介面、組織條件與企業成果呈現不同層級;四層框架屬本文綜合,權重與先後關係仍需依場景驗證。
  2. AI 建議輔助主張多方驗證信心:

    團隊應以固定流程記錄 AI 接觸點、任務完成責任、人工覆核、返工與最終品質,再比較導入前後的端到端結果。

    信心理由:三個來源共同顯示使用、流程與成果屬不同量測層;具體指標仍需依團隊工作與資料品質調整。

HIS 測試的四層指標

FIGURE 05 / MATRIX
HIS 測試的四層指標
項目要記錄什麼常見誤判較接近成果的指標
職業覆蓋使用 AI 的角色比例把帳號啟用視為成效穩定使用的角色與任務類型
任務滲透流程節點中的 AI 接觸點用生成檔案數代替完成度任務一次通過率與人工修改
完整自動化端到端無人工接手比例忽略等待與失敗分類完成責任、逾時與恢復結果
組織成果週期、品質、成本與風險只看節省的撰寫時間交付週期、返工與缺陷外溢
測試流程越長,局部生成速度與最終品質之間的距離通常越需要單獨量測。

目前資料支持哪些判斷,下一輪應持續量什麼?

五份研究共同支持一個穩健判斷:AI 使用已進入大量職業與任務,完整自動化與組織成果仍受產品介面、工作流程、驗收責任與管理條件影響。

外推時需要保留邊界。Google 與 Anthropic 觀察自家產品,Microsoft 主要使用自陳影響與企業產品訊號,聯準會採企業主管調查,PwC 結合職缺與企業曝險分析。它們的分母、時間窗與成果定義各自不同。

實務上可從一條穩定流程開始,連續記錄四週:AI 接觸的節點、直接完成的節點、人工覆核分鐘數、退回與返工原因,以及週期和品質結果。這組資料能讓團隊判斷應擴大自動化、改善流程介面,或把 AI 留在協作位置。

  • 先固定流程與任務難度,建立導入前基線。
  • 同時記錄 AI 產出與人工接手,避免把產出量當成完成量。
  • 將等待、重試、資料準備與錯誤分類納入端到端週期。
  • 每週檢查返工來源,將穩定做法寫入範例、規則與驗收標準。
  • 當品質或風險惡化時收斂授權範圍,再處理資料、工具與責任邊界。
CLAIM-LEVEL EVIDENCE展開本節主張與證據
  1. 來源事實輔助主張直接支持信心:

    Google ATLAS v1.0 以 Gemini App、AI Mode 與 Gemini API 的 1,500 萬筆彙總去識別互動為基礎,涵蓋 150 多個國家、140 種語言、800 個職業與 4,000 項任務。

    信心理由:Google 官方發布頁直接列出資料來源、樣本規模與涵蓋範圍,數字可由完整頁面核對。
  2. 來源事實核心主張直接支持信心:

    ATLAS 觀察到工作場景中的 AI 採用橫跨 68% 職業,這些職業合計涵蓋美國 90% 就業;典型職務約有 21% 任務出現 AI 使用。

    信心理由:Google 官方文章在 ATLAS v1.0 核心發現中直接列出職業覆蓋與任務占比。
  3. 來源事實核心主張直接支持信心:

    ATLAS 的工作互動中,完整自動化占比低於 10%,多數用途集中在構思、策略、資訊檢索與學習等協作活動。

    信心理由:Google 官方文章直接描述工作互動用途,並明列完整自動化低於一成。
  4. 來源事實核心主張直接支持信心:

    Microsoft 對近 2 萬份樣本的模型分析顯示,組織文化、主管支持與人才制度和自陳 AI 影響的關聯權重為 67%,個人因素為 32%;研究明確標示這是統計關聯。

    信心理由:Microsoft 公開方法、樣本、模型結果與因果限制,完整頁面可直接核對。
  5. 來源事實核心主張直接支持信心:

    聯準會研究調查近 750 名企業主管,發現 AI 生產力增益為正但差異顯著,且感知增益高於量測增益。

    信心理由:聯準會研究摘要直接說明樣本、異質性與感知增益高於量測增益的 productivity paradox。
  6. 來源事實輔助主張直接支持信心:

    PwC 以逾 10 億筆職缺廣告分析,報告指出 AI 曝險最高企業的生產力成長相較最低組高 40%,並觀察到技能需求加速變動。

    信心理由:PwC 報告頁直接列出資料規模與主要比例;來源具有顧問業利益關係,本文保留方法外推限制。
  7. AI 建議輔助主張多方驗證信心:

    團隊應以固定流程記錄 AI 接觸點、任務完成責任、人工覆核、返工與最終品質,再比較導入前後的端到端結果。

    信心理由:三個來源共同顯示使用、流程與成果屬不同量測層;具體指標仍需依團隊工作與資料品質調整。
  8. 不確定性輔助主張暫定信心:有效期限:2027-01-31

    目前公開資料仍缺少同一批企業從個人互動、流程完成一路連到成本、品質與營收的跨平台長期追蹤。

    信心理由:五份來源使用不同產品、樣本、觀察單位與成果定義,本文無法建立同一群體的縱向因果鏈。本項未綁定直接來源,應視為尚待確認的不確定性。