
Anthropic 於 2026 年 9 月 10 日發布《Detecting and countering misuse of AI: September 2026》,整理其 Threat Intelligence team 在過去八個月偵測及中斷的濫用活動。報告涵蓋 2025 年 12 月至 2026 年 8 月,分成網絡操作、影響操作、監控、詐騙與欺詐、生物濫用、常規武器開發和模型蒸餾七個傷害範圍。這是一份供應商的威脅情報披露,不是所有事件都能由外界獨立重現。
報告最值得注意的描述,是 AI 在部分活動中已不再只是問答助手,而是流程協調層。Anthropic 表示,案例涉及直接執行或協調多代理框架,讓人類設定較高層目標,再由工具和 agent 處理更多中間步驟。這個說法不代表所有 Claude 使用都會出現同樣情況,但它反映出安全評估不能只看單一回覆,而要觀察模型在長 session、工具鏈和多角色協作中的整體行為。
Anthropic 亦嘗試用 speed、scale 和 depth 去衡量 AI 帶來的 uplift。這個框架比單純問「模型會不會寫 exploit」更接近實際防守:同一個操作是否變快、是否能擴大到更多目標、是否能處理更多複雜環節,都會影響防守者看到的風險。報告描述的趨勢,是原本需要較多專業人力和工具的工作,可能被拆成可由 agent 反覆執行的模組。
對平台團隊而言,這種工作流會改變監控要求。單看登入、prompt 或一個高風險詞語,未必足以理解一個 agent session 的意圖;還要把工具調用、權限變更、資料流、異常速度、跨帳戶關聯和輸出目的放在一起分析。Anthropic 表示已封鎖相關帳戶、加強 safeguard,並在適當情況下與政府及業界夥伴分享情報。其他模型平台是否能取得同樣的可見度,則取決於它們自己的 telemetry 和事件回應能力。
這份報告沒有把責任只放在模型本身。威脅行為者會測試防護、尋找繞過方式,而平台需要持續更新偵測和阻斷策略。對企業使用者來說,這意味着不能把供應商的 abuse filter 當成完整的組織安全邊界。API key、工具權限、瀏覽器 session、外部 connector 和 agent 可讀寫的資料範圍,仍需要由部署方按最小權限、分層批准和可追蹤紀錄管理。
報告亦提醒,AI 濫用和 AI 供應鏈互相牽連。Anthropic 指出,部分活動涉及偷取或濫用 AI API key,令被攻擊的環境變成下一輪活動的計算資源。這個角度對使用多個 agent 平台的公司尤其重要:憑證輪換、短效 token、分離測試與生產環境、限制外部網絡、監察異常用量,都是 agent workflow 的基本控制,而不是事後才補上的安全設定。
需要保持比例感的是,Anthropic 明確說明報告中的案例不是典型濫用,而是迄今識別到較新或較值得披露的活動;它也指出案例主要使用 Haiku、Sonnet 和 Opus,並不是所有新模型都涉及其中。報告內的歸因、受害範圍和 AI 帶來的 uplift,應該被視為 Anthropic 的調查判斷。讀者可以採納防守上的模式,但不應把供應商敘述直接當成完整的獨立取證結論。
最實際的結論,是企業應把 agent 當成一個可能持續運行的系統,而不是一個輸入一次就結束的聊天框。要測試的包括:它能否在 scope 不清時停下來、在權限提升時要求批准、在異常工具鏈出現時觸發告警,以及在中斷後留下足夠證據供人覆核。Anthropic 的披露把風險從「模型輸出有沒有危險」推向「整條工作流會不會被用來放大速度、規模和深度」,這正是下一階段 AI 安全工程的重點。



