返回首頁

標籤

AI安全

AI安全涵蓋模型失控、內容濾網、提示注入、資料外洩與實體威脅等面向,重點在於如何評估風險、降低誤判,並在產品上線前建立可驗證的防護與治理流程。

13 篇文章

硅谷不是在失控,硅谷在推销恐慌
產業動態/8月8日

硅谷不是在失控,硅谷在推销恐慌

硅谷的AI安全叙事正在被包装成市场护城河,而不是单纯的技术警报。

Anthropic的失控测试:AI安全还没过关
技術研究/8月5日

Anthropic的失控测试:AI安全还没过关

Anthropic的内部模型失控不是边角料,而是AI安全评估仍然不可靠的证据。

英伟達重注 SSI,AI 安全正在回到模型競爭中心
產業動態/8月2日

英伟達重注 SSI,AI 安全正在回到模型競爭中心

英偉達對 SSI 的重注說明,AI 安全已不再是邊緣議題,而是下一輪模型競爭的核心。

Anthropic 不是被 KimiK3 打垮,而是被自己的叙事反噬
產業動態/7月25日

Anthropic 不是被 KimiK3 打垮,而是被自己的叙事反噬

Anthropic 的技术仍然强,但它把产品競爭講成價值觀戰爭,反而讓品牌口碑先受傷。

苹果重回全球市值第一,英伟达回落4%
產業動態/7月20日

苹果重回全球市值第一,英伟达回落4%

周五美股早盘,苹果市值重回全球第一,英伟达一度下跌近4%。同一时间,微软在做AI安全工具,华强北内存价格也继续飙升。

把 AI 安全能力做成模板
產業動態/6月29日

把 AI 安全能力做成模板

我拆解周鸿祎 ISC 的 AI 安全思路,整理成一份能直接套进团队流程的能力模板。

Codex 日志寫爆 SSD 怎麼管
工具應用/6月24日

Codex 日志寫爆 SSD 怎麼管

我拆開 Codex 日誌寫爆 SSD 的根因、風險和可直接套用的限流修復模板,給你一份能抄進 PR 的版本。

SpaceX IPO 不該沖淡 Grok 的安全失敗
產業動態/6月13日

SpaceX IPO 不該沖淡 Grok 的安全失敗

SpaceX 的上市不該掩蓋 Grok 帶來的安全、法規與賠償風險,投資人必須把這些負債一起算進去。

為什麼 AI 現在就需要煞車
產業動態/6月6日

為什麼 AI 現在就需要煞車

AI 需要先被有效監管,再繼續加速,否則它會在可控性消失前超過人類的治理能力。

AI 聊天機器人失控暴增 5 倍
AI Agent/4月21日

AI 聊天機器人失控暴增 5 倍

英國資助研究分析 18 萬份 AI 對話,發現 698 起可疑行為,6 個月內失控報告暴增 4.9 倍。

AI 高層遇襲案,名單外溢到全產業
產業動態/4月18日

AI 高層遇襲案,名單外溢到全產業

聯邦文件指稱,攻擊 Sam Altman 住家的嫌犯攜帶反 AI 文件,還點名多位 AI 高層與投資人。這起案件把 AI 爭議拉進實體安全層面。

Anthropic 與澳洲簽 AI 安全 MOU
產業動態/4月4日

Anthropic 與澳洲簽 AI 安全 MOU

Anthropic 與澳洲政府簽 AI 安全 MOU,並投入 AUD$300 萬研究支持、規劃雪梨辦公室,還要共享產業資料與安全評估結果。

OpenAI內容過濾器的標註工廠
產業動態/4月2日

OpenAI內容過濾器的標註工廠

OpenAI把數萬條有害文本交給人工標註,再訓練內容過濾器。這篇拆開它的流程、成本、誤殺率與產業脈絡。