標籤
AI安全
AI安全涵蓋模型失控、內容濾網、提示注入、資料外洩與實體威脅等面向,重點在於如何評估風險、降低誤判,並在產品上線前建立可驗證的防護與治理流程。
13 篇文章

產業動態/8月8日
硅谷不是在失控,硅谷在推销恐慌
硅谷的AI安全叙事正在被包装成市场护城河,而不是单纯的技术警报。

技術研究/8月5日
Anthropic的失控测试:AI安全还没过关
Anthropic的内部模型失控不是边角料,而是AI安全评估仍然不可靠的证据。

產業動態/8月2日
英伟達重注 SSI,AI 安全正在回到模型競爭中心
英偉達對 SSI 的重注說明,AI 安全已不再是邊緣議題,而是下一輪模型競爭的核心。

產業動態/7月25日
Anthropic 不是被 KimiK3 打垮,而是被自己的叙事反噬
Anthropic 的技术仍然强,但它把产品競爭講成價值觀戰爭,反而讓品牌口碑先受傷。

產業動態/7月20日
苹果重回全球市值第一,英伟达回落4%
周五美股早盘,苹果市值重回全球第一,英伟达一度下跌近4%。同一时间,微软在做AI安全工具,华强北内存价格也继续飙升。

產業動態/6月29日
把 AI 安全能力做成模板
我拆解周鸿祎 ISC 的 AI 安全思路,整理成一份能直接套进团队流程的能力模板。

工具應用/6月24日
Codex 日志寫爆 SSD 怎麼管
我拆開 Codex 日誌寫爆 SSD 的根因、風險和可直接套用的限流修復模板,給你一份能抄進 PR 的版本。

產業動態/6月13日
SpaceX IPO 不該沖淡 Grok 的安全失敗
SpaceX 的上市不該掩蓋 Grok 帶來的安全、法規與賠償風險,投資人必須把這些負債一起算進去。

產業動態/6月6日
為什麼 AI 現在就需要煞車
AI 需要先被有效監管,再繼續加速,否則它會在可控性消失前超過人類的治理能力。

AI Agent/4月21日
AI 聊天機器人失控暴增 5 倍
英國資助研究分析 18 萬份 AI 對話,發現 698 起可疑行為,6 個月內失控報告暴增 4.9 倍。

產業動態/4月18日
AI 高層遇襲案,名單外溢到全產業
聯邦文件指稱,攻擊 Sam Altman 住家的嫌犯攜帶反 AI 文件,還點名多位 AI 高層與投資人。這起案件把 AI 爭議拉進實體安全層面。

產業動態/4月4日
Anthropic 與澳洲簽 AI 安全 MOU
Anthropic 與澳洲政府簽 AI 安全 MOU,並投入 AUD$300 萬研究支持、規劃雪梨辦公室,還要共享產業資料與安全評估結果。

產業動態/4月2日
OpenAI內容過濾器的標註工廠
OpenAI把數萬條有害文本交給人工標註,再訓練內容過濾器。這篇拆開它的流程、成本、誤殺率與產業脈絡。