[RSCH] 12 分鐘閱讀OraCore 編輯部

Systema把虚拟细胞评估改成另一套玩法

我拆开Systema这套评估法,讲清虚拟细胞为什么高分不等于真懂扰动。

分享 LinkedIn
Systema把虚拟细胞评估改成另一套玩法

虚拟细胞的分数到底在骗谁?

Systema把虚拟细胞评估从“像不像”改成了“真不真”。

我盯虚拟细胞这类 AIVC(AI virtual cell)工作有一阵子了。模型越来越大,数据越堆越多,leaderboard 也越看越像那么回事,但我总觉得哪里不对。最烦的是,很多模型在标准评估里分数挺漂亮,一换个扰动、换个细胞系、换个任务边界,表现就开始发虚。它们像是在学“扰动之后会有一团转录变化”,但不一定真学到了“这个扰动为什么会引发这组变化”。

这不是吹毛求疵。我做过类似的单细胞预测任务,最容易踩坑的就是把“能区分 control 和 perturbed”误当成“能解释 perturbation”。前者很容易刷分,后者才是难点。知乎这篇长文把虚拟细胞的前世今生、算法路线、数据问题、商业化和未来都串了一遍,而真正把我拽住的,是它提到的 Systema 这套新评估框架。它直接把我之前对 leaderboard 的那点信任打碎了。

先别急着夸模型,先问它在比什么

訂閱 AI 趨勢週報

每週精選模型發布、工具應用與深度分析,直送信箱。不定期,不騷擾。

不會寄垃圾信,隨時可取消。

Systema框架提出了更根本的挑战。2025年Nature Biotechnology发表的Systema研究指出,现有方法的高预测分数主要由“系统性变异”(systematic variation)驱动——即perturbed vs control细胞之间的一致转录差异,而非扰动特异性效应。Systema将评估参考点从control centroid转移到perturbed centroid,在此框架下重新评估发现:预测unseen扰动效应“比标准指标所暗示的要困难得多”。

这段话的意思很直白:以前很多评估方式,默认你只要把 perturbed 细胞预测得像 control 附近的某个方向偏移,就算做对了。但 Systema 说,等等,你可能只是学到了“扰动后细胞总会变得更像受压状态”,而不是“这个扰动本身带来的特异性分子后果”。

Systema把虚拟细胞评估改成另一套玩法

我第一次看到这个思路时,脑子里冒出来的不是论文,而是做题。你让学生做选择题,他能靠排除法拿高分,不代表他真会那门课。很多虚拟细胞模型现在就有点这个味道:它们在标准 benchmark 里像个好学生,真正要它解释一个没见过的 perturbation,就开始露怯。

Systema 最狠的一点,是它把参考点从 control centroid 挪到了 perturbed centroid。这个小动作,把评估逻辑整个翻过来了。以前你看的是“离 control 有多像”,现在你看的是“有没有学到 perturbation 的特异偏移”。这不是语义游戏,是直接改了比赛规则。

怎么应用这个思路?如果你在做自己的 AIVC 项目,别只看一个总分。你至少要拆成两类问题:一类是模型能不能把 perturbed 和 control 区分开,另一类是它能不能捕捉到 perturbation-specific 的表达变化。前者可能很高,后者才决定模型有没有研究价值。

  • 别只看 AUROC、R2 这种总指标。
  • 把“系统性变异”和“扰动特异性效应”分开评估。
  • 如果可能,加入 perturbed-centroid 视角的误差分析。

高分不一定代表懂机制,可能只是会认应激

Systema 这篇最让我警惕的地方,是它把“高分”背后的来源说穿了。很多模型看起来预测得不错,实际上可能主要捕捉的是细胞受到扰动后的通用反应,比如 stress response、转录噪声上升、状态漂移这些东西。说白了,它们先学会了“细胞被折腾后会乱一点”,然后把这个乱当成了预测能力。

这就像你训练一个图像模型识别猫,结果它主要学会的是“背景里有沙发就更像猫”。你给它换个背景,它就不行了。虚拟细胞里也一样,模型可能学的是实验流程、批次效应、通用应激,而不是生物机制本身。

我自己在看单细胞扰动任务时,最怕的就是这种“伪理解”。因为它特别容易在 leaderboard 上显得漂亮。只要数据集里 control 和 perturbed 的差异足够稳定,模型就能抓到一个大方向,然后分数就上去了。问题是,这种分数对真正的药物发现、靶点筛选、机制推断帮助有限。

Systema 的价值在于,它逼你承认一个事实:高分可能只是模型把“扰动的一般性后果”学熟了,不等于它学会了“扰动特异性机制”。这句话很刺耳,但很有用。尤其是在你准备拿模型去讲商业故事的时候,这个区分特别要命。

怎么落地?我会建议你做三件事:

  • 把训练集和测试集按扰动类型、细胞系、实验条件拆开,别让模型靠近似重复数据刷分。
  • 加上对“应激反应基因集”的单独分析,看看模型是不是只会抓这个。
  • 做 ablation 时,优先验证模型是否真的依赖 perturbation 相关特征,而不是 batch 或状态偏移。

如果模型一删掉某些通用应激特征就崩,那它可能根本没学到你想要的东西。

从 control centroid 到 perturbed centroid,评估逻辑才算像样

这部分是 Systema 最有意思的地方,也是最容易被忽略的地方。以前很多任务默认 control 是基准,模型只要预测出一个“从 control 出发的变化”就行。但现实里,perturbation 不是只会把细胞往一个统一方向推。不同扰动可能造成不同的状态转移轨迹,甚至会把细胞推向完全不同的表达区域。

Systema把虚拟细胞评估改成另一套玩法

Systema 把参考点换成 perturbed centroid,本质上是在问:你的模型是否真的知道“这个 perturbation 的结果应该在哪里”,而不是只知道“perturbation 会让细胞偏离原点”。这个差别很大。前者接近机制建模,后者更像分类器式的状态判断。

我以前做过一个很像的实验:同一套模型,在一个基准集上表现不错,换成更严格的对照后,误差立刻暴露。后来复盘发现,模型其实只是抓住了一个全局偏移趋势。它会说“都差不多”,但说不出“差在哪儿”。Systema 这套框架就是把这种“差不多”给揪出来了。

如果你是做研究的人,我觉得这会逼着你重新设计实验。你不能再满足于“模型预测后的分布和真实分布差不多”。你要问的是:它是不是在正确的扰动邻域里?它是不是在正确的细胞状态流形上?它是不是对未见扰动还有可迁移的结构理解?

实践上,我会这么做:

  • 把预测结果和真实 perturbed centroid 的距离单独算出来。
  • 按扰动类别分层,不要把所有 perturbation 混成一个池子。
  • 如果有时间序列,看看模型能不能复原状态转移方向,而不是只复原终点。

这一步很烦,但不做,很多结论都站不稳。

scGPT 这种大模型也不是免检票

文章里提到一个很刺眼的点:即使 fine-tuned 的 scGPT 在 CIN(chromosomal instability)预测上 AUC 也只有 0.73,其他模型还接近随机。这个信息很重要,因为它提醒我,别看大模型名字响,就默认它理解细胞扰动。

scGPT 这类模型的优势,通常在于表达建模能力强、预训练覆盖广、迁移潜力好。但一旦任务变成“预测未见扰动的真实效应”,它们也会碰到边界。尤其是在 perturbation biology 里,数据噪声、实验偏差、任务定义不清,都会把模型逼回原形。

我不反对大模型,我反对的是把大模型当答案机。单细胞扰动不是文本补全,不能靠“见得多”自动解决机制推断。你要的是因果相关的结构,不只是统计相关的补丁。

这里我会特别注意两个问题。第一,fine-tuning 数据是不是足够代表目标扰动空间。第二,评估指标是不是只奖励了“表面相似”,而没有奖励“机制正确”。如果这两点没处理好,模型再大也只是更会背题。

怎么用到你的项目里?我建议别只比最终分数,至少加上这些检查:

  • 未见扰动上的泛化曲线。
  • 跨细胞系迁移表现。
  • 对已知机制扰动的方向一致性。
  • 对负对照和弱扰动的区分能力。

如果一个模型在这些维度上都不稳,那它的“高分”就要打折看。

数据才是虚拟细胞最脏的地方

说到底,AIVC 这条路最难的不是模型结构,而是数据。单细胞扰动数据天然有很多问题:批次效应、测序深度差异、实验条件不一致、扰动强度不均匀、标签稀疏。你以为自己在学生物,其实很可能在学实验室流程。

知乎这篇长文把数据、算法、商业化放在一起讲,挺对的。因为虚拟细胞如果没有高质量、标准化、可复用的数据集,模型再漂亮也很难出圈。这个领域特别容易陷入“数据集越大,噪声越大;模型越强,幻觉越稳”的怪圈。

我自己的经验是,数据问题往往不会在第一轮实验暴露,而是在你准备做外部验证、做产品化、做合作的时候突然炸开。那时你才发现,不同来源的 perturbation 根本不是同一种东西,control 也不是 control,所谓 ground truth 其实只是某个实验条件下的近似值。

所以如果你要做 AIVC,我会把数据治理放到第一位:

  • 明确扰动类型和实验条件的元数据。
  • 统一表达矩阵预处理流程。
  • 记录 batch、平台、时间点、剂量这些关键信息。
  • 尽量保留原始分布,不要过度清洗到把信号也洗没了。

模型可以慢慢调,数据一旦定义错了,后面全是白忙。

商业化别急着吹,先看它能不能帮人做决定

我对很多 AIVC 商业故事的态度都比较冷。不是因为它没价值,而是因为它很容易被讲成“AI 读懂细胞了,所以药物研发要被重写”。这种话听着爽,落地时通常很痛。

真正能商业化的虚拟细胞,不是“看起来像生物学”,而是“能减少实验次数、提高筛选命中率、缩短决策链条”。如果模型只是给出一个漂亮的表达谱,研究员看完还是得自己重做实验,那它的价值就很有限。

Systema 这类工作对商业化的影响其实很直接。它提醒你,很多现有模型的高分可能只是对通用扰动反应的拟合,不足以支撑高风险决策。换句话说,如果你拿这个模型去做靶点优先级排序、药物组合筛选、毒性预测,最好先问一句:它到底懂不懂这个 perturbation 的特异性后果?

我会把商业化分成三层:

  • 第一层:辅助分析,给研究员省时间。
  • 第二层:候选排序,帮你缩小实验空间。
  • 第三层:真正影响决策,直接改变实验设计。

大多数 AIVC 现在最多落在前两层。想进第三层,评估标准必须更狠,Systema 这种思路就是往这个方向推。

你该怎么把这套思路用到自己的项目里

如果我把这篇知乎长文和 Systema 的核心思想压缩成一句话,那就是:别再把“预测得像”误当成“理解得对”。这句话听起来像废话,但很多项目就是栽在这里。

我建议你在自己的虚拟细胞工作流里,直接加一层“反直觉检查”。比如模型分数很高时,先别庆祝,先问三个问题:它是不是只会认应激?它是不是只是在复原 control 偏移?它对未见扰动有没有真正的结构泛化?

如果这三个问题答不出来,模型就还只是一个不错的拟合器,不是机制模型。这个判断很残酷,但很省时间。

我也建议你把 benchmark 设计成分层结构,而不是一锅端。至少分出通用扰动、强应激扰动、机制明确扰动、未见扰动四类。这样你才能看清模型到底在哪一类上真有能力,在哪一类上只是碰巧。

可抄的模板

# Virtual Cell Evaluation Template (Systema-style)

## Goal
Evaluate whether the model predicts perturbation-specific cellular responses, not just generic control-vs-perturbed separation.

## Data splits
- In-distribution perturbations
- Unseen perturbations
- Cross-cell-line transfer
- Cross-batch / cross-platform transfer

## Primary metrics
- Distance to perturbed centroid
- Directional consistency of perturbation effect
- Rank correlation of affected genes
- Recovery of known pathway signatures

## Secondary checks
- Control-vs-perturbed classification score
- Stress-response enrichment
- Batch sensitivity analysis
- Ablation on metadata and preprocessing

## Failure analysis
- Does the model mostly capture generic stress?
- Does performance collapse on unseen perturbations?
- Is the model sensitive to batch or platform artifacts?
- Are gains preserved after removing obvious shortcuts?

## Decision rule
Only treat the model as biologically useful if it performs well on unseen perturbations and keeps directional consistency beyond generic stress effects.

我會真的把這段貼進 README、實驗記錄或者項目評審里。因為它逼著團隊把“高分”拆開看,不讓大家被一個總指標哄住。

最後再說一句,我對 AIVC 不是悲觀,我只是對“看起來很懂”這件事特別不耐煩。Systema 的意義就在這兒:它不是告訴你虛擬細胞沒用,而是提醒你,之前很多“有用”的證據可能沒你想的那麼硬。

原始討論來自知乎文章 《4万字长文必读!一文讲透虚拟细胞(AIVC)的前世今生:算法、数据、商业化和未来》。上面這篇是我基於該文中對 Systema 的總結,再結合 Nature BiotechnologyscGPT 和我自己的評估經驗做的拆解;模板部分是我重新整理的,可直接拿去改你的項目評估。