AI生成tSNE图:从单细胞分群到论文投稿图的实战经验
tSNE图看起来简单,投稿时却常因配色、标注、分辨率和图例问题返修。结合AI辅助作图流程,聊聊怎么把它做得既规范又能表达真实结果。
第一次认真处理tSNE图,是在一组单细胞转录组数据投稿前。数据本身已经跑得差不多了,分群结果也和预期吻合,但把图放进论文里时,问题一下子冒出来:颜色太花、cluster编号太小、坐标轴和主题元素显得很“软件默认”,同一组细胞在主图、补充图和回复审稿意见时还用了不同配色。审稿人倒不是质疑算法,而是觉得图注与图中标识对应不清,要求重新整理。
这类情况在单细胞、空间组学、表型分型、流式细胞分析、机器学习特征可视化里都很常见。tSNE擅长把高维结构压到二维平面上,帮助读者观察样本、细胞类型或类别之间是否聚在一起;但它也很容易被误读。点的距离、簇的大小、坐标轴数值,并不能像普通散点图那样直接解释。因此,论文中的tSNE图不只是“画得好看”,更重要的是把分析边界、标签来源和颜色逻辑交代清楚。
先别急着让AI出图,先确认图要回答什么问题
很多同学拿到表达矩阵或降维结果后,第一反应是找工具把tSNE图画出来。其实在使用AI生成tSNE图之前,最好先写一句话:这张图想证明什么?是展示不同处理组的细胞混合程度,还是强调某类细胞在疾病组富集?是比较多个聚类算法的一致性,还是给后续 marker 基因表达定位?
这句话会决定图的组织方式。比如,按细胞类型着色适合做总览图;按样本、组别或批次着色适合检查混杂;按某个基因表达量着色适合展示连续性信号。若一张tSNE图同时承担这些任务,读者反而抓不住重点。主图通常保留最核心的一张,其他切分方式放进补充图。
我更习惯在正式作图前列一个简短清单:降维输入用了哪些特征,是否做了HVG选择、PCA预处理和批次校正;perplexity、迭代次数、随机种子是否记录;cluster标签来自聚类结果、已知细胞注释,还是人工命名;图中每个数字或缩写能否在图注中找到解释。这些信息不需要全部堆在图上,但作者心里必须有数。
AI适合帮忙做什么,不适合代替什么
AI在tSNE图中的作用,更多是辅助设计、重绘、排版和规范检查,而不是凭空“想象”一批细胞点。真正用于论文结论的图,底层坐标和分类信息必须来自原始分析结果。AI可以根据已有embedding、cluster标签和分组信息生成统一风格,也可以帮助调整图例、字体、配色、面板尺寸和导出格式;但不能让它根据文字描述编造聚类结构,更不能为了得到漂亮的分界线而挪动点的位置。
这也是我比较警惕“一键生成”的原因。tSNE图属于结果图,不是纯概念示意图。若AI只根据“免疫细胞分群明显”生成一张看似合理的图,哪怕视觉效果很好,也不能放进结果部分。研究框架图、机制模式图、图文摘要可以有更高程度的视觉设计,tSNE图却要保留数据真实性。
实际操作中,我通常会先用Python或R完成降维、聚类和注释,导出每个点的x、y坐标以及对应的cluster、cell type、sample、condition、gene expression等字段。随后再进入AI辅助环节,让它根据论文目标期刊的风格进行重绘。这样既能控制分析过程,也能避免后期无法追溯。
一张能投稿的tSNE图,重点在细节
tSNE图最常见的问题,是默认软件样式太重。坐标轴上的长数字通常没有实际生物学意义,很多期刊允许隐藏刻度,但会保留“t-SNE1”“t-SNE2”这样的轴标题。点也不宜过大,否则高密度区域会糊成一团;点过小时,投影或打印后又看不清。一般会根据细胞总量调整透明度和点径,几十万细胞时往往需要采样显示或采用密度方式呈现,同时在图注里说明。
颜色要服务于类别属性。细胞类型图适合采用区分度高、色盲友好的离散配色;疾病与对照组适合使用固定、可比较的颜色;基因表达量则适合单色渐变或感知均匀的连续色带,不要用彩虹色表达连续值。主图和补充图里,同一细胞类型必须保持同一个颜色。这个细节看似基础,返修时却特别容易被发现。
标签位置也很关键。直接在每个簇中央写数字是常见做法,但如果簇很小、形状细长,数字可能盖住关键点。更稳妥的方法是把cluster编号放在簇内部或旁边,再在图中或图注里给出对应细胞类型。若论文读者主要关注细胞类型,主图可以直接放缩写;若需要展示无监督聚类过程,则保留数字编号并另配注释表。
多面板图还要考虑对齐。比如左图按细胞类型着色,右图按疾病状态着色,下面一排是几个关键marker基因的表达图,那么所有面板应使用完全相同的坐标范围和点顺序。否则读者会误以为不同面板展示的是不同降维结果。面板字母、比例尺、色条和标题也要统一,不要一张图用10号字,另一张图用14号字。
把AI放进实际改图流程,会省很多返工时间
我现在的流程通常是:先保存标准化后的绘图数据,再生成一张朴素的检查图,确认分群没有明显批次效应、标签没有错位;接着把图表需求描述清楚,例如目标期刊、图栏数量、颜色偏好、是否显示坐标轴、是否需要密度底图、标签是细胞类型还是cluster编号;AI重绘后,再回到原始结果逐项核对。
这里的提示词不要只写“帮我做一张高级的tSNE图”。更有效的说法是:输入字段包括哪些,颜色依据哪一列,对照组和处理组如何区分,字体希望接近哪本期刊,图中是否保留网格线,输出矢量PDF和300 dpi TIFF,图例放在底部还是右侧。信息越具体,来回修改越少。
如果不想反复在通用绘图软件和AI对话框之间折腾,也可以试试科研配图Pro这类专门面向论文图的工具。它比较适合把已有的tSNE结果整理成投稿风格,也能顺带处理SCI图文摘要、研究框架图、实验流程图和PPT汇报图的统一视觉。对经常被导师要求“再精致一点”的同学来说,这种专业化工具比从零手搓PS图层要轻松。
这些误区,我在改图时踩过,也见别人踩过
第一个误区是把tSNE上的距离当作真实相似度。两个簇在二维图上挨得近,并不必然表示它们在高维空间中差异小;某些簇看起来很大,也可能只是点密度或可视化参数造成的。论文表述上最好使用“聚集”“分离”“共定位”等描述,而不是夸大成严格的定量距离。
第二个误区是反复调perplexity直到出现想要的图案。参数可以做敏感性检查,但不能按预期结果挑选图片。若不同参数下聚类关系不稳定,应回到数据预处理、特征选择和批次校正层面找原因。随机种子也要保存,避免审稿后无法复现同一张图。
第三个误区是用tSNE证明分类模型效果。若是机器学习样本的特征可视化,tSNE只能作为辅助证据,还应配合混淆矩阵、准确率、召回率、F1分数或独立验证集结果。分类边界很清楚,不代表模型泛化能力强,尤其当测试集与训练集存在泄漏时,降维图可能给出过于乐观的印象。
第四个误区是过度修饰。有些作者喜欢加阴影、立体点、发光边缘和复杂背景,视觉上很热闹,却不符合论文图的阅读习惯。学术图表需要的是克制:白底、清晰标签、统一线宽、色盲友好、打印可读。真正好的tSNE图,读者不用放大截图就能明白每个颜色代表什么。
投稿前,按期刊和伦理要求再过一遍
不同期刊对图片格式、分辨率和色彩模式要求不同。TIFF、PDF、EPS都很常见,位图至少满足期刊规定的分辨率,线稿和文字若能矢量处理会更稳妥。色彩方面,RGB适合在线预览,部分期刊印刷流程会偏好CMYK,但转换后某些鲜艳颜色可能变暗,所以最初配色就不要只依赖屏幕效果。
还要检查图中是否混入了不该出现的信息。比如患者编号、样本真实姓名、未发表批次、内部路径、软件默认标题等。补充图中的tSNE坐标文件也建议整理成规范命名,回复审稿意见时可以明确说明使用的参数和随机种子。这样即使对方要求重新计算或增加按批次着色的面板,也不会手忙脚乱。
如果使用科研作图工具进行AI辅助重绘,最好保留原始脚本、输入表格、中间图和最终导出文件。AI改变的是视觉层和排版效率,不应该改变数据关系。换句话说,漂亮的tSNE图是在忠实呈现分析结果,而不是替分析本身说话。
我理解很多研究生 deadline 紧,实验、写作和补图都挤在一起。但tSNE图往往是单细胞或分型论文中最先被读者看到的结果图之一,它决定了别人是否愿意继续追着看图注和marker证据。早点把坐标、标签、颜色和导出格式固定下来,后面做主图、补充材料、答辩PPT和审稿回复,都会顺很多。
所以,与其把AI当成“自动帮我画完”的黑箱,不如把它当作一个熟悉期刊风格的配图助手:你负责数据、解释和判断,它负责规范呈现、快速改版和视觉统一。这样生成的tSNE图,才既拿得出手,也经得起追问。