郑康杰照片

郑康杰 欢迎来一起做一些有趣的事情!

博士后研究员 · 桑格研究所(Wellcome Sanger Institute)
青年研究员 · 沃尔森学院(Wolfson College), 剑桥大学
AI for Biology · Genomics · Biomolecules

我致力于构建可扩展的数据驱动型 AI 模型,让机器能够从海量生物组学数据中学习,破译生命的“语言”,并挖掘其中潜藏的生命系统新规律。

关于我

我目前在英国剑桥的 Wellcome Sanger Institute 从事博士后研究,与 Dr. Mo Lotfollahi 合作开发面向大规模生物组学数据的可扩展、可泛化基础模型,捕获基因表达的规律。自 2026 年 1 月起,我同时担任剑桥大学 Wolfson College 青年研究员。 我的研究聚焦于序列数据建模(蛋白质、基因组)与结构数据建模(3D 分子结构)两个部分,致力于实现跨生物模态的一体化理解。 博士期间,我主要研究面向分子建模的基础模型,相关成果构成博士论文 《基于预训练模型的分子建模研究》 的核心内容,并荣获 ACM 北京分会优秀博士学位论文奖。

学术经历

  • 青年研究员 , Wolfson College, 剑桥大学 (2026 年 1 月 – 至今)
  • 博士后研究员, Wellcome Sanger Institute (2025 年 9 月 – 至今)
  • 计算机科学博士, 北京大学 (2020 年 8 月 – 2025 年 6 月)
    导师: 张铭教授
  • 计算机科学学士, 哈尔滨工业大学 (2016 年 8 月 – 2020 年 6 月)
    毕业于哈工大英才学院,并荣获英才学院十佳毕业生。

业界经历

  • 研究实习生, 清华大学智能产业研究院 (2022 年 8 月 – 2024 年 11 月)
    研究方向: 面向蛋白质与药物分子的 AI 建模
  • 研究实习生, 腾讯 AI Lab (2021 年 8 月 – 2022 年 8 月)
    研究方向: 非自回归文本生成
  • 研究实习生, 百度研究院 (2019 年 8 月 – 2020 年 5 月)
    导师: 孙明明教授
    研究方向: 信息抽取

研究亮点

面向单细胞基因调控与统一分子建模的多尺度基础模型。

最新研究

单细胞基因调控模型(MUSS)

整合 DNA 序列、单细胞染色质可及性和基因表达,在多个尺度上建模单细胞基因调控。

NeurIPS 2026 · 已接收(Poster)

代码即将发布。

代表研究

全原子蛋白语言模型 (ESM-AA)

理解多尺度分子数据(如药物分子与蛋白质大分子),在蛋白质-分子联合建模任务上达到优异效果。

ICML 2024

代表性论文

* 表示共同一作 · 完整论文列表见 Google Scholar 。

科学智能

  1. MUSS: A Multi-scale and Sequence-based Model for Single-cell Gene Regulation. NeurIPS 2026 · 已接收(Poster).
    Kangjie Zheng*, Amirhossein Vahidi*, Liying Jin*, Joseph Clarke, Vijaya Baskar MS, Connor Rogerson, Mengji Zhang, Muzlifah Haniffa, Anshul Kundaje, Mohammad Lotfollahi.
    代码即将发布。
  2. CrossMol: Cross-Modal Mask-Predict Pre-training For 3D Molecular Data. Bioinformatics · 2026.
    Kangjie Zheng, Junwei Yang, Siyu Long, Wei Ju, Wei-Ying Ma, Hao Zhou, Ming Zhang.
  3. ESM All-Atom: Multi-scale Protein Language Model for Unified Molecular Modeling. ICML 2024.
    Kangjie Zheng*, Siyu Long*, Tianyu Lu, Junwei Yang, Xinyu Dai, Ming Zhang, Zaiqing Nie, Wei-Ying Ma, Hao Zhou.
  4. SMI-Editor: Edit-based SMILES Language Model with Fragment-level Supervision. ICLR 2025.
    Kangjie Zheng, Siyue Liang, Junwei Yang, Bin Feng, Zequn Liu, Wei Ju, Zhiping Xiao, Ming Zhang.
  5. Mol-AE: Auto-Encoder Based Molecular Representation Learning With 3D Cloze Test Objective. ICML 2024.
    Junwei Yang*, Kangjie Zheng*, Siyu Long, Zaiqing Nie, Ming Zhang, Xinyu Dai, Wei-Ying Ma, Hao Zhou.

语言建模

  1. ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models. ICML 2025.
    Kangjie Zheng, Junwei Yang, Siyue Liang, Bin Feng, Zequn Liu, Wei Ju, Zhiping Xiao, Ming Zhang.
  2. Towards A Unified Training for Levenshtein Transformer. ICASSP 2023.
    Kangjie Zheng, Longyue Wang, Zhihao Wang, Binqi Chen, Ming Zhang, Zhaopeng Tu.
  3. A Decoding Algorithm Based on Directed Acyclic Transformers for Length-Control Summarization. EMNLP Findings 2024.
    Chenyang Huang, Hao Zhou, Cameron Jen, Kangjie Zheng, Osmar Zaiane, Lili Mou.
  4. Gloss Matters: Unlocking the Potential of Non-Autoregressive Sign Language Translation. ACM MM 2025.
    Zhihao Wang, Shiyu Liu, Zhiwei He, Kangjie Zheng, Liangying Shao, Junfeng Yao, Jinsong Su.

学术服务与报告

学术服务

程序委员会 / 审稿

  • Conference on Neural Information Processing Systems (NeurIPS’25) — 审稿人
  • International Conference on Learning Representations (ICLR’24, ’25) — 审稿人
  • International Conference on Machine Learning (ICML’24, ’25) — 审稿人
  • AAAI Conference on Artificial Intelligence (AAAI’25) — 审稿人
  • ACL Rolling Review (ACL ARR) — 审稿人

报告与展示

联系我

欢迎来信交流合作、讨论研究,或进一步了解我的工作。

摘要

MUSS: A Multi-scale and Sequence-based Model for Single-cell Gene Regulation

NeurIPS 2026 · 已接收(Poster)

Kangjie Zheng*, Amirhossein Vahidi*, Liying Jin*, Joseph Clarke, Vijaya Baskar MS, Connor Rogerson, Mengji Zhang, Muzlifah Haniffa, Anshul Kundaje, Mohammad Lotfollahi.

* 共同第一作者。

代码即将发布。

中文摘要(译文)

对单细胞基因调控进行建模,需要在不同调控尺度上联合表征 DNA 序列、染色质可及性和基因表达。基于序列的模型能够捕捉 DNA 层面的调控规律,但通常缺乏细胞层面的分辨率;单细胞组学模型则能够捕捉细胞状态的语义信息,却将基因和染色质可及性峰视为固定词表中的标记,因此缺乏统一的、基于序列的调控视角。我们提出 MUSS,一种基于序列的多尺度单细胞基因调控模型,同时保留 DNA 层面和细胞层面的分辨率。MUSS 使用冻结的预训练序列编码器,从 DNA 中提取峰级和基因级表征,再通过结合峰与峰自注意力以及基于距离的峰与基因交互的多尺度编码器进行整合,并利用配对的 scATAC-seq 和 scRNA-seq 数据训练,使序列衍生表征与细胞特异的调控状态对齐。在基因表达预测、增强子与基因关联、转录因子靶基因恢复和零样本细胞聚类等任务中,MUSS 均优于基于序列和单细胞组学的基线模型,并可进一步泛化到训练中未见过的基因和可及性峰。这些结果表明,MUSS 能够学习具有生物学意义且具备广泛泛化能力的调控表征,从 DNA 序列中解析细胞类型特异的调控程序。

英文原文 / English original

Modeling gene regulation in single cells requires jointly representing DNA sequence, chromatin accessibility, and gene expression across regulatory scales. Sequence-based models capture DNA-level regulatory grammar but typically lack cell-level resolution, whereas single-cell omics models capture cell-state semantics but treat genes and peaks as fixed vocabulary tokens, and thus lack a unified sequence-based view of regulation. Here, we present MUSS, a sequence-based multi-scale model for single-cell gene regulation that preserves both DNA-level and cell-level resolution. MUSS derives peak- and gene-level representations from DNA using a frozen pre-trained sequence encoder, integrates them with a multi-scale encoder combining peak-peak self-attention and distance-based peak-gene interaction, and trains on paired scATAC-seq and scRNA-seq to align sequence-derived representations with cell-specific regulatory states. Across gene expression prediction, enhancer-gene linking, TF-target gene recovery, and zero-shot cell clustering, MUSS outperforms both sequence-based and single-cell omics baselines, and further generalizes to genes and peaks unseen during training. Together, these results demonstrate that MUSS learns biologically meaningful and broadly generalizable regulatory representations for decoding cell-type-specific regulatory programs from DNA sequence.