{"entity":{"id":"genomic-and-protein-language-models","kind":"term","name":"Genomic and protein language models: Evo 2, Enformer, ESM","aka":["protein language model","protein language models","ESM2","ESM-2","ESM-3","Enformer","genomic language model","DNA language model","Evo 2 model","StripedHyena"],"tldr":"Sequence models read DNA or protein letters the way language models read text: ESM predicts protein structure and function, Enformer predicts gene expression from DNA sequence, and Evo 2 models whole genomes with a million-base context.","summary":"ESM-2, from Lin and colleagues at Meta, is a protein language model whose embeddings predict atomic-level structure and are reused as gene tokens by cell models such as UCE. Enformer, from Avsec and colleagues at DeepMind, predicts expression and chromatin signals from 200 kilobases of DNA by combining convolutions with transformer attention. Evo 2 is a 40-billion-parameter genomic model on the StripedHyena 2 architecture with a one-million-base context; its zero-shot variant-effect claims are the kind of result that must be checked on clinical variant sets, and at least one independent check found them wanting.","asOf":"2026-09-24","links":[{"label":"Lin et al., Evolutionary-scale prediction of atomic-level protein structure with a language model (ESM-2, Science 2023)","url":"https://doi.org/10.1126/science.ade2574"},{"label":"ESM on GitHub (facebookresearch/esm)","url":"https://github.com/facebookresearch/esm"},{"label":"Avsec et al., Enformer: effective gene expression prediction from sequence by integrating long-range interactions (Nature Methods 2021)","url":"https://doi.org/10.1038/s41592-021-01252-x"}],"tags":["cansim-terms"],"related":["cancer-ai-vocabulary"],"cancers":[],"sections":[],"technologies":["nucleotide-transformer","evo2"],"targets":[],"drugs":[],"companies":[],"institutions":[],"pathways":[],"terms":["autoregressive-modelling","tokenisation","variant-effect-prediction","zero-shot"],"trials":[],"people":[],"bottlenecks":[],"keyPapers":[],"journals":[],"dependsOn":[],"notes":["Listed in the CanSim terms map 1.0.0 (docs/onco/terms.json, generated 2026-09-24), CC BY 4.0, attribution: CanSim project, an open, public-data-first cancer foundation-model programme; CanSim page path /terms/evo-2."],"provenance":{"editedBy":"OnCo CanSim terms wave (Wikipedia summaries, standards and project pages, GDC and FDA pages, Europe PMC)","editedOn":"2026-09-24","note":"CanSim terms map 1.0.0 (docs/onco/terms.json, generated 2026-09-24), CC BY 4.0, attribution: CanSim project, an open, public-data-first cancer foundation-model programme"},"category":"Methods and models"},"route":"/terms/genomic-and-protein-language-models/","neighbours":{"term":[{"id":"autoregressive-modelling","kind":"term","name":"Autoregressive (next-token) modelling","route":"/terms/autoregressive-modelling/"},{"id":"cancer-ai-vocabulary","kind":"term","name":"Cancer AI vocabulary (CanSim terms map)","route":"/terms/cancer-ai-vocabulary/"},{"id":"tokenisation","kind":"term","name":"Tokenisation (genes, tiles and sequence as tokens)","route":"/terms/tokenisation/"},{"id":"variant-effect-prediction","kind":"term","name":"Variant effect prediction","route":"/terms/variant-effect-prediction/"},{"id":"zero-shot","kind":"term","name":"Zero-shot prediction","route":"/terms/zero-shot/"}],"technology":[{"id":"evo2","kind":"technology","name":"Evo 2 (Arc Institute, NVIDIA)","route":"/technologies/evo2/"},{"id":"nucleotide-transformer","kind":"technology","name":"Nucleotide Transformer (InstaDeep)","route":"/technologies/nucleotide-transformer/"}]}}