# OnCo record tokenisation (term). Data CC BY-NC 4.0, attribute "Data from OnCo (onco.cc)". Whole corpus: https://onco.cc/api/v1/onco.nt
@prefix schema: <https://schema.org/> .
@prefix onco: <https://onco.cc/ns#> .
@prefix xsd: <http://www.w3.org/2001/XMLSchema#> .

<https://onco.cc/terms/tokenisation/>
  a schema:DefinedTerm ;
  onco:kind "term" ;
  schema:identifier "tokenisation" ;
  schema:name "Tokenisation (genes, tiles and sequence as tokens)"@en ;
  schema:alternateName "tokenisation"@en, "tokenization"@en, "gene tokenisation"@en, "gene tokens"@en, "rank-based tokenisation"@en, "value binning"@en, "byte-pair encoding"@en, "universal tokenisation"@en, "semantic token grounding"@en ;
  schema:description "Tokenisation is how raw input is chopped into the discrete pieces a transformer reads: words into subwords, a slide into tiles, an expression profile into genes ranked or binned by level."@en ;
  schema:url <https://onco.cc/terms/tokenisation/> ;
  schema:dateModified "2026-09-24"^^xsd:date ;
  schema:sameAs <https://en.wikipedia.org/wiki/Lexical_analysis> ;
  schema:citation <https://en.wikipedia.org/wiki/Byte-pair_encoding>, <https://en.wikipedia.org/wiki/Lexical_analysis> ;
  onco:tag "cansim-terms" ;
  onco:related <https://onco.cc/terms/cancer-ai-vocabulary/> ;
  onco:terms <https://onco.cc/terms/transformer-architecture/>, <https://onco.cc/terms/embedding/>, <https://onco.cc/terms/masked-modelling/> .
