Dataset report · v2

biocorpus

A sequence-first biology pre-training corpus: 21,138,120 documents, ~9.15 B tokens, built from UniProt and Ensembl — deduplicated at UniRef50, filtered to genuinely learnable annotation, with verified DNA→RNA→protein mappings.

21,138,120 documents~9.15 B tokens 49 GB raw · 7.0 GB compressed64 zstd shards tier A+B annotation gateCC-BY-4.0 / open
9.15 Btokens (Llama-3 / marin-tokenizer)
21.1 Mdocuments
34 MUniRef50 representatives considered
0%cross-source redundancy (reps are unique)
Published at hf://buckets/timodonnell/biocorpus as 64 .jsonl.zst shards (7.0 GB). Built by a local flat-file join — no per-record web requests.
Composition

What's in it

Documents and tokens by record type. Token counts are measured with the Marin tokenizer over an unbiased reservoir sample per source.

record typedocumentstok/doctokensshare of tokens
TrEMBL representativesAnnotated UniProtKB entry of each UniRef50 cluster representative — the deduplicated protein universe (the bulk).20,091,1784238.493 B
92.9%
Swiss-ProtThe full reviewed set, richly annotated, emitted in both orderings (recognition + design).950,1746130.582 B
6.4%
Central dogmaDNA (pre-mRNA) → spliced RNA → protein for one human transcript, with the mapping verified.21,3162,4680.053 B
0.6%
Splice sites5′ donor / 3′ acceptor junction windows with the observed motif classified.75,4522380.018 B
0.2%

The protein backbone is the UniProtKB entry of each UniRef50 cluster representative — the whole protein universe once, deduplicated at 50% identity, each carrying its real annotation. Swiss-Prot adds richly-curated depth in both orderings; the human genomic records add signal protein databases don't carry — splicing and the central dogma.

Quality

The annotation gate

A protein is kept only if it carries genuinely learnable annotation — tier A (a biological field: function, catalytic activity, localization, pathway, disease, or GO) or tier B (a substantive structural feature: domain boundary, active/binding site, signal peptide, transmembrane span, PTM, disulfide, repeat). Entries whose only annotation is a disordered or coiled-coil region — the bulk of "Uncharacterized protein" TrEMBL entries — are dropped (~21% of representatives). UniProt evidence tags ({ECO:…}), empty Evidence= clauses and markup are stripped; there are no <protein>/<dna> tags.

Annotation coverage of the kept set

fieldTrEMBL repsSwiss-Prot
per-residue features (domains/sites/PTMs)92.4%84.5%
GO terms64.4%98.7%
subcellular location21.7%65.9%
function5.9%85.2%
catalytic activity6.9%46.1%
pathway2.5%23.3%
Format

One JSON object per line

text is what a tokenizer consumes; every other field is queryable metadata:

id · source · source_version · source_url · license · accession · entity_type · seq_type · seq_len · organism · taxid · gene · name · annotations{…} · sequence · sequences{dna_genomic,rna,cds,protein} (dogma only) · ordering · text

Each document leads with a short identity anchor, then the sequence, then clean natural-language annotation. Missing fields are omitted rather than rendered as empty slots, and only claims that were checked are asserted.

Examples

Example documents

Full documents, nothing truncated — long ones scroll inside their box.

TrEMBL representative — tier A (recognition ordering)

Deduplicated cluster representative with real biological annotation. Sequence first: trains P(annotation | sequence).

uniprot:D9Q373 · Acidilobus saccharovorans (strain DSM 16705 / JCM 18335 / VK
source=uniprot_trembl entity_type=protein seq_type=aa seq_len=214 ordering=sequence_first
>tr:D9Q373 Probable thymidylate kinase [Acidilobus saccharovorans (strain DSM 16705 / JCM 18335 / VKM B-2471 / 345-15)]
MKGAIVALEGIDGSGITTHSKLLAQRLSSMGYRAIYTKEPTEGPVGQVIRQLLAQGRPEPRLAALLFAADRSWHLCCDPSLPGGVMGALEQGYVVVMDRYKYSSIAYQGASGADPGWLWEVNSFAPEADLLIFIDVPVEVALSRVAERQRREGYEVEGFLRRAKERFYEVLAQAEARGVTVVRLSQVKDDRPLSVDEFSSLVLEEALRFLKTLR

Probable thymidylate kinase — UniProtKB/TrEMBL D9Q373 — is a 214-residue protein from Acidilobus saccharovorans (strain DSM 16705 / JCM 18335 / VKM B-2471 / 345-15) (NCBI taxon 666510); gene tmk.
Catalytic activity: Reaction=dTMP + ATP = dTDP + ADP; Xref=Rhea:RHEA:13517, ChEBI:CHEBI:30616, ChEBI:CHEBI:58369, ChEBI:CHEBI:63528, ChEBI:CHEBI:456216; EC=2.7.4.9
GO annotations: cytoplasm (component); ATP binding (function); dTMP kinase activity (function); dTDP biosynthetic process (process); dTTP biosynthetic process (process); dUDP biosynthetic process (process)
Sequence features: 1 domain [8-181 (Thymidylate kinase-like)]
Keywords: ATP-binding; Kinase; Nucleotide biosynthesis; Nucleotide-binding; Reference proteome; Transferase
Lineage: Archaea > Thermoproteota > Thermoprotei > Acidilobales > Acidilobaceae > Acidilobus

TrEMBL representative — tier B

No biological field, but kept on a substantive structural feature — a domain boundary. This is the class the gate deliberately protects.

uniprot:A0A1D3L0M4 · Methanobacterium congolense
source=uniprot_trembl entity_type=protein seq_type=aa seq_len=177 ordering=sequence_first
>tr:A0A1D3L0M4 Transposase zinc-ribbon domain-containing protein [Methanobacterium congolense]
MVGVIFLGMKSDLVLELFIPDEEKALNFFRCIRWSNGVYCPECGSYDVYKRGYVYNKRVRRYSCNKCGKNFTDFSDTIFANKHLPLGEMFYIILNQDKKSVNRLSEELGHKWESIDRLSKEFKEYLEKNTKDPVLSGKIEIDEMYQSSGDKGLKKTIQDAEASNKEEEARGKKTNHQ

Transposase zinc-ribbon domain-containing protein — UniProtKB/TrEMBL A0A1D3L0M4 — is a 177-residue protein from Methanobacterium congolense (NCBI taxon 118062); gene MCBB_0570.
Sequence features: 1 domain [20-69 (Transposase zinc-ribbon)]; 1 region [149-177 (Disordered)]
Keywords: Reference proteome
Lineage: Archaea > Methanobacteriati > Methanobacteriota > Methanomada group > Methanobacteria > Methanobacteriales > Methanobacteriaceae > Methanobacterium

Swiss-Prot — recognition ordering

Sequence → annotation.

uniprot:Q60888#se · Mus musculus (Mouse)
source=uniprot_swissprot entity_type=protein seq_type=aa seq_len=311 ordering=sequence_first
>sp:Q60888 Olfactory receptor 10D1B [Mus musculus (Mouse)]
MKNLSVVTQFILLGIPHTEGVETMLFVLFFSFYIFTLVGNLLILLAIVSSSRLHTPMYFFLCQLSVCDIFFPSVSSPKMLFYLSGNTPAISYAGCVSQLFFYHFLGGTECFLYTVMAYDRFVAICYPLRYSVIMSHRICAFLAMGTAVFGCIHSTFLTTLTFQLPYCGPKDVNYYFCDIPVVMKLACADTSTLEMVGFISVGLMPLSCFFFILTSYSCIVRSILQIRSTEGRHRAFSTCSAHFTAILLFYMPVIFIYLRPTPSPWLDATVQILNNLVTPMLNPLIYSLRNKEVKSSLWTVLHLLCFLPKHL

Olfactory receptor 10D1B — UniProtKB/Swiss-Prot Q60888 — is a 311-residue protein from Mus musculus (Mouse) (NCBI taxon 10090); gene Or10d1b.
Function: Odorant receptor
Subcellular location: Cell membrane; Multi-pass membrane protein
GO annotations: membrane (component); plasma membrane (component); G protein-coupled receptor activity (function); olfactory receptor activity (function); detection of chemical stimulus involved in sensory perception of smell (process); G protein-coupled receptor signaling pathway (process); sensory perception of smell (process)
Sequence features: 8 topo dom; 7 transmem [25-45 (Helical; Name=1); 55-75 (Helical; Name=2)]; 1 disulfid [95-187]
Keywords: Cell membrane; Disulfide bond; G protein-coupled receptor; Membrane; Olfaction; Receptor; Reference proteome; Sensory transduction; Transducer; Transmembrane; Transmembrane helix
Lineage: Eukaryota > Metazoa > Chordata > Craniata > Vertebrata > Euteleostomi > Mammalia > Eutheria

Swiss-Prot — design ordering

The same entry rendered metadata-first: trains P(sequence | annotation).

uniprot:Q60888#me · Mus musculus (Mouse)
source=uniprot_swissprot entity_type=protein seq_type=aa seq_len=311 ordering=metadata_first
Olfactory receptor 10D1B — UniProtKB/Swiss-Prot Q60888 — is a 311-residue protein from Mus musculus (Mouse) (NCBI taxon 10090); gene Or10d1b.
Function: Odorant receptor
Subcellular location: Cell membrane; Multi-pass membrane protein
GO annotations: membrane (component); plasma membrane (component); G protein-coupled receptor activity (function); olfactory receptor activity (function); detection of chemical stimulus involved in sensory perception of smell (process); G protein-coupled receptor signaling pathway (process); sensory perception of smell (process)
Sequence features: 8 topo dom; 7 transmem [25-45 (Helical; Name=1); 55-75 (Helical; Name=2)]; 1 disulfid [95-187]
Keywords: Cell membrane; Disulfide bond; G protein-coupled receptor; Membrane; Olfaction; Receptor; Reference proteome; Sensory transduction; Transducer; Transmembrane; Transmembrane helix
Lineage: Eukaryota > Metazoa > Chordata > Craniata > Vertebrata > Euteleostomi > Mammalia > Eutheria

>sp:Q60888 Olfactory receptor 10D1B [Mus musculus (Mouse)]
MKNLSVVTQFILLGIPHTEGVETMLFVLFFSFYIFTLVGNLLILLAIVSSSRLHTPMYFFLCQLSVCDIFFPSVSSPKMLFYLSGNTPAISYAGCVSQLFFYHFLGGTECFLYTVMAYDRFVAICYPLRYSVIMSHRICAFLAMGTAVFGCIHSTFLTTLTFQLPYCGPKDVNYYFCDIPVVMKLACADTSTLEMVGFISVGLMPLSCFFFILTSYSCIVRSILQIRSTEGRHRAFSTCSAHFTAILLFYMPVIFIYLRPTPSPWLDATVQILNNLVTPMLNPLIYSLRNKEVKSSLWTVLHLLCFLPKHL

Central dogma

DNA → spliced RNA → protein in one document, verified (mRNA = spliced exons; translate(CDS) = protein).

ensembl-dogma:ENST00000304952:triple · Homo sapiens
source=ensembl entity_type=central_dogma seq_type=rna seq_len=885 ordering=sequence_first
>ensembl-dogma:ENST00000304952 HES4 [Homo sapiens]
Gene HES4 (protein_coding), Ensembl canonical transcript ENST00000304952, 1:998,964-1,000,097 (-), 4 exon(s) / 3 intron(s).

Genomic DNA (pre-mRNA, sense strand; exons UPPERCASE, introns lowercase):
GCGGGCCTGGAGCCGGGATCCGCCCTAGGGGCTCGGATCGCCGCGCGCTCGCCGCTCGCCCGCCAGCCCGCCCGTGGTCCGTGGCGGCGCGCTCCACCCGGCACGGGGAGGCGCGGGGCGCACCATGGCCGCAGACACGCCGGGGAAACCGAGCGCCTCGCCGATGGCAGGAGCGCCGGCCAGCGCCAGCCGGACCCCAGACAAGCCCCGGAGCGCGGCCGAGCACCGCAAGgtggggtcccggccgggcgtgaggggggcgaccggggggcgggagggacgcgggactcagccggtgcccgacccgcagTCCTCCAAGCCGGTCATGGAGAAGCGGCGCCGAGCGCGTATTAACGAGAGCCTCGCTCAGCTCAAAACCCTCATCCTGGACGCCCTCAGAAAAGAGgtaagtcgggggcgaaggcccgagacccggagtctgggtcgcagctgacctggacctcccgcctatccccgcccccagAGCTCCCGCCACTCGAAGCTGGAGAAGGCGGACATCCTGGAGATGACCGTGAGACACCTGCGGAGCCTGCGTCGCGTGCAGGTGACGGgtgaggcgcgggcggcggcggcttggaggcggggggagggcgcgggacccccgggacccggcaccgacctctcctcctgtgtcgctcccgcagCCGCGCTCAGCGCCGACCCCGCCGTTCTGGGCAAGTACCGCGCCGGCTTCCACGAGTGTCTGGCGGAGGTGAACCGCTTCCTGGCCGGCTGCGAGGGCGTCCCGGCCGACGTGCGCTCCCGCCTGCTGGGCCACCTGGCAGCCTGCCTGCGCCAGCTGGGACCCTCCCGCCGCCCGGCCTCGCTGTCCCCGGCTGCCCCCGCAGAGGCCCCAGCGCCCGAGGTCTACGCGGGCCGCCCGCTGCTGCCATCGCTCGGCGGCCCCTTCCCTCTGCTCGCGCCGCCGCTGCTGCCGGGTCTGACCCGGGCGCTGCCCGCCGCCCCCAGGGCGGGGCCGCAGGGCCCGGGTGGGCCCTGGAGGCCGTGGCTGCGCTGAGGCTGTGGCCCTGAGACTGCATCGGAGGCGGCGCCCCGTTCTAGGGCCGTGGCCTTTGCCGAGACTGTAGCAGAGAAAACGTATTTATTATTCCA

Transcription and splicing remove 3 intron(s) (249 nt) to give the mature mRNA (885 nt):
GCGGGCCUGGAGCCGGGAUCCGCCCUAGGGGCUCGGAUCGCCGCGCGCUCGCCGCUCGCCCGCCAGCCCGCCCGUGGUCCGUGGCGGCGCGCUCCACCCGGCACGGGGAGGCGCGGGGCGCACCAUGGCCGCAGACACGCCGGGGAAACCGAGCGCCUCGCCGAUGGCAGGAGCGCCGGCCAGCGCCAGCCGGACCCCAGACAAGCCCCGGAGCGCGGCCGAGCACCGCAAGUCCUCCAAGCCGGUCAUGGAGAAGCGGCGCCGAGCGCGUAUUAACGAGAGCCUCGCUCAGCUCAAAACCCUCAUCCUGGACGCCCUCAGAAAAGAGAGCUCCCGCCACUCGAAGCUGGAGAAGGCGGACAUCCUGGAGAUGACCGUGAGACACCUGCGGAGCCUGCGUCGCGUGCAGGUGACGGCCGCGCUCAGCGCCGACCCCGCCGUUCUGGGCAAGUACCGCGCCGGCUUCCACGAGUGUCUGGCGGAGGUGAACCGCUUCCUGGCCGGCUGCGAGGGCGUCCCGGCCGACGUGCGCUCCCGCCUGCUGGGCCACCUGGCAGCCUGCCUGCGCCAGCUGGGACCCUCCCGCCGCCCGGCCUCGCUGUCCCCGGCUGCCCCCGCAGAGGCCCCAGCGCCCGAGGUCUACGCGGGCCGCCCGCUGCUGCCAUCGCUCGGCGGCCCCUUCCCUCUGCUCGCGCCGCCGCUGCUGCCGGGUCUGACCCGGGCGCUGCCCGCCGCCCCCAGGGCGGGGCCGCAGGGCCCGGGUGGGCCCUGGAGGCCGUGGCUGCGCUGAGGCUGUGGCCCUGAGACUGCAUCGGAGGCGGCGCCCCGUUCUAGGGCCGUGGCCUUUGCCGAGACUGUAGCAGAGAAAACGUAUUUAUUAUUCCA
Exon boundaries in the mRNA: 1-232, 233-328, 329-416, 417-885.
5' UTR: 1-124 (124 nt); CDS: 125-790 (666 nt); 3' UTR: 791-885 (95 nt).

Translation of the CDS (666 nt, standard genetic code) yields the 221-residue protein:
MAADTPGKPSASPMAGAPASASRTPDKPRSAAEHRKSSKPVMEKRRRARINESLAQLKTLILDALRKESSRHSKLEKADILEMTVRHLRSLRRVQVTAALSADPAVLGKYRAGFHECLAEVNRFLAGCEGVPADVRSRLLGHLAACLRQLGPSRRPASLSPAAPAEAPAPEVYAGRPLLPSLGGPFPLLAPPLLPGLTRALPAAPRAGPQGPGGPWRPWLR

Verified: the mRNA equals the genomic exons with introns removed; translate(CDS) equals the protein.

Splice site

A window over a donor/acceptor site with the observed motif classified.

ensembl_splice:ENST00000594440:intron1:donor · Homo sapiens
source=ensembl entity_type=splice_junction seq_type=dna seq_len=200 ordering=sequence_first
>ensembl:ENST00000594440:intron1:donor [Homo sapiens]
CCTTGATTAAACGTGCACTTCGCAGTCCTCGGTTCTCCATACCCGTGACCTGGGGATCGCTACGGACCTTAAAATACCCGCAACAGCCCCTTCGTCCCAAGTAAGTAGGAGAATTGCTTCCCTTTCGGTTTAAAATCTCTCTGAGGCCGTTCCTTGCTCTCTGCCTTTCTTCCTTAGGACCATGTAGACAACCCCATTCA

The sequence is a 200 bp window over a 5' splice donor site in gene ZNF841 from Homo sapiens (NCBI taxon 9606).
Splice site: 5' splice donor
Transcript: ENST00000594440
Intron: 1 of 6
Intron location: 19:52,093,972-52,095,574 (-)
Intron length: 1,603 bp
Donor dinucleotide: GT — canonical (GT-AG)
Uniform sample

Random documents

An unbiased reservoir sample across the whole corpus — representative of what a model actually sees.

uniform sample 1
>tr:A0A1W2B5F7 Helix-turn-helix domain-containing protein [Moheibacter sediminis]
MKILENILFYLFLLVGNILFAQNPKIPVKNTFKELRSHYENMEENNQRALPFVNAYLEKAKKENNYDKIIQGYRDFIFFSPKREDKLVYADSCISYALNSKNNELISKAYLGKGILYYFFYKKYQPALDNYLKAYQYSENIEDKYLKNSIIYHIGVVKSYLGYYDEALMLFNECITYFEPLTIADIHPNLVFNNQKGYFNSLHQKIICYQQLGNHVKSDSLIQIGLSTLPHSQEFALEKSYFLKSKAVSNYYKNDFNLAIIYFNNALPELKKINDFTWFSVSYFYLGKCYLKTHRKNLAIPYFMKVDSIFQKNKFILPQIRENYEILIHHFHSVENHEQELHYTRQLLKVDSVLNKDFKYLSSKMHKEYSTKALLKKQEQLENRNSIGFNLLIAASVLTFVLLINLIYRSKKEKEIQQKYIELEKRIIKQNNQRMNTNVSMIINPIQKGKTEKPAYLIEEILQKLEKFEQNKGFRKKGLTQSQLAKKFETNTTYLSQVINEYKMKNFNTYLNNLRMNYITHELYHNPKYLEYTIEALAEDCGISSRQNFSDLFNEVNGIRPADFIRKRRELRQKESSISLN

Helix-turn-helix domain-containing protein — UniProtKB/TrEMBL A0A1W2B5F7 — is a 581-residue protein from Moheibacter sediminis (NCBI taxon 1434700); gene SAMN06296427_105272.
GO annotations: DNA-binding transcription factor activity (function); sequence-specific DNA binding (function)
Sequence features: 1 transmem [387-408 (Helical)]; 1 domain [459-567 (HTH araC/xylS-type)]
Keywords: Membrane; Reference proteome; Transmembrane; Transmembrane helix
Lineage: Bacteria > Pseudomonadati > Bacteroidota > Flavobacteriia > Flavobacteriales > Weeksellaceae > Moheibacter
uniform sample 2
>sp:Q9Z0F3 Bcl-2-like protein 10 [Mus musculus (Mouse)]
MADSQDPLHERTRRLLSDYIFFCAREPDTPEPPPTSVEAALLRSVTRQIQQEHQEFFSSFCESRGNRLELVKQMADKLLSKDQDFSWSQLVMLLAFAGTLMNQGPYMAVKQKRDLGNRVIVTRDCCLIVNFLYNLLMGRRHRARLEALGGWDGFCRFFKNPLPLGFWRRLLIQAFLSGFFATAIFFIWKRL

Bcl-2-like protein 10 — UniProtKB/Swiss-Prot Q9Z0F3 — is a 191-residue protein from Mus musculus (Mouse) (NCBI taxon 10090); gene Bcl2l10.
Function: Promotes cell survival by suppressing apoptosis induced by BAX but not BAK (By similarity). Increases binding of AHCYL1/IRBIT to ITPR1 (By similarity). Reduces ITPR1-mediated calcium release from the endoplasmic reticulum cooperatively with AHCYL1/IRBIT under normal cellular conditions (By similarity). Under apoptotic stress conditions, dissociates from ITPR1 and is displaced from mitochondria-associated endoplasmic reticulum membranes, leading to increased Ca(2+) transfer to mitochondria which promotes apoptosis (By similarity). Required for the correct formation of the microtubule organizing center during oocyte cell division, potentially via regulation of protein abundance and localization of other microtubule organizing center components such as AURKA and TPX2 (PubMed:27753540)
Subcellular location: Mitochondrion. Nucleus membrane. Endoplasmic reticulum. Cytoplasm, cytoskeleton, spindle. Note=Localizes to mitochondria- associated endoplasmic reticulum membranes (MAMs) (By similarity). Localization to MAMs is greatly reduced under apoptotic stress conditions (By similarity)
GO annotations: cytosol (component); endoplasmic reticulum (component); membrane (component); mitochondria-associated endoplasmic reticulum membrane contact site (component); mitochondrial outer membrane (component); mitochondrion (component); nuclear membrane (component); spindle (component); calcium ion binding (function); caspase binding (function); channel activity (function); identical protein binding (function); +9 more
Sequence features: 8 helix; 3 strand; 2 motif [79-98 (BH1); 144-155 (BH2)]; 1 transmem [166-183 (Helical)]; 1 crosslnk; 1 turn
Keywords: 3D-structure; Apoptosis; Cytoplasm; Cytoskeleton; Endoplasmic reticulum; Isopeptide bond; Membrane; Mitochondrion; Nucleus; Reference proteome; Transmembrane; Transmembrane helix
Lineage: Eukaryota > Metazoa > Chordata > Craniata > Vertebrata > Euteleostomi > Mammalia > Eutheria
uniform sample 3
>tr:A0A1Z4ER67 Lysozyme [Mycobacteroides stephanolepidis]
MTTTGRISGGADIQLKAIRDDAQKLSDGASAGQAQLDLIRQTDKLQDYWDNSEAANAAWDDYQHNSSRLERDLGKLRESSAAVTGVADRIEQVLTLKQQQTTSVVKSLIEGTLRNSPGDLENRLVTGAASIWARNQGGGIGGVGTNQHLYAHHGAPGDNWNWNDVKADLQNSVADAFAAACKQLDAINAATDKNLQESYAKLLEALNIPQGPTGTGSGVTEQGAPGDLTPDQLIAIMNSQGHDLSKEKAAEYAPLLEAAMKERGITSPAQKAAFLAQLAAETGGLTNWSENTPASGYNVGRGPIQLTGEGNYEAAGNALGIDLLNNPGLASDPKYAFRIAAWFVTSDEMGNAMGKLGDGGWGSVPFLGTYATGSNGEQFAQYGSGTGFEGMSRTINGGMAGWRARAEFYETARQVLGAPSLGPYPQHPEESHAG

Lysozyme — UniProtKB/TrEMBL A0A1Z4ER67 — is a 434-residue protein from Mycobacteroides stephanolepidis (NCBI taxon 1520670); gene MSTE_00091.
GO annotations: chitinase activity (function); cell wall macromolecule catabolic process (process); chitin catabolic process (process); defense response (process)
Sequence features: 1 domain [295-346 (Glycoside hydrolase family 19 catalytic)]
Keywords: Disulfide bond; Plant defense; Reference proteome
Lineage: Bacteria > Bacillati > Actinomycetota > Actinomycetes > Mycobacteriales > Mycobacteriaceae > Mycobacteroides
uniform sample 4
>tr:A0A671VQV7 BCL2 interacting killer [Sparus aurata (Gilthead sea bream)]
MVAQTRQPRQAVSLQAGPGEVDTGTLFDMNLRVNDGAARAIGRQLAVIGDKLDREWASRDPNWPPSPLHMLRPAQALTRTIYRDIHSQLWGFKGLSAAVKAWISSTAPGQGILRADAWTAWVSSFKAVTCTGWSRGALVTVALVAAVTIFGALWVEGRA

BCL2 interacting killer — UniProtKB/TrEMBL A0A671VQV7 — is a 159-residue protein from Sparus aurata (Gilthead sea bream) (NCBI taxon 8175).
Sequence features: 1 transmem [136-155 (Helical)]
Keywords: Membrane; Reference proteome; Transmembrane; Transmembrane helix
Lineage: Eukaryota > Metazoa > Chordata > Craniata > Vertebrata > Euteleostomi > Actinopterygii > Neopterygii
uniform sample 5
>tr:A0ABV5JLE6 DUF1127 domain-containing protein [Pseudohalocynthiibacter aestuariivivens]
MSITTATRSVPFGAITTFRLVHAIENAAEAFASWKAARQTRGALANLSDSQLEDIGLVRADADMIYNKIRSGRY

DUF1127 domain-containing protein — UniProtKB/TrEMBL A0ABV5JLE6 — is a 74-residue protein from Pseudohalocynthiibacter aestuariivivens (NCBI taxon 1591409); gene ACFFUT_18060.
Sequence features: 1 domain [28-62 (YjiS-like)]
Keywords: Reference proteome
Lineage: Bacteria > Pseudomonadati > Pseudomonadota > Alphaproteobacteria > Rhodobacterales > Paracoccaceae > Pseudohalocynthiibacter
uniform sample 6
>tr:A0A0A8EBX7 Transmembrane protein [Mesomycoplasma flocculare ATCC 27399]
MNKNRQNYRYQNPQNRANFPNQERKSPNFPRRYPVYHQEQEYDREDFQEENNYYQERTYYKPKYENSQQFYQEQLMEQDYHDRMEQKWINEDSNNFISKEVRKIFGLELIFLPLKAIFWFLLIITVSVVTLLWTQELIPGWTYHKKYLPLIIIPGIIAAVLFFLFVKTLLDYKAVKKSVDYFRSQLRNNNNRLEMPPMIPWLVKKVNQKEVNAIWLCVFSLFATIMMGINYWILLKYFPEKNIQNSIEYITSMSINAVLFIIMLVYDLMLRRRLSNIEAIFGHIYHKSVDVARIRFRRHLIWAFFTVIIFLILRRIGKKRNLI

Transmembrane protein — UniProtKB/TrEMBL A0A0A8EBX7 — is a 323-residue protein from Mesomycoplasma flocculare ATCC 27399 (NCBI taxon 743971); gene MYF_00355.
Sequence features: 5 transmem [109-135 (Helical); 147-166 (Helical)]; 1 region [1-30 (Disordered)]
Keywords: Membrane; Reference proteome; Transmembrane; Transmembrane helix
Lineage: Bacteria > Bacillati > Mycoplasmatota > Mycoplasmoidales > Metamycoplasmataceae > Mesomycoplasma
uniform sample 7
>tr:I1JWM9 DCD domain-containing protein [Glycine max (Soybean) (Glycine hispida)]
MRWEKVKGIGGEEGPGKRWGHTCNAVRDGRFLYLFGGYGKFNCQTNQVHVFDTLKQSWSEPAIKGPPPTPRDSHSCTVIGDSLFVFGGTDGSKLLNDLHILDTSSHTWVFPTVRGEAPDAREGHDAALVGKRLFMFGGCGRSADNINEVYYNDLYILNTELFVWNRATTSGTPPSPRDGHTCSSWRNKIIVIGGEDENDSYLSDVHILDTDTLIWSKLCTSGQLLPPRAGHSTVSFGKNLFVFGGFTDAQSLYNDLYMLNIETCVWTKVAITPNGPSARFSVAGDCLDPYMSGVLVFVGGCNRNLEALDDMHYLYTGIARESEQRPKKLSLRKQLKLKCLEQNPNLVQNPVLCGYGVGADSNQPMSILNYSQPSRLYIPVNQPLPPGKKMFQANVKGKNSAGYTIETVIDGKPLHGVLFKNQPNTLIPVPNTSSRKRTFSEILSPASNGIHSHNVMAYKVLRQDRMQDKQELRGESSESHERHKEADTIVVSSNPTTAAKSIKVSVNPEPEAVSMDQNGDEKNDTPKSLIESLKNDGSNDVTSSKGEVQIGGQINVPVSNYEIPRQMSDAPNCNADVLKPAAAKSAVCPPNQGVTGDCTTPRTEGHNEQAKLT

DCD domain-containing protein — UniProtKB/TrEMBL I1JWM9 — is a 613-residue protein from Glycine max (Soybean) (Glycine hispida) (NCBI taxon 3847); gene LOC100785267.
GO annotations: cytoplasm (component); signal transduction (process)
Sequence features: 2 region [466-546 (Disordered); 586-613 (Disordered)]
Keywords: Kelch repeat; Reference proteome; Repeat
Lineage: Eukaryota > Viridiplantae > Streptophyta > Embryophyta > Tracheophyta > Spermatophyta > Magnoliopsida > eudicotyledons
uniform sample 8
>tr:A0A4R3YPW7 Response regulator receiver domain-containing protein [Luteibacter rhizovicinus]
MPDWLRSGMQLGMGRTMSLAERILEGRSVLLVEDEAMLAMVLEDRLLDAGSTAVHIFGHVEAALVFLAAHTVDLAIVDVNVAGESGERVGEVLVARGIPFVFSSGYDDVGLDERWRDWPLLRKPYGTADLHAVLLDLIHGTKGTDPV

Response regulator receiver domain-containing protein — UniProtKB/TrEMBL A0A4R3YPW7 — is a 147-residue protein from Luteibacter rhizovicinus (NCBI taxon 242606); gene EC912_10584.
GO annotations: phosphorelay signal transduction system (process)
Sequence features: 1 domain [28-138 (Response regulatory)]; 1 mod res [78 (4-aspartylphosphate)]
Keywords: Phosphoprotein; Reference proteome
Lineage: Bacteria > Pseudomonadati > Pseudomonadota > Gammaproteobacteria > Lysobacterales > Rhodanobacteraceae > Luteibacter