bioRxiv · 10.64898/2025.12.12.693901
Vir2vec: A Genome-Wide Viral Embedding
Abstract
Genomic language models (gLMs) are powerful numerical surrogates for DNA, but existing architectures focus primarily on human DNA or limited viral sets, and no dedicated benchmark exists for viral genome understanding. Here we introduce Vir2vec (from 17M to 422M parameters), decoder-only gLMs continually pretrained on a curated pan-viral corpus of 565,747 complete genomes across 295 species. We also present the viral Genome Understanding Evaluation (vGUE), a benchmark probing viral representations across broad organism discrimination, evolutionary signatures, intra-genus separation, variant subtyping, and host tropism. Evaluated as frozen feature extractors under nested cross-validation, Vir2vec achieves top balanced accuracy across 5 of 7 vGUE tasks, outperforming human-trained (MistralDNA), viral-specific (ModernBERTvirus), and broad biological foundation (Evo1) model. Furthermore, Vir2vec displays robust zero-shot generalization to unseen viral families. Finally, we introduce an argmax-routed SHAP explainability framework that projects feature attributions directly onto single-codon coordinates, correctly isolating key receptor-binding domain mutations driving mouse host adaptation. Vir2vec and vGUE provide a foundation for viral surveillance and discovery pipelines.
Explore related subjects
Keep this discovery
Explore connections, maps & timelines
Rancati, S., Arozarena Donelli, P., Nicora, G., Bergomi, L., Buonocore, T., Sy, M. A., Pandey, S., Prosperi, M., Salemi, M., Bellazzi, R., Boucher, C., Parimbelli, E., Marini, S.. 2025-12-13. Vir2vec: A Genome-Wide Viral Embedding. https://doi.org/10.64898/2025.12.12.693901
Cite the original work for its findings. Save a collection to share your selection of sources.