A collaborative submission model for building high-quality data resources at scale through partnership
Community data resources that aggregate datasets across studies are critical infrastructure for modern biomedical research, accelerating discovery as rapidly advancing Artificial Intelligence (AI) models place ever-greater demand on large, well-described data corpora. However, building these resources involves a fundamental tension: comprehensive metadata is imperative for reuse, yet capturing this information systematically requires substantial effort that limits growth. We detail how CZ CELLxGENE Discover has used the collaborative submission model - where data contributors partner with dedicated resource curators - to become a large, widely used single-cell genomics resource for diverse analytical applications including AI model development and integrative analysis. This partnership leverages contributors intimate study knowledge and curators focus on data reuse and expertise in standardization to improve data quality, metadata accuracy, and richness. This is achieved by motivating researcher participation through tangible benefits while minimizing submission burden. We contrast this collaborative model with contributor-driven and resource-driven approaches, highlighting tradeoffs in scalability, consistency across submissions, and quality assurance. The principles and practices we describe provide a framework for building high-quality community data resources across diverse biological data types.