TY - RPRT TI - Real Science Is Harder Than Benchmarks: Evaluating Advanced AI Frameworks on Published Studies. I. Uncertainty Quantification, ML on Therapeutic Data Commons, and Agent-Based Modeling AU - Ahmed, M. O. AU - Amale, S. A. AU - Bhavsar, R. D. AU - Chopra, P. AU - Jaimes, A. AU - Kachhwah, A. AU - Kalotra, C. D. AU - Li, P. AU - Li, X. AU - Liao, Y. AU - Roy, R. AU - Senthilselvan, N. AU - Shao, Y. AU - Sharma, A. D. AU - Shrivatsan, A. AU - Xue, R. AU - You, Y. AU - Badkul, A. AU - Xie, L. AU - Oet, M. AU - Lee, K. AU - Sinitskiy, A. PY - 2026 DO - 10.64898/2026.06.24.734302 UR - https://www.biorxiv.org/content/10.64898/2026.06.24.734302v1 ID - 10.64898/2026.06.24.734302 ER -