Portrait of Jinliang Shi

Jinliang Shi

HPC for Machine Learning

About me

I am a Ph.D. candidate in Computer Science and Technology at Beijing University of Posts and Telecommunications, expected to graduate in June 2027. My research focuses on high-performance computing, GPU sparse computing, and efficient large-model training and inference systems. My work has appeared in leading conferences and journals, including SC '26, PPoPP '25, HPDC '26, and TPDS '26.

Interests

Publications

First-Author Publications

[SC '26] Jinliang Shi, Shigang Li

FastInfer: Breaking the Low-to-Moderate Sparsity Barrier for Efficient LLM Inference

[TPDS '26] Jinliang Shi, Shigang Li, Rongtian Fu, Xueying Wang, Youxuan Xu, Tong Wu

UltraGNN: A Sparse-Operator-Aware Framework for Accelerating Graph Neural Networks on Tensor Cores

[PPoPP '25] Jinliang Shi, Shigang Li, Youxuan Xu, Rongtian Fu, Xueying Wang, Tong Wu

FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores

[Parallel Computing '23] Jinliang Shi, Dewu Chen, Jiabi Liang, Lin Li, Yue Lin, Jianjiang Li

New YARN sharing GPU based on graphics memory granularity scheduling

[Under Evaluation] Jinliang Shi, Shigang Li, Youxuan Xu, Xueying Wang, Rongtian Fu, Zhi Ma, Tong Wu

Libra: Unleashing GPU Heterogeneity for High-Performance Sparse Matrix Multiplication

Other Publications

[HPDC '26] Rongtian Fu, Shigang Li, Youxuan Xu, Tong Wu, Zhi Ma, and Jinliang Shi

Omnia: Efficient RAG Serving through Speculative Scheduling

[Parallel Computing '24] Jianjiang Li, Lin Li, Qingwei Wang, Wei Xue, Jiabi Liang, and Jinliang Shi

Parallel Optimization and Application of Unstructured Sparse Triangular Solver on New Generation of Sunway Architecture

Talks

FastInfer: Breaking the Low-to-Moderate Sparsity Barrier for Efficient LLM Inference

SC '26 · Chicago, USA

FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores

HPC China '25 · Ordos, China

FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores

PPoPP '25 · Las Vegas, USA

FlashSparse: Minimizing Computation Redundancy for Fast Sparse Matrix Multiplications on Tensor Cores

2nd Youth Symposium on High-Performance Computing · Chongqing, China

Experience & Education

Tencent logo

2026.07 – 2026.09

Large-Model Training Acceleration Intern @ Tencent

★ Qingyun Top Talent Program

Huawei logo

2023.10 – 2025.01

GNN Model Operator Development Intern @ Huawei

BUPT logo

2023.09 – 2027.06

Ph.D. in Computer Science & Technology @ Beijing University of Posts and Telecommunications

Advisor: Prof. Shigang Li

Baidu logo

2021.06 – 2021.08

Cloud Computing Development Intern @ Baidu

USTB logo

2020.09 – 2023.06

M.S. in Computer Science & Technology @ University of Science and Technology Beijing

Advisor: Prof. Jianjiang Li

Hebei Agricultural University logo

2016.09 – 2020.06

B.S. in Computer Science & Technology @ Hebei Agricultural University

GitHub

Contact

Visitor Map