Skip to content
ICPP 2026 hero image

Schedule

Conference Program

Program at a Glance

ICPP 2026 takes place September 28 - October 1, 2026. Workshops and tutorials are held on Monday, September 28; the main conference runs Tuesday, September 29 through Thursday, October 1.

The program features 117 full papers, 8 posters, 4 demonstrations, 13 workshop papers, and 2 tutorials.

Download the conference booklet (PDF)

Sessions are held at NTU@one-north on levels 3 and 7. Room codes below refer to Auditorium 302 (AUD302), Lecture Theatres 301/701/702 (LT301, LT701, LT702) and Seminar Rooms 703/706 (SR703, SR706); see the floor plans for how to find them.

Day Highlights
Mon, 28 Sep — Workshops & Tutorials 5 workshops and 2 tutorials
Tue, 29 Sep — Main Conference Day 1 Opening · Keynotes 1–2 · Sessions 1A–2D · Posters & Demos · Reception
Wed, 30 Sep — Main Conference Day 2 Keynotes 3–4 · Sessions 3A–4D · Banquet
Thu, 1 Oct — Main Conference Day 3 Sessions 5A–8D

Monday, September 28 — Workshops and Tutorials

Time Program
9:00–10:30 Morning Session 1
The First International Workshop on State of Practice in Deploying Supercomputers with NVIDIA Superchips (SPIN-NVSC) · LT701
SUSTAIN-HPC 2026 – Workshop on Sustainable Computing for High-Performance and Distributed Systems · LT702
Workshop on Benchmarking in the Data Center (BID) · SR703
Tutorial: Accelerating AI and HPC Workflows with AMD ROCm AI and Modern GPU Clusters · SR706
10:30–11:00 Tea Break · Level 7
11:00–12:30 Morning Session 2
The First International Workshop on State of Practice in Deploying Supercomputers with NVIDIA Superchips (SPIN-NVSC) · LT701
SUSTAIN-HPC 2026 – Workshop on Sustainable Computing for High-Performance and Distributed Systems · LT702
Workshop on Benchmarking in the Data Center (BID) · SR703
Tutorial: Accelerating AI and HPC Workflows with AMD ROCm AI and Modern GPU Clusters · SR706
12:30–13:30 Lunch · Level 7
13:30–15:00 Afternoon Session 1
The First International Workshop on State of Practice in Deploying Supercomputers with NVIDIA Superchips (SPIN-NVSC) · LT701
Workshop on Agentic AI in Real-World Systems: Infrastructure, Algorithms, and Deployment · LT702
International Workshop on Data Compression for AI and Big Data Applications (DC4AI) · SR703
Tutorial: Coyote V2: An Open-Source FPGA Shell for Modern Distributed Data Processing · SR706
15:00–15:30 Tea Break · Level 7
15:30–17:00 Afternoon Session 2
The First International Workshop on State of Practice in Deploying Supercomputers with NVIDIA Superchips (SPIN-NVSC) · LT701
Workshop on Agentic AI in Real-World Systems: Infrastructure, Algorithms, and Deployment · LT702
International Workshop on Data Compression for AI and Big Data Applications (DC4AI) · SR703
Tutorial: Coyote V2: An Open-Source FPGA Shell for Modern Distributed Data Processing · SR706

Tutorial abstracts and agendas, and links to each workshop's own website, are on the Workshops and Tutorials page.


Tuesday, September 29 — Main Conference Day 1

Time Program
8:45–9:00 Opening · AUD302
9:00–10:00 Keynote 1: Xian-He Sun, Illinois Institute of Technology
From Scalable Computing to the Scaling Law: A Reexamination of Parallel Processing · AUD302
10:00–10:30 Tea Break · Function Hall (Level 3)
10:30–12:10 1A — MoE Systems · AUD302
1B — Disaggregated Memory · LT301
1C — Scientific Computing I · LT701
1D — Compiler Optimization · LT702
12:10–13:40 Lunch · Function Hall (Level 3)
13:40–14:40 Keynote 2: Torsten Hoefler, ETH Zurich
Ultra Ethernet for Next-Generation AI and HPC Workloads · AUD302
14:40–15:10 Tea Break · Function Hall (Level 3)
15:10–16:50 2A — LLM Inference and Serving I · AUD302
2B — Processing-in-Memory · LT301
2C — Numerical Computing · LT701
2D — Graph Algorithms · LT702
17:00–18:00 Posters and Demonstrations · Function Hall (Level 3)
18:00–20:00 Reception · Function Hall (Level 3)

Wednesday, September 30 — Main Conference Day 2

Time Program
9:00–10:00 Keynote 3: Xiaowen Chu, The Hong Kong University of Science and Technology (Guangzhou)
Efficient LLM Serving via Compression-Centric Optimizations · AUD302
10:00–10:30 Tea Break · Function Hall (Level 3)
10:30–12:10 3A — LLM Inference and Serving II · AUD302
3B — Key-Value Stores · LT301
3C — Hardware Acceleration · LT701
3D — Graph Learning · LT702
12:10–13:40 Lunch · Function Hall (Level 3)
13:40–14:40 Keynote 4: Li-Shiuan Peh, National University of Singapore
Parallel Computing on Ultra-Low-Power Chips · AUD302
14:40–15:10 Tea Break · Function Hall (Level 3)
15:10–16:50 4A — LLM Inference and Serving III · AUD302
4B — Storage Systems · LT301
4C — Sparse Linear Algebra I · LT701
4D — Performance Analysis and Modeling I · LT702
17:15 Shuttle from NTU@one-north to Banquet
18:30–21:00 Banquet — The Ballroom @ Mount Faber Peak
21:00 Shuttle from Mount Faber Peak to Park Avenue Rochester

Thursday, October 1 — Main Conference Day 3

Time Program
9:00–10:15 5A — Memory Management · AUD302
5B — AI Acceleration · LT301
5C — Serverless Computing · LT701
5D — Parallel Data Processing · LT702
10:15–10:45 Tea Break · Function Hall (Level 3)
10:45–12:00 6A — AI Caching · AUD302
6B — Learning-Based Scheduling · LT301
6C — Network Algorithms · LT701
6D — Performance Analysis and Modeling II · LT702
12:00–13:00 Lunch · Function Hall (Level 3)
13:00–14:40 7A — Sparse Linear Algebra II · AUD302
7B — Data-Center Networks · LT301
7C — Distributed Learning · LT701
7D — Parallel Training · LT702
14:40–15:10 Tea Break · Function Hall (Level 3)
15:10–16:50 8A — GEMM Optimization · AUD302
8B — Cloud Scheduling · LT301
8C — Federated Learning · LT701
8D — Scientific Computing II · LT702
16:50 Conference closes

Technical Sessions

Papers are listed in presentation order.

Session 1A — MoE Systems

Tuesday, September 29 · 10:30 – 12:10 · Venue: AUD302

  1. MigMoE: Task-Aware Expert Migration for Faster and More Balanced Expert-Parallel MoE Inference
    Xueyuan Han, Zinuo Cai, Zhuolong Jiang, Rui Zhang, Ruhui Ma
  2. CARE-MoE: Correlation-Aware Expert Placement and Semantic Equivalence Routing for MoE LLM Inference on Edge Devices
    Zhenyu Wang, Wei Li, Ao Ren, Duo Liu, Bo Zhang, Kan Zhong, Chaoxia Qin, Haoyang Li
  3. BR-MoE: A Memory-Budget-Aware Co-Design Framework for Efficient MoE Inference on Resource-Constrained GPUs
    Lei Jiang, Jingwei Sun, Junqing Lin, Han Li, Mingge Lu, Yinghua Zhou, Guangzhong Sun
  4. Fine-grained Computation-Communication Overlap via Tile-level Signaling and Scheduling for Mixture-of-Experts
    Minyu Cui, Anna Wingkvist, Morgan Ericsson

Session 1B — Disaggregated Memory

Tuesday, September 29 · 10:30 – 12:10 · Venue: LT301

  1. Aethon: Performance-aware Memory Offloading for Co-running Applications in Public Clouds
    Guangqiang Luan, Pu Pang, Quan Chen, Chen Chen, Wenda Tang, Deze Zeng, Li Li, Senbo Fu, Miaohe Lin, Xueqi Wu, Qian Peng, Minyi Guo
  2. Duet: Orchestrating Full-Duplex-Aware Proactive Demotion in CXL Tiered Memory
    Shengsong Kong, Lizhao Zhang, Shufan He, Zhenzhou Ji, Zhongchuan Fu, Malik Saad Nawaz, Yifan Wan, Yue Yu, Yinghao Zheng, Tianyu Hu, Kim Jei, Yufa Yang
  3. MEDO: Adaptive Multi-Stream Data Offloading for Efficient Management of Disaggregated Memory Pool
    Jing Wang, Hanzhang Yang, Chao Li, Xinkai Wang, Taolei Wang, Jinyang Guo, Minyi Guo, Jie Meng, Shuangfu Zeng
  4. Breaking the Migration Barrier: Hardware-Software Co-Designed Translation Coherence for Tiered Memory
    Fengkun Dong, Shaoxuan He, Wei Long, Guoqing Xiao, Wangdong Yang, Kenli Li, Marc Casas

Session 1C — Scientific Computing I

Tuesday, September 29 · 10:30 – 12:10 · Venue: LT701

  1. Large-Scale Quantum Circuit Simulation on HPC Cluster via Cache Blocking, Boosting, and Gate Fusion Optimization
    Chuan-Chi Wang, Yan-Jie Wang, Chia-Heng Tu, Shih-Hao Hung
  2. ZSWP: Rollback-Free Spherical ε-Join for Scalable Astronomical Cross-Matching on Heterogeneous Supercomputer Architectures
    Yuhao Yuan, Ce Yu, Jingwen Xing, Hao Fu, Yajie Zhang, Chen Wang, Bin Yang
  3. High-Performance Virtual Screening Based on Parallel Molecular Dynamics Simulations with Early Termination
    Shingo Okuno, Natsuki Kanazawa, Takuto Koyama, Takashi Katoh, Shigeyuki Matsumoto, Yasushi Okuno
  4. AtomFlow: Accelerating GNN-Based Molecular Dynamics with ab initio Accuracy on Fugaku Supercomputer
    Yiming Du, Mingzhen Li, Lijun Liu, Guangming Tan, Weile Jia

Session 1D — Compiler Optimization

Tuesday, September 29 · 10:30 – 12:10 · Venue: LT702

  1. In-Copy Fusion: Runtime Argument Fusion for Efficient OpenMP GPU Offloading
    Dionysios-Odysseas Sotiropoulos, Sara Royuela Alcázar, Eduardo Quiñones, Alessandro Capotondi, Andrea Marongiu
  2. Adaptive Operator Fusion with Subproblem Decomposition for Enhanced Memory Efficiency
    Heng Shi, Xiaofeng Guan, Jianguo Yao
  3. Thinking Globally, Acting Locally: Merge Sort's Auto-Vectorization on Shuffle-Heavy ISAs
    Jincheng Zhou, Jin Zhang, Xiang Zhang, Tiaojie Xiao, Chunye Gong
  4. A SYCLic Investigation of SYCL Ecosystems: UniSYCL for Heterogeneous Scaling
    Nabayan Chaudhury, Norihisa Fujita, Beau Johnston, Taisuke Boku, Wu-chun Feng

Session 2A — LLM Inference and Serving I

Tuesday, September 29 · 15:10 – 16:50 · Venue: AUD302

  1. RPSC: Robust LLM Scheduling by Tolerating Prediction Inaccuracy and Mitigating Tail Latency
    Guosheng Xiao, Xuan Mo, Jialun Li, Weigang Wu
  2. S2PAR: Scalable Surface Code Ancilla Routing Card for Distributed Fault-Tolerant Quantum Computing
    Samuel Stein, Shuwen Kan, Charles Guinn, Esin Tureci, Guus Avis, Chenxu Liu, Zefan Du, Margaret Martonosi, Stefan Krastanov, Ying Mao, Andrew A. Houck, Ang Li
  3. WAQ-LLM: Optimizing Multi-Instance LLM Deployment via Workload-Aware Queueing Model
    Jiaxin Lai, Yizhou Luo, Qiang Wang
  4. Heterogeneous SLO Guaranteed Multi-Resource-Aware Batching in LLM Serving
    Haiying Shen, Tanmoy Sen, Yuxiong He

Session 2B — Processing-in-Memory

Tuesday, September 29 · 15:10 – 16:50 · Venue: LT301

  1. Cuckoo-GPU: Accelerating Cuckoo Filters on Modern GPUs
    Tim Dortmann, Markus Vieth, Bertil Schmidt
  2. Query Density-Driven Partitioning for Spatiotemporal Load Balancing on Processing-in-Memory Systems
    Takato Hideshima, Shigeyuki Sato, Tomoharu Ugawa
  3. PIM-Pai: Boosting the Performance of Index Structures with Minimal Effort on Processing-in-Memory Architecture
    Lixiao Cui, Kedi Yang, Zhuoran Wang, Xinming Yuan, Yusen Li, Gang Wang, Xiaoguang Liu
  4. PIM-Forge: Toward Autonomous PIM Kernel Synthesis through Constraint-Guided Hardware Exploration
    Yixing Du, Qingyun Tang, Lixiao Cui, Yusen Li, Gang Wang, Xiaoguang Liu

Session 2C — Numerical Computing

Tuesday, September 29 · 15:10 – 16:50 · Venue: LT701

  1. VILIB++: High Performance C++ Library for Auto-Vectorizing Interval Arithmetic
    Xingjian Qi, Robert Strzodka
  2. From 2N to N2: Tree-Free Scalable Sparse Symmetric Tucker Decomposition
    Yongseok Soh, Shruti Shivakumar, Jiajia Li, Jee Choi, Ramakrishnan Kannan
  3. High-Performance Star-M SVD for Big Data Compression
    Md Taufique Hussain, Grey Ballard, Aditya Devarakonda, Srinivas Eswar, Naman Pesricha, Vishwas Rao
  4. Elasticity in Parallel Sparse Triangular Solve
    Raphael Steiner, Christos Matzoros, Pál András Papp, Toni Boehnlein, Albert-Jan Yzelman

Session 2D — Graph Algorithms

Tuesday, September 29 · 15:10 – 16:50 · Venue: LT702

  1. Sparsity-aware Fine-grained Parallelization for Set Intersection Computations in Graph Datasets
    Atharva Gondhalekar, Wu-chun Feng
  2. Contraction Hierarchies for Parallel Sequence-to-Graph Alignment
    Aranya Banerjee, Srinivas Aluru
  3. SQUASH: Distributed Square Estimation with Provable Error Bounds for Dynamic Graphs
    Shaikh Arifuzzaman, Shubhashish Kar
  4. DyGMIS: Fast and Scalable Fully Dynamic MIS Maintenance on Large Evolving Graphs
    Prajjwal Nijhara, Agam Harpreet Singh, Aditya Trivedi, Dip Sankar Banerjee

Session 3A — LLM Inference and Serving II

Wednesday, September 30 · 10:30 – 12:10 · Venue: AUD302

  1. ReliefServe: Relieving GPU Pressure in Multi-Model Serving via Selective CPU Escape
    Shijie Peng, Yanying Lin, Chengzhi Lu, Shuaipeng Wu, Chengzhong Xu, Kejiang Ye
  2. AsymFlow: Enabling Long-Context LLM Serving via CPU-GPU Prefill-Decode Disaggregation
    Junwen Zhang, Weiling Yang, Jianbin Fang, Enda Yu, Dezun Dong
  3. IHS-LM: Intra-batch Hybrid Scheduling and Layer Migration for VLM Pipeline Inference Acceleration on Edge Devices
    Yun Li, Tianfu Pang, Zhiyu Cai, Zhenxiang Pan, Yingchi Mao, Jie Wu
  4. Cross-Layer Performance Analysis of Single-GPU Large Language Model Inference
    Zongxing Zhao, Xiaqing Li, Zekai Meng, Zhengjun Fu, Qian Wang, Yanling Zhang, Yidong Li

Session 3B — Key-Value Stores

Wednesday, September 30 · 10:30 – 12:10 · Venue: LT301

  1. ZNStore: Decomposing the B+Tree Write Path for Zoned Namespace SSDs
    Bo Chen, Jinlei Hu, Chengxiao Gong, Jianxi Chen, Dan Feng
  2. HGB+-Tree: An Hourglass-like B+-tree for Persistent Memory
    Hai Yang, Chaoshu Yang, Runyu Zhang, Yu Peng
  3. CmptQuiet: Optimizing Tail Latency and Throughput in LSM-Tree Key-Value Stores via Contention-Aware Compaction
    Jiufei Liu, Kaiyuan Xu, Shu Yin
  4. Breaking the Single-Entry Bottleneck: Dynamic Write Routing for Heterogeneous Key-Value Stores
    Ruisong Zhou, Liang Bao, Haijun Zhang, Peng Wang, Chunhua Li, Ke Zhou

Session 3C — Hardware Acceleration

Wednesday, September 30 · 10:30 – 12:10 · Venue: LT701

  1. Algorithm–Hardware Co-Design of Spiking Transformers for In-Memory Neuromorphic Edge Vision
    Yixing Li, Wenhua Hu, Haohui Peng, Hongjiang Deng, Mengying Hu, Jianwen Xiang, Rui Hao
  2. AIE-HE: Accelerating Client-Side Processing of Homomorphic Encryption on AMD AI Engine
    Haruto Katakura, Ai Nozaki, Motoharu Tsuboi, Takuya Kojima, Hiroshi Nakamura, Hideki Takase
  3. RayFST: Accelerating Finite-State Transducer Composition with Ray Tracing Cores
    Tianao Ge, Xiaowen Chu, Hongyuan Liu
  4. A Neuromorphic Dual-Stage Swin Transformer for Wetland Classification on Edge Platforms
    Hongjiang Deng, Wenhua Hu, Haohui Peng, Yixing Li, Mengying Hu, Jianwen Xiang, Rui Hao

Session 3D — Graph Learning

Wednesday, September 30 · 10:30 – 12:10 · Venue: LT702

  1. ATLAS: Enabling an Asynchronous State-Aware Pipeline for Efficient Training of Temporal Graph Neural Networks
    Yongchun Jiang, Yongchao Liu, Kaifan Jia, Heng Zhang
  2. FAST: A Holistic Framework for Optimizing Memory-I/O, Computation, and Sampling in Temporal GNN Training
    Yushu Cai, Qingrui Zhu, Lei Liu, Kai Sheng, Hao Chen, Xin He
  3. PruneInfer: Exact Full-Neighborhood GNN Inference of Large Datasets on a Single GPU via Full Topology Pruning
    Liyang Wu, Menghan Jia, Chunye Gong, Xinhai Chen, Pan Dong, Dongsheng Li
  4. Tempest: A GPU-Accelerated Engine for Streaming Temporal Random Walks
    Md Ashfaq Salehin, George Parisis, Luc Berthouze

Session 4A — LLM Inference and Serving III

Wednesday, September 30 · 15:10 – 16:50 · Venue: AUD302

  1. NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching
    Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo
  2. SSQT: A Hardware-Friendly Fusion Compression Framework of Structured Sparsification and Sensitivity-Driven Quantization for Large-Scale Language Models
    Qiansheng Song, Guolin Tang
  3. Online Scheduling of Battery-Aware Speculative Decoding for Energy-Efficient Cloud-Edge Collaborative LLM Inference
    Hengdi Wang, Lei Jiao, Konglin Zhu, Lin Zhang
  4. GroupKV: Hierarchical KV Cache Management for Long-Context Diffusion LLM Inference
    Jinhao Wang, Zhexin Hu, Kangjie Zhou, Xin Zhou, Fangfang Liu

Session 4B — Storage Systems

Wednesday, September 30 · 15:10 – 16:50 · Venue: LT301

  1. PG-Tune: Prediction-Guided Distributed Storage System Tuning without Repeated Online Benchmarking
    Weiming Zhang, Chengyu Ma, Haijun Zhang, Yu Liu, Peng Wang, Xiaojun Guo, Fengkui Yang, Ke Zhou
  2. Toward Continuous Service in Enterprise-Level Distributed Block Storage Systems
    Jun Li, Liang Chen, Wenzhang Wu, Mingzhe Hu
  3. DdlRT: A deterministic data layout for efficient redundancy transitioning in erasure-coded systems
    Xiaotong Geng, Haoqi Duan, Liangliang Xu, Tingting Chen, Cunchen Hu
  4. FNR: A Probabilistic Data Repair Scheme for Reed-Solomon Coded Storage Amid Network Fluctuations
    Huizhao Feng, Yikun Hu, Zhen Luo, Tao Lu, Huizhang Luo, Kenli Li

Session 4C — Sparse Linear Algebra I

Wednesday, September 30 · 15:10 – 16:50 · Venue: LT701

  1. Hierarchical Shared Memory-Aware Optimization for TRSM on GPU Platforms
    Xinzhe Chen, Haowei Li, Lijuan Hu, Wenjing Ma, Fangfang Liu
  2. DB-SpMSpV: Dual-View Blocked Sparse Matrix-Sparse Vector Multiplication for Dynamic GPU Workloads
    Xing Cong, Chenhao Xie, Rui Wang, Zhongzhi Luan, Yi Liu, Depei Qian
  3. AFH-SpMM: Auto-Fit Heterogeneous Block Sparse-Dense Matrix Multiplication on Tensor Core GPUs
    Zhirui Chen, Heng Zhang, Kaifan Jia
  4. RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
    Aiying Li, Jingwei Sun, Han Li, Wence Ji, Junqing Lin, Guangzhong Sun

Session 4D — Performance Analysis and Modeling I

Wednesday, September 30 · 15:10 – 16:50 · Venue: LT702

  1. Revealing NVIDIA Closed-Source Driver Command Streams for CPU–GPU Runtime Behavior Insight
    Yuang Yan, Ian Karlin, Ryan Grant
  2. MServerSim: A Modular Design based Simulation Technique for Modern AI Servers
    Rengang Li, Yinan Tang, Ruidong Yan, Zhenhua Guo, Endong Wang
  3. StreamTrace: Fast Trace Analysis for Large-Scale Parallel Applications on a Single Node
    Yuyang Jin, Jidong Zhai
  4. Vadar: Runtime Performance Variance Detection and Diagnosis for Parallel Applications
    Yifan Jia, Shuang Niu, Yuhang Hu, Chunbao Zhou, Ningming Nie, Jue Wang, Yangang Wang

Session 5A — Memory Management

Thursday, October 1 · 9:00 – 10:15 · Venue: AUD302

  1. Governing Global ASID/PCID Management for QoS Isolation in Shared-Kernel Mixed-Priority Systems
    Zhaomeng Deng, Ziqi Zhang, Peng Jiang, Yunfeng Ye, Yuxin Ren, Ning Jia, Xinwei Hu, Yao Guo, Ding Li
  2. MiTDM: Eliminating False Conflicts in Scalable MVCC in Disaggregated Memory
    Aoxin Wei, Jintian Wu, Jian Zhou, RunJie Yu, Ruijin Wu, Fei Wu
  3. RDPart: A reuse-based OS-level cache-partitioning policy for fairness optimization in cloud data centers
    Javier Aznal, Juan Carlos Saez, Carlos Bilbao

Session 5B — AI Acceleration

Thursday, October 1 · 9:00 – 10:15 · Venue: LT301

  1. AccESM: Packed-Total Exact Inference for CPU ESM2 Embedding
    Wenhao Sun, Panpan Cui, Yiqi Liu, Wanyu Wang
  2. Pagoda: Time and Energy Rooflines for DNN Workloads on Edge Accelerators Across Power Modes
    Prashanthi S. K., Kunal Kumar Sahoo, Amartya Ranjan Saikia, Pranav Gupta, Atharva Vinay Joshi, Priyanshu Pansari, Yogesh Simmhan
  3. MX-KMeans: Accelerating K-Means Clustering through Microscaling Quantization
    Rongtian Fu, Dongbo Lv, Xueying Wang, Shigang Li

Session 5C — Serverless Computing

Thursday, October 1 · 9:00 – 10:15 · Venue: LT701

  1. AeroFlow: Accelerating Serverless Workflows through Serialization-Free WebAssembly Execution
    Wang Xiong, Zhida Jiang, Zhuocheng Ge, Xi Wang, Chuan Luo, Tianyu Wo, Chunming Hu, Renyu Yang
  2. MOPAR: A Model Partitioning Framework for Deep Learning Inference Services on Serverless Platforms
    Jiaang Duan, Shiyou Qian, Hanwen Hu, Jian Cao, Guangtao Xue
  3. RSC: Enabling High-Performance RDMA for Serverless Services with Adaptive Network Multiplexing
    Wendi Song, Guangping Xu, Yangyang Fan, Yu Li, Lei Yang, Yunjie Li

Session 5D — Parallel Data Processing

Thursday, October 1 · 9:00 – 10:15 · Venue: LT702

  1. Chapel for Parallel AND Distributed GPU Computing: A Case Study with Jaccard Similarity
    Paul Sathre, Wu-chun Feng
  2. Parallel Prefix Filter Search for Weighted Jaccard Similarity
    Sankalpa Pokharel, Alima Subedi, Elizabeth Oluwadamilola Durowoju, Satish Puri
  3. SimPattern: A Novel Byte-Pattern Matching based Chunk Similarity Detection for Post-Deduplication
    Zhenyu Cai, Xuming Ye, Wenlong Tian, Ruixuan Li, Haozhao Wang, Jianfeng Lu, Zhenrui He, Zhiyong Xu, Palash Yuvraj Ingle

Session 6A — AI Caching

Thursday, October 1 · 10:45 – 12:00 · Venue: AUD302

  1. PINCH: Predictive Importance-Sampling-Informed Cache for I/O-Bound DNN Training
    Yuchen Liu, Shu Yin
  2. Edge-Cloud Collaborative RAG with Multi-State Semantic Caching
    Kang Liu, Guangping Xu, Yaru Fu, Mingyuan Ding, Yuxin Wu, Junhui Li, Lei Yang
  3. MIGServe: Layout-Aware Multi-Instance GPU Management for Efficient LLM Serving
    Jianwen Chen, Yunkai Liang, Bin Gao, Zhi Zhou, Fei Xu, Xu Chen, Deke Guo

Session 6B — Learning-Based Scheduling

Thursday, October 1 · 10:45 – 12:00 · Venue: LT301

  1. ReLA: Representation Learning and Aggregation for Scalable Job Scheduling with Reinforcement Learning
    Zhengyi Kwan, Wei Zhang, Aik Beng Ng, Zhengkui Wang, Simon See
  2. Scalable RL-Based Online Scheduling Framework for Modular Process Systems
    Mingrui Yin, Hao Zhang, Chenxin Cai, Jie Liu
  3. BP-MDS: Million-Scale Approximate CVRP in Minutes via Parallel Divide-and-Conquer
    Chekkala Sandeep Reddy, Lakshya Rani P, Somesh Singh, Rajesh Pandian Muniasamy, Rupesh Nasre

Session 6C — Network Algorithms

Thursday, October 1 · 10:45 – 12:00 · Venue: LT701

  1. Scalable Exact Path Selection via Structure-Aware Search for Virtual Payment Channels
    Jiangnan Luo, Zhebei Shen, Yuan Zhang, Sheng Zhong
  2. Asynchronous Dispersion with Optimal Time Complexity
    Debasish Pattanayak, Ajay D. Kshemkalyani, Manish Kumar, Anisur Rahaman Molla, Gokarna Sharma
  3. CrossServe: Cross-Layer Scheduling for SLO Optimization in Multi-Tenant LLM Serving
    Jiahe Li, Jiabin Li

Session 6D — Performance Analysis and Modeling II

Thursday, October 1 · 10:45 – 12:00 · Venue: LT702

  1. Async-Checkpoint: Redesigning Gradient Checkpointing with Asynchronous Execution
    Changhao Ma, Suping Wu, Jiawei Dai, Jie Yang, Hao Xu, Dong Qiang
  2. Offline Signal Reconstruction and Time-dependent Roofline analysis for Always-on Monitoring
    Bengisu Elis, Cristian Santiago Vargas Ortiz, Josef Weidendorfer, Martin Schulz
  3. GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning
    Jiaqi Wang, Jingwei Sun, Jiyu Luo, Han Li, Guangzhong Sun

Session 7A — Sparse Linear Algebra II

Thursday, October 1 · 13:00 – 14:40 · Venue: AUD302

  1. TFS: Tile-Aware SpMM–GeMM Fusion for Accelerating GNN Inference on Intel AMX
    Xiao Yan, Haodong Bian, Xiaoying Wang, Tengfei Cao, Jianqiang Huang
  2. CoTC-SpMM: A Cooperative Tensor–CUDA Cores Scheme for Efficient Sparse Matrix Multiplication
    Qin Du, Shengle Lin, Yuedan Chen, Guoqing Xiao, Marc Casas, Kenli Li
  3. RODIS: Accelerating Sparse Matrix Multiplication on GPU via Row-Orchestration and Dynamic Instruction Scheduling
    Jianfeng Cui, Bo Yuan, Zekun Jiang, Kai Lu, Sheng Liu
  4. TileSpMM: A Variable-Size Tiled Algorithm for Sparse Matrix-Matrix Multiplication on Tensor Cores
    Hongwei Zeng, Shuqin Feng, Haocheng Lian, Yuechen Lu, Weifeng Liu

Session 7B — Data-Center Networks

Thursday, October 1 · 13:00 – 14:40 · Venue: LT301

  1. ActiveRDMA: SmartNIC-offloaded, Multi-Step RDMA operations
    Jerónimo Sánchez García, Peter-Jan Gootzen, Raphaël Frantz, Zach Tiffany, Manjunath Gorentla Venkata, Juan José Vegas Olmos, Sokol Kosta, Flavio Vella, Salvatore Di Girolamo
  2. Coflow Scheduling in Hybrid-Switched Data Center Networks under Not-All-Stop Reconfiguration
    Xin Wang, Hong Shen, Hui Tian
  3. PipeTree: Decision Tree Partitioning for Efficient Inference on Programmable Switches
    Jiawei Huang, Xin Li, Yijun Li, Xiaojuan Lu, Zhaoyi Li, Tao Zhang, Jingling Liu, Zhangwen Lu, Shaodong Huang
  4. Bypass-Enabled Topology-Agnostic Multicast Router for Fault-Tolerant Network-on-Chips
    Juntae Jung, Tae Hee Han

Session 7C — Distributed Learning

Thursday, October 1 · 13:00 – 14:40 · Venue: LT701

  1. Low-bit and Sparsified Gradient Communication for Accelerating Distributed Deep Learning with Convergence Guarantees
    Jiaqi Li, Shaohuai Shi, Jing Peng, Tiejun Wang, Jiqing Gu, Xi Wu
  2. Decentralized Learning with Communication-Efficient Learned Gradient Sketches
    Zehua Cheng, Wei Dai, Jiahao Sun
  3. DiCTR: A Distributed Lightweight Second-Order Optimization Algorithm for Deep Model Training
    Ruidong Yan, Liang Jin, Li Wang, Hongwei Zhang, Zhenhua Guo, Yinan Tang
  4. Towards High-Fidelity yet Low-Overhead Gradient Compression for In-Network Aggregation
    Jin Wang, Chenye Zhu, Jinbin Hu

Session 7D — Parallel Training

Thursday, October 1 · 13:00 – 14:40 · Venue: LT702

  1. OmniPipe: Efficient, Flexible and Scalable Pipeline Parallelism for Large Model Training
    Jun Li, Zhi Ma, Shigang Li
  2. Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
    Long Zhao, Qinghe Wang, Jiaan Zhu, Youhui Bai, Zewen Jin, Chaoyi Ruan, Shannon Wang, Cheng Li
  3. Memory-Aware Joint Optimisation of Partitioning and Scheduling for Pipeline-Parallel Training
    Ning Wang, Andrea Raith, Oliver Sinnen
  4. Chameleon: Adaptive Bidirectional Pipeline Parallelism for Edge Collaborative Training
    Tao Liu, Xiangpeng Hou, Liying Li, Peijin Cong, Dan Meng, Junlong Zhou

Session 8A — GEMM Optimization

Thursday, October 1 · 15:10 – 16:50 · Venue: AUD302

  1. TileGEMM: Boosting the Performance of GEMM on AMX-Powered CPUs by Exploiting Data Reuse
    Kangkang Chen, Huayou Su, Menghan Jia, Yong Dou
  2. BAG: Faster Matrix Multiplication on a Single GPU
    Yao Liu, Yewen Li, Zhonghai Zhang, Erlin Yao, Guangming Tan, Weile Jia
  3. MAGSAT: Memory-Access-Guided Fusion and Shape-Adaptive Auto-Tuning for Dynamic Tensor Programs
    Haodong Deng, Jianuo Sheng, Wenhao Dai, Fangxin Liu, Qingxiao Sun
  4. RapidGEMM: An Efficient Tile-agnostic GEMM for Mixture-of-Experts Training
    Le Xu, Yutao Sun, Yingbo Hao, Li Dong, Yilei Yang, Weijiang Xu, Youshan Miao, Hangbo Bao, Furu Wei, Qiong Luo

Session 8B — Cloud Scheduling

Thursday, October 1 · 15:10 – 16:50 · Venue: LT301

  1. QMScaler: A QoS-Constrained Resource-Efficient Microservice Autoscaling Framework for Edge Environments
    Tianyang Zheng, Pengfei Yang, Zhe Xu, Wenkai Lv, Hui Zeng, Hui Li, Shenwei Xu, Quan Wang
  2. Microservices Scheduling with ReS Model: Characterization, Regulation and Metrics
    Zichen Xu, Zijun Li, Quan Chen, Jiuchen Shi, Zhuang Yang, Zhen Wang, Qisong Zheng, Wenjie Zhang, Minyi Guo
  3. FaaSHive: Addressing Limited Visibility in Function-as-a-Service via Worker-driven Scheduling
    Seonggyu Han, Sangwoong Kim, Minho Kim, Myeongjae Jeon, Daehoon Kim

Session 8C — Federated Learning

Thursday, October 1 · 15:10 – 16:50 · Venue: LT701

  1. SCPFL: A Safety Reinforcement Learning Framework for Joint Energy-Fairness Optimization in Long-term Federated Learning
    Siwei Xue, Gang Li
  2. Scaling Synthetic-Image Pre-Training for Federated Fine-Tuning of Large Vision Models
    Qianpiao Ma, Xiaozhu Song, Junlong Zhou, Yue Zeng, Jianchun Liu, Huaqing Tu
  3. Tensos: Fast and Accurate Federated GBDT Training via Tentative Feature Shrinking on Stragglers
    Shipeng Hu, Guangyan Zhang, Junyu Wei, Yang Wang, Jiming Xu

Session 8D — Scientific Computing II

Thursday, October 1 · 15:10 – 16:50 · Venue: LT702

  1. MillionQAOA: A Dividable QAOA Framework for Solving Million-Vertex-Scale Max-Cut Problems
    Xie-Ru Li, Po-Hsuan Huang, Chia-Heng Tu, Shih-Hao Hung
  2. Bit-Efficient Tensor Core Acceleration for High-Order Shallow-Water Dynamical Core
    Jienan Yao, Lilong Zhou, Heng Li, Wei Xue
  3. A Low-Overhead, Lightweight, Lossless GPU Compression Algorithm for Numerical Simulations
    Téodora Hovi, François Letierce, Laurent Lucas