Conference Program
Program at a Glance
ICPP 2026 takes place September 28 - October 1, 2026. Workshops and tutorials are held on Monday, September 28; the main conference runs Tuesday, September 29 through Thursday, October 1.
The program features 117 full papers, 8 posters, 4 demonstrations, 13 workshop papers, and 2 tutorials.
Download the conference booklet (PDF)
Sessions are held at NTU@one-north on levels 3 and 7. Room codes below refer to Auditorium 302 (AUD302), Lecture Theatres 301/701/702 (LT301, LT701, LT702) and Seminar Rooms 703/706 (SR703, SR706); see the floor plans for how to find them.
| Day | Highlights |
|---|---|
| Mon, 28 Sep — Workshops & Tutorials | 5 workshops and 2 tutorials |
| Tue, 29 Sep — Main Conference Day 1 | Opening · Keynotes 1–2 · Sessions 1A–2D · Posters & Demos · Reception |
| Wed, 30 Sep — Main Conference Day 2 | Keynotes 3–4 · Sessions 3A–4D · Banquet |
| Thu, 1 Oct — Main Conference Day 3 | Sessions 5A–8D |
Monday, September 28 — Workshops and Tutorials
Tutorial abstracts and agendas, and links to each workshop's own website, are on the Workshops and Tutorials page.
Tuesday, September 29 — Main Conference Day 1
| Time | Program |
|---|---|
| 8:45–9:00 | Opening · AUD302 |
| 9:00–10:00 | Keynote 1: Xian-He Sun, Illinois Institute of Technology From Scalable Computing to the Scaling Law: A Reexamination of Parallel Processing · AUD302 |
| 10:00–10:30 | Tea Break · Function Hall (Level 3) |
| 10:30–12:10 | 1A — MoE Systems · AUD302 1B — Disaggregated Memory · LT301 1C — Scientific Computing I · LT701 1D — Compiler Optimization · LT702 |
| 12:10–13:40 | Lunch · Function Hall (Level 3) |
| 13:40–14:40 | Keynote 2: Torsten Hoefler, ETH Zurich Ultra Ethernet for Next-Generation AI and HPC Workloads · AUD302 |
| 14:40–15:10 | Tea Break · Function Hall (Level 3) |
| 15:10–16:50 | 2A — LLM Inference and Serving I · AUD302 2B — Processing-in-Memory · LT301 2C — Numerical Computing · LT701 2D — Graph Algorithms · LT702 |
| 17:00–18:00 | Posters and Demonstrations · Function Hall (Level 3) |
| 18:00–20:00 | Reception · Function Hall (Level 3) |
Wednesday, September 30 — Main Conference Day 2
| Time | Program |
|---|---|
| 9:00–10:00 | Keynote 3: Xiaowen Chu, The Hong Kong University of Science and Technology (Guangzhou) Efficient LLM Serving via Compression-Centric Optimizations · AUD302 |
| 10:00–10:30 | Tea Break · Function Hall (Level 3) |
| 10:30–12:10 | 3A — LLM Inference and Serving II · AUD302 3B — Key-Value Stores · LT301 3C — Hardware Acceleration · LT701 3D — Graph Learning · LT702 |
| 12:10–13:40 | Lunch · Function Hall (Level 3) |
| 13:40–14:40 | Keynote 4: Li-Shiuan Peh, National University of Singapore Parallel Computing on Ultra-Low-Power Chips · AUD302 |
| 14:40–15:10 | Tea Break · Function Hall (Level 3) |
| 15:10–16:50 | 4A — LLM Inference and Serving III · AUD302 4B — Storage Systems · LT301 4C — Sparse Linear Algebra I · LT701 4D — Performance Analysis and Modeling I · LT702 |
| 17:15 | Shuttle from NTU@one-north to Banquet |
| 18:30–21:00 | Banquet — The Ballroom @ Mount Faber Peak |
| 21:00 | Shuttle from Mount Faber Peak to Park Avenue Rochester |
Thursday, October 1 — Main Conference Day 3
| Time | Program |
|---|---|
| 9:00–10:15 | 5A — Memory Management · AUD302 5B — AI Acceleration · LT301 5C — Serverless Computing · LT701 5D — Parallel Data Processing · LT702 |
| 10:15–10:45 | Tea Break · Function Hall (Level 3) |
| 10:45–12:00 | 6A — AI Caching · AUD302 6B — Learning-Based Scheduling · LT301 6C — Network Algorithms · LT701 6D — Performance Analysis and Modeling II · LT702 |
| 12:00–13:00 | Lunch · Function Hall (Level 3) |
| 13:00–14:40 | 7A — Sparse Linear Algebra II · AUD302 7B — Data-Center Networks · LT301 7C — Distributed Learning · LT701 7D — Parallel Training · LT702 |
| 14:40–15:10 | Tea Break · Function Hall (Level 3) |
| 15:10–16:50 | 8A — GEMM Optimization · AUD302 8B — Cloud Scheduling · LT301 8C — Federated Learning · LT701 8D — Scientific Computing II · LT702 |
| 16:50 | Conference closes |
Technical Sessions
Papers are listed in presentation order.
Session 1A — MoE Systems
Tuesday, September 29 · 10:30 – 12:10 · Venue: AUD302
- MigMoE: Task-Aware Expert Migration for Faster and More Balanced Expert-Parallel MoE Inference
Xueyuan Han, Zinuo Cai, Zhuolong Jiang, Rui Zhang, Ruhui Ma - CARE-MoE: Correlation-Aware Expert Placement and Semantic Equivalence Routing for MoE LLM Inference on Edge Devices
Zhenyu Wang, Wei Li, Ao Ren, Duo Liu, Bo Zhang, Kan Zhong, Chaoxia Qin, Haoyang Li - BR-MoE: A Memory-Budget-Aware Co-Design Framework for Efficient MoE Inference on Resource-Constrained GPUs
Lei Jiang, Jingwei Sun, Junqing Lin, Han Li, Mingge Lu, Yinghua Zhou, Guangzhong Sun - Fine-grained Computation-Communication Overlap via Tile-level Signaling and Scheduling for Mixture-of-Experts
Minyu Cui, Anna Wingkvist, Morgan Ericsson
Session 1B — Disaggregated Memory
Tuesday, September 29 · 10:30 – 12:10 · Venue: LT301
- Aethon: Performance-aware Memory Offloading for Co-running Applications in Public Clouds
Guangqiang Luan, Pu Pang, Quan Chen, Chen Chen, Wenda Tang, Deze Zeng, Li Li, Senbo Fu, Miaohe Lin, Xueqi Wu, Qian Peng, Minyi Guo - Duet: Orchestrating Full-Duplex-Aware Proactive Demotion in CXL Tiered Memory
Shengsong Kong, Lizhao Zhang, Shufan He, Zhenzhou Ji, Zhongchuan Fu, Malik Saad Nawaz, Yifan Wan, Yue Yu, Yinghao Zheng, Tianyu Hu, Kim Jei, Yufa Yang - MEDO: Adaptive Multi-Stream Data Offloading for Efficient Management of Disaggregated Memory Pool
Jing Wang, Hanzhang Yang, Chao Li, Xinkai Wang, Taolei Wang, Jinyang Guo, Minyi Guo, Jie Meng, Shuangfu Zeng - Breaking the Migration Barrier: Hardware-Software Co-Designed Translation Coherence for Tiered Memory
Fengkun Dong, Shaoxuan He, Wei Long, Guoqing Xiao, Wangdong Yang, Kenli Li, Marc Casas
Session 1C — Scientific Computing I
Tuesday, September 29 · 10:30 – 12:10 · Venue: LT701
- Large-Scale Quantum Circuit Simulation on HPC Cluster via Cache Blocking, Boosting, and Gate Fusion Optimization
Chuan-Chi Wang, Yan-Jie Wang, Chia-Heng Tu, Shih-Hao Hung - ZSWP: Rollback-Free Spherical ε-Join for Scalable Astronomical Cross-Matching on Heterogeneous Supercomputer Architectures
Yuhao Yuan, Ce Yu, Jingwen Xing, Hao Fu, Yajie Zhang, Chen Wang, Bin Yang - High-Performance Virtual Screening Based on Parallel Molecular Dynamics Simulations with Early Termination
Shingo Okuno, Natsuki Kanazawa, Takuto Koyama, Takashi Katoh, Shigeyuki Matsumoto, Yasushi Okuno - AtomFlow: Accelerating GNN-Based Molecular Dynamics with ab initio Accuracy on Fugaku Supercomputer
Yiming Du, Mingzhen Li, Lijun Liu, Guangming Tan, Weile Jia
Session 1D — Compiler Optimization
Tuesday, September 29 · 10:30 – 12:10 · Venue: LT702
- In-Copy Fusion: Runtime Argument Fusion for Efficient OpenMP GPU Offloading
Dionysios-Odysseas Sotiropoulos, Sara Royuela Alcázar, Eduardo Quiñones, Alessandro Capotondi, Andrea Marongiu - Adaptive Operator Fusion with Subproblem Decomposition for Enhanced Memory Efficiency
Heng Shi, Xiaofeng Guan, Jianguo Yao - Thinking Globally, Acting Locally: Merge Sort's Auto-Vectorization on Shuffle-Heavy ISAs
Jincheng Zhou, Jin Zhang, Xiang Zhang, Tiaojie Xiao, Chunye Gong - A SYCLic Investigation of SYCL Ecosystems: UniSYCL for Heterogeneous Scaling
Nabayan Chaudhury, Norihisa Fujita, Beau Johnston, Taisuke Boku, Wu-chun Feng
Session 2A — LLM Inference and Serving I
Tuesday, September 29 · 15:10 – 16:50 · Venue: AUD302
- RPSC: Robust LLM Scheduling by Tolerating Prediction Inaccuracy and Mitigating Tail Latency
Guosheng Xiao, Xuan Mo, Jialun Li, Weigang Wu - S2PAR: Scalable Surface Code Ancilla Routing Card for Distributed Fault-Tolerant Quantum Computing
Samuel Stein, Shuwen Kan, Charles Guinn, Esin Tureci, Guus Avis, Chenxu Liu, Zefan Du, Margaret Martonosi, Stefan Krastanov, Ying Mao, Andrew A. Houck, Ang Li - WAQ-LLM: Optimizing Multi-Instance LLM Deployment via Workload-Aware Queueing Model
Jiaxin Lai, Yizhou Luo, Qiang Wang - Heterogeneous SLO Guaranteed Multi-Resource-Aware Batching in LLM Serving
Haiying Shen, Tanmoy Sen, Yuxiong He
Session 2B — Processing-in-Memory
Tuesday, September 29 · 15:10 – 16:50 · Venue: LT301
- Cuckoo-GPU: Accelerating Cuckoo Filters on Modern GPUs
Tim Dortmann, Markus Vieth, Bertil Schmidt - Query Density-Driven Partitioning for Spatiotemporal Load Balancing on Processing-in-Memory Systems
Takato Hideshima, Shigeyuki Sato, Tomoharu Ugawa - PIM-Pai: Boosting the Performance of Index Structures with Minimal Effort on Processing-in-Memory Architecture
Lixiao Cui, Kedi Yang, Zhuoran Wang, Xinming Yuan, Yusen Li, Gang Wang, Xiaoguang Liu - PIM-Forge: Toward Autonomous PIM Kernel Synthesis through Constraint-Guided Hardware Exploration
Yixing Du, Qingyun Tang, Lixiao Cui, Yusen Li, Gang Wang, Xiaoguang Liu
Session 2C — Numerical Computing
Tuesday, September 29 · 15:10 – 16:50 · Venue: LT701
- VILIB++: High Performance C++ Library for Auto-Vectorizing Interval Arithmetic
Xingjian Qi, Robert Strzodka - From 2N to N2: Tree-Free Scalable Sparse Symmetric Tucker Decomposition
Yongseok Soh, Shruti Shivakumar, Jiajia Li, Jee Choi, Ramakrishnan Kannan - High-Performance Star-M SVD for Big Data Compression
Md Taufique Hussain, Grey Ballard, Aditya Devarakonda, Srinivas Eswar, Naman Pesricha, Vishwas Rao - Elasticity in Parallel Sparse Triangular Solve
Raphael Steiner, Christos Matzoros, Pál András Papp, Toni Boehnlein, Albert-Jan Yzelman
Session 2D — Graph Algorithms
Tuesday, September 29 · 15:10 – 16:50 · Venue: LT702
- Sparsity-aware Fine-grained Parallelization for Set Intersection Computations in Graph Datasets
Atharva Gondhalekar, Wu-chun Feng - Contraction Hierarchies for Parallel Sequence-to-Graph Alignment
Aranya Banerjee, Srinivas Aluru - SQUASH: Distributed Square Estimation with Provable Error Bounds for Dynamic Graphs
Shaikh Arifuzzaman, Shubhashish Kar - DyGMIS: Fast and Scalable Fully Dynamic MIS Maintenance on Large Evolving Graphs
Prajjwal Nijhara, Agam Harpreet Singh, Aditya Trivedi, Dip Sankar Banerjee
Session 3A — LLM Inference and Serving II
Wednesday, September 30 · 10:30 – 12:10 · Venue: AUD302
- ReliefServe: Relieving GPU Pressure in Multi-Model Serving via Selective CPU Escape
Shijie Peng, Yanying Lin, Chengzhi Lu, Shuaipeng Wu, Chengzhong Xu, Kejiang Ye - AsymFlow: Enabling Long-Context LLM Serving via CPU-GPU Prefill-Decode Disaggregation
Junwen Zhang, Weiling Yang, Jianbin Fang, Enda Yu, Dezun Dong - IHS-LM: Intra-batch Hybrid Scheduling and Layer Migration for VLM Pipeline Inference Acceleration on Edge Devices
Yun Li, Tianfu Pang, Zhiyu Cai, Zhenxiang Pan, Yingchi Mao, Jie Wu - Cross-Layer Performance Analysis of Single-GPU Large Language Model Inference
Zongxing Zhao, Xiaqing Li, Zekai Meng, Zhengjun Fu, Qian Wang, Yanling Zhang, Yidong Li
Session 3B — Key-Value Stores
Wednesday, September 30 · 10:30 – 12:10 · Venue: LT301
- ZNStore: Decomposing the B+Tree Write Path for Zoned Namespace SSDs
Bo Chen, Jinlei Hu, Chengxiao Gong, Jianxi Chen, Dan Feng - HGB+-Tree: An Hourglass-like B+-tree for Persistent Memory
Hai Yang, Chaoshu Yang, Runyu Zhang, Yu Peng - CmptQuiet: Optimizing Tail Latency and Throughput in LSM-Tree Key-Value Stores via Contention-Aware Compaction
Jiufei Liu, Kaiyuan Xu, Shu Yin - Breaking the Single-Entry Bottleneck: Dynamic Write Routing for Heterogeneous Key-Value Stores
Ruisong Zhou, Liang Bao, Haijun Zhang, Peng Wang, Chunhua Li, Ke Zhou
Session 3C — Hardware Acceleration
Wednesday, September 30 · 10:30 – 12:10 · Venue: LT701
- Algorithm–Hardware Co-Design of Spiking Transformers for In-Memory Neuromorphic Edge Vision
Yixing Li, Wenhua Hu, Haohui Peng, Hongjiang Deng, Mengying Hu, Jianwen Xiang, Rui Hao - AIE-HE: Accelerating Client-Side Processing of Homomorphic Encryption on AMD AI Engine
Haruto Katakura, Ai Nozaki, Motoharu Tsuboi, Takuya Kojima, Hiroshi Nakamura, Hideki Takase - RayFST: Accelerating Finite-State Transducer Composition with Ray Tracing Cores
Tianao Ge, Xiaowen Chu, Hongyuan Liu - A Neuromorphic Dual-Stage Swin Transformer for Wetland Classification on Edge Platforms
Hongjiang Deng, Wenhua Hu, Haohui Peng, Yixing Li, Mengying Hu, Jianwen Xiang, Rui Hao
Session 3D — Graph Learning
Wednesday, September 30 · 10:30 – 12:10 · Venue: LT702
- ATLAS: Enabling an Asynchronous State-Aware Pipeline for Efficient Training of Temporal Graph Neural Networks
Yongchun Jiang, Yongchao Liu, Kaifan Jia, Heng Zhang - FAST: A Holistic Framework for Optimizing Memory-I/O, Computation, and Sampling in Temporal GNN Training
Yushu Cai, Qingrui Zhu, Lei Liu, Kai Sheng, Hao Chen, Xin He - PruneInfer: Exact Full-Neighborhood GNN Inference of Large Datasets on a Single GPU via Full Topology Pruning
Liyang Wu, Menghan Jia, Chunye Gong, Xinhai Chen, Pan Dong, Dongsheng Li - Tempest: A GPU-Accelerated Engine for Streaming Temporal Random Walks
Md Ashfaq Salehin, George Parisis, Luc Berthouze
Session 4A — LLM Inference and Serving III
Wednesday, September 30 · 15:10 – 16:50 · Venue: AUD302
- NeuroPrefetcher: Storage-Aware Sparse LLM Inference via Delta Prefetching
Nobel Dhar, Md Romyull Islam, Xuechen Zhang, Gongjin Sun, Sahidul Islam, Bobin Deng, Kun Suo - SSQT: A Hardware-Friendly Fusion Compression Framework of Structured Sparsification and Sensitivity-Driven Quantization for Large-Scale Language Models
Qiansheng Song, Guolin Tang - Online Scheduling of Battery-Aware Speculative Decoding for Energy-Efficient Cloud-Edge Collaborative LLM Inference
Hengdi Wang, Lei Jiao, Konglin Zhu, Lin Zhang - GroupKV: Hierarchical KV Cache Management for Long-Context Diffusion LLM Inference
Jinhao Wang, Zhexin Hu, Kangjie Zhou, Xin Zhou, Fangfang Liu
Session 4B — Storage Systems
Wednesday, September 30 · 15:10 – 16:50 · Venue: LT301
- PG-Tune: Prediction-Guided Distributed Storage System Tuning without Repeated Online Benchmarking
Weiming Zhang, Chengyu Ma, Haijun Zhang, Yu Liu, Peng Wang, Xiaojun Guo, Fengkui Yang, Ke Zhou - Toward Continuous Service in Enterprise-Level Distributed Block Storage Systems
Jun Li, Liang Chen, Wenzhang Wu, Mingzhe Hu - DdlRT: A deterministic data layout for efficient redundancy transitioning in erasure-coded systems
Xiaotong Geng, Haoqi Duan, Liangliang Xu, Tingting Chen, Cunchen Hu - FNR: A Probabilistic Data Repair Scheme for Reed-Solomon Coded Storage Amid Network Fluctuations
Huizhao Feng, Yikun Hu, Zhen Luo, Tao Lu, Huizhang Luo, Kenli Li
Session 4C — Sparse Linear Algebra I
Wednesday, September 30 · 15:10 – 16:50 · Venue: LT701
- Hierarchical Shared Memory-Aware Optimization for TRSM on GPU Platforms
Xinzhe Chen, Haowei Li, Lijuan Hu, Wenjing Ma, Fangfang Liu - DB-SpMSpV: Dual-View Blocked Sparse Matrix-Sparse Vector Multiplication for Dynamic GPU Workloads
Xing Cong, Chenhao Xie, Rui Wang, Zhongzhi Luan, Yi Liu, Depei Qian - AFH-SpMM: Auto-Fit Heterogeneous Block Sparse-Dense Matrix Multiplication on Tensor Core GPUs
Zhirui Chen, Heng Zhang, Kaifan Jia - RSH-SpMM: A Row-Structured Hybrid Kernel for Sparse Matrix-Matrix Multiplication on GPUs
Aiying Li, Jingwei Sun, Han Li, Wence Ji, Junqing Lin, Guangzhong Sun
Session 4D — Performance Analysis and Modeling I
Wednesday, September 30 · 15:10 – 16:50 · Venue: LT702
- Revealing NVIDIA Closed-Source Driver Command Streams for CPU–GPU Runtime Behavior Insight
Yuang Yan, Ian Karlin, Ryan Grant - MServerSim: A Modular Design based Simulation Technique for Modern AI Servers
Rengang Li, Yinan Tang, Ruidong Yan, Zhenhua Guo, Endong Wang - StreamTrace: Fast Trace Analysis for Large-Scale Parallel Applications on a Single Node
Yuyang Jin, Jidong Zhai - Vadar: Runtime Performance Variance Detection and Diagnosis for Parallel Applications
Yifan Jia, Shuang Niu, Yuhang Hu, Chunbao Zhou, Ningming Nie, Jue Wang, Yangang Wang
Session 5A — Memory Management
Thursday, October 1 · 9:00 – 10:15 · Venue: AUD302
- Governing Global ASID/PCID Management for QoS Isolation in Shared-Kernel Mixed-Priority Systems
Zhaomeng Deng, Ziqi Zhang, Peng Jiang, Yunfeng Ye, Yuxin Ren, Ning Jia, Xinwei Hu, Yao Guo, Ding Li - MiTDM: Eliminating False Conflicts in Scalable MVCC in Disaggregated Memory
Aoxin Wei, Jintian Wu, Jian Zhou, RunJie Yu, Ruijin Wu, Fei Wu - RDPart: A reuse-based OS-level cache-partitioning policy for fairness optimization in cloud data centers
Javier Aznal, Juan Carlos Saez, Carlos Bilbao
Session 5B — AI Acceleration
Thursday, October 1 · 9:00 – 10:15 · Venue: LT301
- AccESM: Packed-Total Exact Inference for CPU ESM2 Embedding
Wenhao Sun, Panpan Cui, Yiqi Liu, Wanyu Wang - Pagoda: Time and Energy Rooflines for DNN Workloads on Edge Accelerators Across Power Modes
Prashanthi S. K., Kunal Kumar Sahoo, Amartya Ranjan Saikia, Pranav Gupta, Atharva Vinay Joshi, Priyanshu Pansari, Yogesh Simmhan - MX-KMeans: Accelerating K-Means Clustering through Microscaling Quantization
Rongtian Fu, Dongbo Lv, Xueying Wang, Shigang Li
Session 5C — Serverless Computing
Thursday, October 1 · 9:00 – 10:15 · Venue: LT701
- AeroFlow: Accelerating Serverless Workflows through Serialization-Free WebAssembly Execution
Wang Xiong, Zhida Jiang, Zhuocheng Ge, Xi Wang, Chuan Luo, Tianyu Wo, Chunming Hu, Renyu Yang - MOPAR: A Model Partitioning Framework for Deep Learning Inference Services on Serverless Platforms
Jiaang Duan, Shiyou Qian, Hanwen Hu, Jian Cao, Guangtao Xue - RSC: Enabling High-Performance RDMA for Serverless Services with Adaptive Network Multiplexing
Wendi Song, Guangping Xu, Yangyang Fan, Yu Li, Lei Yang, Yunjie Li
Session 5D — Parallel Data Processing
Thursday, October 1 · 9:00 – 10:15 · Venue: LT702
- Chapel for Parallel AND Distributed GPU Computing: A Case Study with Jaccard Similarity
Paul Sathre, Wu-chun Feng - Parallel Prefix Filter Search for Weighted Jaccard Similarity
Sankalpa Pokharel, Alima Subedi, Elizabeth Oluwadamilola Durowoju, Satish Puri - SimPattern: A Novel Byte-Pattern Matching based Chunk Similarity Detection for Post-Deduplication
Zhenyu Cai, Xuming Ye, Wenlong Tian, Ruixuan Li, Haozhao Wang, Jianfeng Lu, Zhenrui He, Zhiyong Xu, Palash Yuvraj Ingle
Session 6A — AI Caching
Thursday, October 1 · 10:45 – 12:00 · Venue: AUD302
- PINCH: Predictive Importance-Sampling-Informed Cache for I/O-Bound DNN Training
Yuchen Liu, Shu Yin - Edge-Cloud Collaborative RAG with Multi-State Semantic Caching
Kang Liu, Guangping Xu, Yaru Fu, Mingyuan Ding, Yuxin Wu, Junhui Li, Lei Yang - MIGServe: Layout-Aware Multi-Instance GPU Management for Efficient LLM Serving
Jianwen Chen, Yunkai Liang, Bin Gao, Zhi Zhou, Fei Xu, Xu Chen, Deke Guo
Session 6B — Learning-Based Scheduling
Thursday, October 1 · 10:45 – 12:00 · Venue: LT301
- ReLA: Representation Learning and Aggregation for Scalable Job Scheduling with Reinforcement Learning
Zhengyi Kwan, Wei Zhang, Aik Beng Ng, Zhengkui Wang, Simon See - Scalable RL-Based Online Scheduling Framework for Modular Process Systems
Mingrui Yin, Hao Zhang, Chenxin Cai, Jie Liu - BP-MDS: Million-Scale Approximate CVRP in Minutes via Parallel Divide-and-Conquer
Chekkala Sandeep Reddy, Lakshya Rani P, Somesh Singh, Rajesh Pandian Muniasamy, Rupesh Nasre
Session 6C — Network Algorithms
Thursday, October 1 · 10:45 – 12:00 · Venue: LT701
- Scalable Exact Path Selection via Structure-Aware Search for Virtual Payment Channels
Jiangnan Luo, Zhebei Shen, Yuan Zhang, Sheng Zhong - Asynchronous Dispersion with Optimal Time Complexity
Debasish Pattanayak, Ajay D. Kshemkalyani, Manish Kumar, Anisur Rahaman Molla, Gokarna Sharma - CrossServe: Cross-Layer Scheduling for SLO Optimization in Multi-Tenant LLM Serving
Jiahe Li, Jiabin Li
Session 6D — Performance Analysis and Modeling II
Thursday, October 1 · 10:45 – 12:00 · Venue: LT702
- Async-Checkpoint: Redesigning Gradient Checkpointing with Asynchronous Execution
Changhao Ma, Suping Wu, Jiawei Dai, Jie Yang, Hao Xu, Dong Qiang - Offline Signal Reconstruction and Time-dependent Roofline analysis for Always-on Monitoring
Bengisu Elis, Cristian Santiago Vargas Ortiz, Josef Weidendorfer, Martin Schulz - GCL-Sampler: Discovering Kernel Similarity for Sampled GPU Simulation via Graph Contrastive Learning
Jiaqi Wang, Jingwei Sun, Jiyu Luo, Han Li, Guangzhong Sun
Session 7A — Sparse Linear Algebra II
Thursday, October 1 · 13:00 – 14:40 · Venue: AUD302
- TFS: Tile-Aware SpMM–GeMM Fusion for Accelerating GNN Inference on Intel AMX
Xiao Yan, Haodong Bian, Xiaoying Wang, Tengfei Cao, Jianqiang Huang - CoTC-SpMM: A Cooperative Tensor–CUDA Cores Scheme for Efficient Sparse Matrix Multiplication
Qin Du, Shengle Lin, Yuedan Chen, Guoqing Xiao, Marc Casas, Kenli Li - RODIS: Accelerating Sparse Matrix Multiplication on GPU via Row-Orchestration and Dynamic Instruction Scheduling
Jianfeng Cui, Bo Yuan, Zekun Jiang, Kai Lu, Sheng Liu - TileSpMM: A Variable-Size Tiled Algorithm for Sparse Matrix-Matrix Multiplication on Tensor Cores
Hongwei Zeng, Shuqin Feng, Haocheng Lian, Yuechen Lu, Weifeng Liu
Session 7B — Data-Center Networks
Thursday, October 1 · 13:00 – 14:40 · Venue: LT301
- ActiveRDMA: SmartNIC-offloaded, Multi-Step RDMA operations
Jerónimo Sánchez García, Peter-Jan Gootzen, Raphaël Frantz, Zach Tiffany, Manjunath Gorentla Venkata, Juan José Vegas Olmos, Sokol Kosta, Flavio Vella, Salvatore Di Girolamo - Coflow Scheduling in Hybrid-Switched Data Center Networks under Not-All-Stop Reconfiguration
Xin Wang, Hong Shen, Hui Tian - PipeTree: Decision Tree Partitioning for Efficient Inference on Programmable Switches
Jiawei Huang, Xin Li, Yijun Li, Xiaojuan Lu, Zhaoyi Li, Tao Zhang, Jingling Liu, Zhangwen Lu, Shaodong Huang - Bypass-Enabled Topology-Agnostic Multicast Router for Fault-Tolerant Network-on-Chips
Juntae Jung, Tae Hee Han
Session 7C — Distributed Learning
Thursday, October 1 · 13:00 – 14:40 · Venue: LT701
- Low-bit and Sparsified Gradient Communication for Accelerating Distributed Deep Learning with Convergence Guarantees
Jiaqi Li, Shaohuai Shi, Jing Peng, Tiejun Wang, Jiqing Gu, Xi Wu - Decentralized Learning with Communication-Efficient Learned Gradient Sketches
Zehua Cheng, Wei Dai, Jiahao Sun - DiCTR: A Distributed Lightweight Second-Order Optimization Algorithm for Deep Model Training
Ruidong Yan, Liang Jin, Li Wang, Hongwei Zhang, Zhenhua Guo, Yinan Tang - Towards High-Fidelity yet Low-Overhead Gradient Compression for In-Network Aggregation
Jin Wang, Chenye Zhu, Jinbin Hu
Session 7D — Parallel Training
Thursday, October 1 · 13:00 – 14:40 · Venue: LT702
- OmniPipe: Efficient, Flexible and Scalable Pipeline Parallelism for Large Model Training
Jun Li, Zhi Ma, Shigang Li - Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism
Long Zhao, Qinghe Wang, Jiaan Zhu, Youhui Bai, Zewen Jin, Chaoyi Ruan, Shannon Wang, Cheng Li - Memory-Aware Joint Optimisation of Partitioning and Scheduling for Pipeline-Parallel Training
Ning Wang, Andrea Raith, Oliver Sinnen - Chameleon: Adaptive Bidirectional Pipeline Parallelism for Edge Collaborative Training
Tao Liu, Xiangpeng Hou, Liying Li, Peijin Cong, Dan Meng, Junlong Zhou
Session 8A — GEMM Optimization
Thursday, October 1 · 15:10 – 16:50 · Venue: AUD302
- TileGEMM: Boosting the Performance of GEMM on AMX-Powered CPUs by Exploiting Data Reuse
Kangkang Chen, Huayou Su, Menghan Jia, Yong Dou - BAG: Faster Matrix Multiplication on a Single GPU
Yao Liu, Yewen Li, Zhonghai Zhang, Erlin Yao, Guangming Tan, Weile Jia - MAGSAT: Memory-Access-Guided Fusion and Shape-Adaptive Auto-Tuning for Dynamic Tensor Programs
Haodong Deng, Jianuo Sheng, Wenhao Dai, Fangxin Liu, Qingxiao Sun - RapidGEMM: An Efficient Tile-agnostic GEMM for Mixture-of-Experts Training
Le Xu, Yutao Sun, Yingbo Hao, Li Dong, Yilei Yang, Weijiang Xu, Youshan Miao, Hangbo Bao, Furu Wei, Qiong Luo
Session 8B — Cloud Scheduling
Thursday, October 1 · 15:10 – 16:50 · Venue: LT301
- QMScaler: A QoS-Constrained Resource-Efficient Microservice Autoscaling Framework for Edge Environments
Tianyang Zheng, Pengfei Yang, Zhe Xu, Wenkai Lv, Hui Zeng, Hui Li, Shenwei Xu, Quan Wang - Microservices Scheduling with ReS Model: Characterization, Regulation and Metrics
Zichen Xu, Zijun Li, Quan Chen, Jiuchen Shi, Zhuang Yang, Zhen Wang, Qisong Zheng, Wenjie Zhang, Minyi Guo - FaaSHive: Addressing Limited Visibility in Function-as-a-Service via Worker-driven Scheduling
Seonggyu Han, Sangwoong Kim, Minho Kim, Myeongjae Jeon, Daehoon Kim
Session 8C — Federated Learning
Thursday, October 1 · 15:10 – 16:50 · Venue: LT701
- SCPFL: A Safety Reinforcement Learning Framework for Joint Energy-Fairness Optimization in Long-term Federated Learning
Siwei Xue, Gang Li - Scaling Synthetic-Image Pre-Training for Federated Fine-Tuning of Large Vision Models
Qianpiao Ma, Xiaozhu Song, Junlong Zhou, Yue Zeng, Jianchun Liu, Huaqing Tu - Tensos: Fast and Accurate Federated GBDT Training via Tentative Feature Shrinking on Stragglers
Shipeng Hu, Guangyan Zhang, Junyu Wei, Yang Wang, Jiming Xu
Session 8D — Scientific Computing II
Thursday, October 1 · 15:10 – 16:50 · Venue: LT702
- MillionQAOA: A Dividable QAOA Framework for Solving Million-Vertex-Scale Max-Cut Problems
Xie-Ru Li, Po-Hsuan Huang, Chia-Heng Tu, Shih-Hao Hung - Bit-Efficient Tensor Core Acceleration for High-Order Shallow-Water Dynamical Core
Jienan Yao, Lilong Zhou, Heng Li, Wei Xue - A Low-Overhead, Lightweight, Lossless GPU Compression Algorithm for Numerical Simulations
Téodora Hovi, François Letierce, Laurent Lucas