arXiv Preprint
Swimba: Switch Mamba Model Scales State Space Models
Zhixu Du, Krishna Teja Chitty-Venkata, Murali Emani, Venkatram Vishwanath, H. Helen Li, Yiran Chen
arXiv Preprint
BaKlaVa — Budgeted Allocation of KV cache for Long-context Inference
Ahmed Burak Gulhan, Krishna Teja Chitty-Venkata, Murali Emani, Mahmut Kandemir, Venkatram Vishwanath
AdapFM @ ICML 2026
LExI: Layer-Adaptive Active Experts for Efficient MoE Model Inference
Krishna Teja Chitty-Venkata, Murali Emani
ACM HPDC 2026
PKAS: Predictive KVCache-Aware Scheduling for Faster LLM and Transformer Inferences
Jie Ye, Avinash Maurya, Krishna Teja Chitty-Venkata, Bogdan Nicolae, Anthony Kougkas, Xian-He Sun
35th International Symposium on High-Performance Parallel and Distributed Computing
ISC 2026 Workshop
PreLoRA: Hybrid Pre-training of Vision Transformers with Full Training and Low-Rank Adapters
Krishu K Thapa, Reet Barik, Krishna Teja Chitty-Venkata, Murali Emani, Venkatram Vishwanath
ICLR 2026 Workshop
ImageNet-Think-250K: A Large-Scale Synthetic Dataset for Multimodal Reasoning for Vision Language Models
Krishna Teja Chitty-Venkata, Murali Emani
EACL 2026
PagedEviction: Structured Block-wise KV Cache Pruning for Efficient Large Language Model Inference
Krishna Teja Chitty-Venkata, Jie Ye, Bogdan Nicolae et al.
Findings of the European Chapter of the Association for Computational Linguistics 2026
PMBS @ SC 2025
MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models
Krishna Teja Chitty-Venkata, Sylvia Howland, Golara Azar, Daria Soboleva, Natalia Vassilieva, Siddhisanket Raskar, Murali Emani, Venkatram Vishwanath
2025 IEEE/ACM PMBS Workshop at Supercomputing
BiVision @ ICCV 2025
MoPEQ: Mixture of Mixed Precision Quantized Experts
Krishna Teja Chitty-Venkata, Jie Ye, Murali Emani
Binary and Extreme Quantization for Computer Vision Workshop at ICCV 2025
ICIP 2025
LangVision-LoRA-NAS: Neural Architecture Search for Variable LoRA Rank in Vision Language Models
Krishna Teja Chitty-Venkata, Murali Emani, Venkatram Vishwanath
2025 IEEE International Conference on Image Processing
PMBS @ SC 2024
LLM-Inference-Bench: Inference Benchmarking of Large Language Models on AI Accelerators
Krishna Teja Chitty-Venkata, Siddhisanket Raskar, Bharat Kale, Farah Ferdaus, Aditya Tanikanti, Ken Raffenetti, Valerie Taylor, Murali Emani, Venkatram Vishwanath
2024 IEEE/ACM PMBS Workshop at Supercomputing (Acceptance Rate = 25%)
EuroPar 2024
WActiGrad: Structured Pruning for Efficient Finetuning and Inference of Large Language Models on AI Accelerators
Krishna Teja Chitty-Venkata, Varuni Katti Sastry, Murali Emani, Venkatram Vishwanath, Sanjif Shanmugavelu, Sylvia Howland
European Conference on Parallel Processing (Acceptance Rate = 28%)
MDPI AI 2024
ConVision Benchmark: A Contemporary Framework to Benchmark CNN and ViT Models
Shreyas Bangalore Vijayakumar, Krishna Teja Chitty-Venkata, Kanishk Arya, Arun K Somani
MDPI AI Journal
IEEE Access 2023
Differentiable Neural Architecture, Mixed Precision and Accelerator Co-search
Krishna Teja Chitty-Venkata, Yiming Bian, Murali Emani, Venkatram Vishwanath, Arun K Somani
IEEE Access Journal
IEEE Access 2023
Neural Architecture Search Benchmarks: Insights and Survey
Krishna Teja Chitty-Venkata, Yiming Bian, Murali Emani, Venkatram Vishwanath, Arun K Somani
IEEE Access Journal
ACM CSUR 2022
Neural Architecture Search Survey: A Hardware Perspective
Krishna Teja Chitty-Venkata, Arun K Somani
ACM Computing Surveys
IEEE Access 2022
Neural Architecture Search for Transformers: A Survey
Krishna Teja Chitty-Venkata, Arun K Somani
IEEE Access Journal
ACM HPDC 2022
Efficient Design Space Exploration for Sparse Mixed Precision Neural Architectures
Krishna Teja Chitty-Venkata, Murali Emani, Venkatram Vishwanath, Arun K Somani
31st International Symposium on High-Performance Parallel and Distributed Computing (Acceptance Rate = 19%)
IEEE ICIP 2021
Searching Architecture and Precision for U-net based Image Restoration Tasks
Krishna Teja Chitty-Venkata, Arun K Somani
2021 IEEE International Conference on Image Processing
IEEE ASAP 2021
Array-aware Neural Architecture Search
Krishna Teja Chitty-Venkata, Arun K Somani
2021 IEEE 32nd International Conference on Application-specific Systems, Architectures and Processors
IEEE HPCC 2020
Calibration Data-based CNN Filter Pruning for Efficient Layer Fusion
Krishna Teja Chitty-Venkata, Arun K Somani
2020 IEEE International Conference on High Performance Computing and Communications
IEEE PRDC 2020
Model Compression on Faulty Array-based Neural Network Accelerator
Krishna Teja Chitty-Venkata, Arun K Somani
2020 IEEE 25th Pacific Rim International Symposium on Dependable Computing
IEEE ASAP 2020
Array Aware Training/Pruning: Methods for Efficient Forward Propagation on Array-based Neural Network Accelerators
Krishna Teja Chitty-Venkata, Arun K Somani
2020 IEEE 31st International Conference on Application-specific Systems, Architectures and Processors
IEEE ASAP 2019
Impact of Structural Faults on Neural Network Performance
Krishna Teja Chitty-Venkata, Arun K Somani
2019 IEEE 30th International Conference on Application-specific Systems, Architectures and Processors