Continuation of Nicholas Carlini's list, covering arXiv submissions since 2025-09-15.
TF-IDF + logistic regression trained on the original 13,697-entry list (held-out AUC 0.998); papers scoring ≥40% shown, grouped by arXiv ID month. Total: 2806 papers. Last update: 2026-09-01.


2026-08 (226 papers)
- [100%] Rethinking the Transferable Adversarial Attacks and Robust Defense in Federated Learning
Zuobin Xiong; Deval Mukherjee; Homook Cho; Wei Li - [99%] Understanding Fault Tolerance of Adversarially Robust Pruned Models
Manali Dangarikar; Cory Merkel - [99%] Multi-Task Consistency-based Detection of Adversarial Attacks
Cong Chen; Jean-Philippe Monteuuis; Jonathan Petit - [99%] Distilling Vision-Language Models for Robust Traffic Sign Perception in Autonomous Vehicles
Pedram MohajerAnsari; Amir Salarpour; Mert D. Pesé - [99%] Perspective-Invariant Attack with Enhanced Transferability of Adversarial Examples
Kaisheng Liang; Yiming Cao; Bin Xiao - [99%] Breaking the weakest link to evade vision language models
Ilan Zini; Boussad Addad; Katarzyna Kapusta - [99%] KAN-Robust-Bench: A Benchmark for Evaluating the Robustness of Kolmogorov-Arnold Networks
Mohammad Meymani; Roozbeh Razavi-Far - [99%] Defending Network Intrusion Detection Systems Based on Graph Neural Networks Against Structural Adversarial Attacks
Dimitri Galli; Andrea Venturi; Dario Stabili; Mauro Andreolini; Mirco Marchetti - [99%] REPLICANT: Learning Policies for Evading and Hardening Malware Detectors
Shae McFadden; Ilias Tsingenopoulos; Mario D'Onghia; Alexander Herzog; Myles Foley; Chris Hicks; Lorenzo Cavallaro; Fabio Pierazzi - [99%] ARMOR: Manifold-Oriented Training for Adversarially Robust Aerial Object Detection under Data Scarcity
Haoran Wang; Matthew Lau; Alec Helbling; Matthew Hull; ShengYun Peng; Mansi Phute; Martin Andreoni; Willian T. Lunardi; Duen Horng Chau; Wenke Lee - [98%] Double Down on Defense: Strengthening Deep Perceptual Hashes against Evasion Attacks without Retraining
Bangjie Sun; Nayoung Kim; Mun Choon Chan; Jun Han - [98%] Training-Free Reconstruction-Based AI-Generated Image Detectors Are Inherently Vulnerable to Adversarial Examples
Roman Demchenko; Jonas Ricker; Asja Fischer - [98%] RL-FAT: Reinforcement Learning for Fair Adversarial Training
Tejaswini Medi; Levan Mikeladze; Margret Keuper - [97%] Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models
Jiahui Han; Yuhui Yao; Xin Wang; Jiafei Cao; Mingxuan Zhang; Danfeng Shan; Huiqi Deng; Guanchu Wang; Xia Hu - [97%] GENADA: efficient generative time series adversarial attack framework
Michael Baronov; Denis Vorobev; Margarita Rusanova; Petr Sokerin; Alexey Zaytsev - [97%] Fast Test-Time Refinement for Robust Learned Image Compression
Jiaming Liang; Chi-Man Pun; Weisi Lin - [97%] AdROD: HyperNetwork-based Adversarially Robust Object Detection for Autonomous Driving
Yuting Wu; Dongfang Guo; Xiangzhong Luo; Qun Song; Rui Tan - [96%] Corrupting Attention: Evasion-Based Adversarial Attacks on Encoder Attention in Detection Transformers
Ridma Jayasundara; Shaheer Mohamed; Tharindu Fernando; Harshala Gammulle; Basura Fernando; Sanka Rasnayake; A V Subramanyam; Sridha Sridharan; Clinton Fookes - [96%] Why Does Robustness Reduce Superposition?
Adam Elimadi - [96%] FraudBench: Protocol-Sensitive Benchmarking of Adversarial Robustness for Financial Risk Assessment
Xitong Zeng; Zhaoge Bi; Yitian Yang; Huaming Chen; Quan Z. Sheng - [96%] Low-ASR Backdoors: Exploiting Attack Success Rate Reduction and Attacker-Defender Asymmetry
Arham Riaz; Ting Yu - [95%] Eliciting Intrinsic Hallucinations in LLMs via Semantically Equivalent Adversarial Attacks
Atri Vivek Sharma; Brian Formento; Alessio Lomuscio - [94%] Robust Context-Aware Detection of Malicious Instructions in Text
Buzhao Liu; Xinhang Ma; Yevgeniy Vorobeychik - [94%] TOFD: Target-Oriented Feature Decoupling against Poisoning Attacks in Split Federated Learning
Yuhan Xie; Jingrong Huang; Chen Lyu - [94%] Adversarial Attacks on Deep OCR Systems
Wenbo Sun; Hongzong LI; Yanyun Wang; Jiahao MA; Shuxin Zhuang; Rong Feng; Shiqin Tang; Zi Liang - [94%] IDATA: Scalable Invertible Diffusion for Unrestricted Adversarial Transfer Attack
Yi Pan; Jun-Jie Huang; Tianrui Liu; Zihan Chen; Lin Liu; Zhao Wentao - [94%] Adversarial Training Without Input Gradients via Low-Rank Householder Expansions
Tiana C. Johnson; Donsub Rim - [93%] ColorFD: A Finite-Difference Guided Black-Box Physical Adversarial Attack for Remote Sensing Object Detection
Tiannuo Guo; Guhang Qiu; Yuzhen Xie; Rui Feng; Ligang Li; Deliang Xiang - [93%] Learning with Bilevel-Minimax Optimization for Efficient and Reliable Transfer Attacks
Yaohua Liu; Yifan Guo; Jiaxin Gao - [92%] Crushing the Evidence: A Dual-Penalty Evasion Framework for Fooling White-Box Explainable AI Auditors
Niraj Kumar; Harsh Kasyap - [92%] The Boy Who Cried Wolf: Adversarial Misclassification of Safe Inputs as Unsafe in Multimodal Guardrails
Shuo Shi; Rui Yin; Naen Xu; Jiahao Chen; Chunyi Zhou; Tianyu Du; Zhihui Fu; Jun Wang; Zhaoxiang Wang; Shouling Ji - [92%] DRIFT: Derailing Denoising Trajectories of Flow-Matching VLAs with Adversarial Patch Attack
Hoseong Tae; Jong-Seok Lee - [92%] Adversarial Training of Linear Models under Stealthy Attacks
Lovisa Eriksson; Dave Zachariah; André M. H. Teixeira - [92%] Physical Adversarial Examples for Person Detectors in Thermal Images Based on 3D Modeling
Xiaopei Zhu; Siyuan Huang; Zhanhao Hu; Jianmin Li; Jun Zhu; Xiaolin Hu - [91%] A Survey of Adversarial Efficiency Degradation for Vision Transformer by Exploiting Input-adaptive Optimization
Anadi Goyal; Nandish Chattopadhyay; Anupam Chattopadhyay; Chandan Karfa - [91%] Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs
Hongli Shen; Shaopeng Fu; Qinbo Zhang; Jian Li; Di Wang - [91%] DSPrompt: Dynamic Soft Prompt Defense Against M-RAG Corruption
Chang Liu; Yuni Lai; Mingyue Cui; Cong Tian; Yunyan Zhang; Xian Wu; Kai Zhou; Bin Xiao - [91%] Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer
Qi Song; Ziyuan Luo; Haoliang Han; Renjie Wan - [90%] Targeted Label-Flipping and Oversampling Attacks on Federated Conditional GANs
Panav Shah; Avishek Ghosh - [90%] Defending against Model Extraction for GNNs with Model Reprogramming
Yan Wen; Zhenyi Wang; Heng Huang - [89%] Decoy Images Amplify Caption-Mediated Defenses Against Encoded Jailbreaks
Haoyu Zhang; Xiangchen Guan; Shibo Zheng; Mohammad Zandsalimy; Shanu Sushmita - [89%] Chameleon: Robust Defense Against Tor Website Fingerprinting via Many-to-Many Traffic Morphing
Yuwen Cui; Kai Wei; Kehan Shen; Ning Wang; Zhuo Lu; Yao Liu; Guangjing Wang - [89%] OASIS: Optimizing Attacker Sequences for Hard-Label Black-Box Text Attacks
Qian Chen; Shiliang Xiao; Yuzhi Liang - [88%] Two Sides of the Same Coin: Co-Evolving Search for Cross-Task Attacks on Vision-Language Models
Xuanhui Lin; Junhao Dong; Mingrong Gong; Yucheng Chen; Xinghua Qu; Yew-Soon Ong - [88%] On the Adversarial Robustness of Remote Sensing Semantic Change Detection
Weikang Yu; Yonghao Xu; Pedram Ghamisi - [87%] MOAT: Model-Agnostic Randomized Transformations for preventing Efficiency Degradation Attacks on ViTs
Anadi Goyal; Nandish Chattopadhyay; Chandan Karfa; Anupam Chattopadhyay; Norrathep Rattanavipanon - [87%] Learning What Not to Learn: Adversarial Disentangled Prompt Tuning for Robust Vision-Language Models
Yang Chen; Zhan Zhuang; Yanbin Wei; Zebin Chen; Hua Liu; Yu Zhang - [86%] Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Turn Attacks
Siyuan Li; Zehao Liu; Haoyu Li; Xi Lin; Ning Liu; Jun Wu; Jianhua Li; Mohsen Guizani - [86%] ReACT-CLIP: Response-Aware Test-Time Defense for Vision–Language Models
Hashmat Shadab Malik; Toluwani Aremu; Samuele Poppi; Muzammal Naseer; Salman Khan - [86%] Beyond Decision Boundaries: Relational Geometry Attacks on Contrastive Embedding Manifolds
Fei Zhao; Peiyuan Zhang; Xi Li; Chengcui Zhang; Nitesh Saxena - [86%] QuISE: Defense against Typographic Attacks on VLMs via Query-Irrelevant Semantic Editing
Shubin Lu; Jiaqi Yin; Yihao Huang - [86%] Large-scale Testing Global Optimization Methods with Black-box Adversarial Attacks
Wojciech Zarzecki; Jarosław Arabas - [86%] COPA: Continual Preference Optimization for Adaptive Prompt Injection Defense
Roshan Sood; Onat Gungor; Tajana Rosing - [86%] Vulnerable Code Search: Transferable Attack for Code Language Models
Kaicheng Wang; Liyan Huang; Jesse Thomason; Weihang Wang - [85%] Adversarial Agents on Topology Optimization: Understanding the Fragility and Robustness of Deep Learning-based and Physics-Based Design Models under Adversarial Perturbation
Hoang Anh Nguyen; Yuan Hong; Hongyi Xu - [83%] AdvTiles: Physical Adversarial Camouflage Clothing against Person Detectors via Learnable Tiles
Jinlei Wang; Jiahuan Long; Mingkai Sun; Yafei Guo; Yuanhao Huang; Ming Wang; Junqi Wu; Jiacheng Hou; Hongbo Chen; Xingxing Wei; Tingsong Jiang; Wen Yao - [83%] Breaking and Defending LLM-Powered Social Media Bot Detection Systems
Nof Orenstein; Yoni Birman - [83%] FIDA: Feature Instability-Driven Attack on Self-Supervised Facial Representation
Zhiyang Chen; Changchun Yin; Huiqin Yang; Liming Fang - [83%] Let Prompts Bridge Defense Knowledge: Transferable Graph Purification via Vulnerability-Aware GPL
Shuomin Xue; Jingyuan Li; Ju Jia; Jingxuan Yu; Xiaojun Jia - [83%] Ouroboros: Self-Referential Backdoor Attacks on Speech Enhancement via Clean Audio Triggers
Yunjie Zhou; Yuheng Huang; Diqun Yan - [82%] Moving the Safety Barrier: Dynamic Routing Adaptive Alignment Against White-Box Attacks
Shangze Li; Chuancheng Shi; Simiao Xie; Lingzhi He; Cheng Ji; Zifeng Cheng; Fei Shen; Chao Wu; Tat-Seng Chua - [82%] Empirical Analysis of Evasion and Poisoning Against Malware Data Drift Detection
Mingyue Yang; David Lie; Nicolas Papernot - [82%] MissClick: Exploiting Digit-Serialized Coordinates to Attack GUI Grounding Models
Yu Ran; Wentao Zhao; Xin Zhang; Yi Pan - [82%] Robust CurveMoE: Multi-Norm Adversarial Defense for Mixture-of-Experts Models via Mode Connectivity
Xu Zhang; Ren Wang - [82%] CamoDocs: A Poisoning Attack Against Retrieval-Augmented Language Models Using Camouflaged Documents
Jaewon Jung; Haizhong Zheng; Hongsun Jang; Jaeyong Song; Beidi Chen; Jinho Lee - [82%] Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images
Basudha Pal; Arjun Narayanan; Neha Ajith; Vikas R Bhat; Muhammad Umair - [81%] Mind the Gap: Zero-Query Jailbreaks via Filter-Generator Discrepancy in Text-to-Image Systems
Wanguang Li; Zhaoxin Wang; Handing Wang - [81%] Season: Spectrum-Aware Orthogonal Gradient Refinement for Transfer-Based Adversarial Attacks
Tianyi Wang; Zhenghao Gao; Shengjie Xu - [81%] Once Poisoned, Arbitrarily Controlled: A Programmable Backdoor in VLMs
Tao Lin; Gaojie Jin; Zongxin Liu; Peng Wu; Lijia Yu - [81%] TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation
Md Messal Monem Miah; Adrita Anika; Zhiyuan Yu; Ruihong Huang - [81%] CertVLA: Certified Defense against Physical Visual Attacks for Vision-Language-Action Models
Hui Lu; Zhijie Peng; Yuqi Lin; Zaijia Yang; Jiaming He; Shuhan Ye; Yi Yu; Hanwei Zhu; Bingquan Shen; Alex Kot; Xudong Jiang - [80%] Diversity Matters: Distributional Feature Coverage Sample Selection for Data-Efficient Backdoor Attacks
Yi Yang; Xiaoke Chen; Jinyang Huang; Feng-Qi Cui; Yu-Tong Guo; Jia-Cheng Zhao; Haiming Jin; Xiaokang Zhou; Meng Li - [80%] Adversarial Robustness in Smishing Detection: A Comparative Analysis of Adversarial Fragility in Classical vs. Transformer-Based Detection Systems
Denzel Chiuseni; Athanase Bahizire; Silva Hama; Jema David Ndibwile - [80%] STAR-FL: Secure Federated Learning with Spatial-Temporal Analysis and Robust Aggregation
Nawrin Tabassum; Yanzhao Wu - [80%] NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution
Anjun Gao; Yueyang Quan; Yufei Xia; Zhuqing Liu; Minghong Fang - [80%] RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation
Yueyang Quan; Anjun Gao; Yufei Xia; Minghong Fang; Zhuqing Liu - [80%] The Fragility of Jailbreak Robustness Across Operational States
Yuna Park; Hwang Youn Kim; Yujin Kim; Won Woo Ro; Suhyun Kim; Jae-In Hwang - [79%] Salami Attack: Stealthy Collusive Memory Poisoning against OpenClaw
Zheng Lin; Yuzhe Huang; Zhenxing Niu; Xianmin Ye; Haichang Gao - [78%] Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle
Jiaming Zhang; Boyang Chen; Zherui Li; Fuyao Zhang; Xinyu Yan; Hong Xi Tae; Wenwen He; Xuan Wang; Siqi Guo; Junhao Dong; Kun Wang; Hanxun Huang; Yige Li; Xingjun Ma; Yang Cao; Lingjuan Lyu; Wei Yang Bryan Lim - [78%] DiSCO: Defending text-to-image generation through distribution-guided contrastive prompt optimization
Tong Zhang; Motasem Alfarra; Carlos Hinojosa; Christos Louizos; Bernard Ghanem - [77%] A Convolutional Layer Activation Dimensionality Reduction for Out-of-Distribution and Adversarial Attack Detection Methods
Leandro de Souza Rosa; Lorenzo Capelli; Clara Nunes Barrancos; Mauro Mangia; Riccardo Rovatti - [77%] Coverage Is Not Containment: A Fundamental Limit of Admission-Time Defenses Against Coordinated Poisoning of Vector Retrieval
Prashant Kumar Pathak; Tarun Kumar Sharma - [77%] A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks
Tongyan Hu; Bryan Hooi - [76%] Can LLMs Truly Forget? Revealing Unlearning Gaps Through Adversarial Evaluation
Ayush Gupta; Hima Varshini Surisetty; Sreevidya Bollineni; Varad Ingale; Tuhina Tripathi; Abhishek Lalwani; Somya Chatterjee; Sadid Hasan - [75%] DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial
Abay Zhurekbay; Tao Liu; Fan Li - [75%] SRAP: SVD-Refined Adversarial Perturbations for Imperceptible Face-Swap Defense
Sungwon Cho; Kwanghyun Ko; Myungjoo Kang - [75%] Diff-DDoS: Realistic Cyber-Physical Attack Synthesis and Robust Detection for 5G-Enabled CPS Using Tabular Diffusion Models
Bilal Hussain; Xiao Tang; Qinghe Du; Tan Li; Muhammad Azhar; Danista Khan - [75%] Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence
Yang Liu; Bin Chong; Wenkai Yang; Shuai Zhang; Yancheng Chen; Feiyu Han; GuoZhen; Cheng Zhang; Huaibing Xie; Changze Lv; Shihan Dou; Pluto Zhou - [74%] Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift
Longtian Wang; Zhengyu Zhao; Chenhao Lin; Le Yang; Shiwei Wang; Yuhan Zhi; Xiaofei Xie; Chao Shen - [73%] Robust and Personalized Federated Learning for Aircraft-Engine Prognostics under Benign and Adversarial Client Heterogeneity
Chinmoy Mitra; Md. Mehedi Hasan Nipu; Mohammad Sakib Mahmood; Md. Rakibul Islam; M. F. Mridha - [73%] Enhancing Web Application Firewalls with Machine Learning for SQL Injection Detection
Lilliane Linnet Musoke; Atta Badii; Ahmed Ashlam - [72%] Mitigating Backdoors via Decoy Shortcuts and Knowledge Decoupling
Zixuan Zhu; Rui Wang; Lihua Jing; Jinwen Zhong - [72%] Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents
Jia-Chen Zhang; Ze-Yu Zhang; Kai-Wei Zhang - [72%] Generating Attacks for LLMs with GFlowNets
Berkay Ozcam; Irem Onen; Mehmet Fatih Amasyali; Emin Islam Tatli - [72%] TEA: Text Encoder Alignment for Robust Concept Erasure in Text-to-Image Models
Alireza Dehghanpour Farashah; Zhuan Shi; Negar Rostamzadeh; Golnoosh Farnadi - [72%] Adversarial Calibration Attack on Autonomous Vehicles
Liangkai Liu; Qingzhao Zhang; Kang G. Shin - [71%] Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures
Faisal Haque Bappy; Tahrim Hossain; Tarannum Shaila Zaman; Raiful Hasan; Kamrul Hasan; Tariqul Islam - [71%] Build it, Break it, Repeat: Benchmarking and improving LLM-manipulated disinformation detection in social media posts
Kevin Thomas; Milosz Kasprzyk; Reuel C Igbokwe Onuigbo; Elliott Pert; Cameron Tovey; João A. Leite; Olesya Razuvayevskaya; Carolina Scarton - [71%] UniTexture: Cross-Task Universal Adversarial Textures for Vision-Language-Action Models
Yukun Dai; Mingzhe Dai; Tianshi Wang; Fengling Li; Jingjing Li; Lei Zhu - [71%] IndicDetect: Evaluating Cross-Lingual LLM-Generated Text Detection for Hindi, Telugu, and Tamil
Bhaskar Ganesh Devalla; Junchao Wu; Nilesh Dokuparthi; Greeshma Yaluru; Tatiana Muniz Rodriguez; Lidia S. Chao; Derek F. Wong - [70%] PURPOSE: Poisoning Conflict Resolution in RAG via Proxy-Fact-Grounded Updates
Zijian Wang; Yubo Zhu; Muzhi Dong; Yanjun Lou; Yisheng Li; ZiLiang Zhang; Wei Tong; Yuan Zhang; Jingyu Hua; Sheng Zhong - [70%] Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots
S. M . Bhagya P. Samarakoon; M. A. Viraj J. Muthugala; W. K. R. Sachinthana; Mohan Rajesh Elara - [70%] Casting the Net! Revisiting MasterFace Impersonation Attacks
Seunghun Paik; Sunpill Kim; Chanwoo Hwang; Jae Hong Seo - [70%] Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models
Shuozhe Cheng; Kunlan Xiang; Mingxuan Li; Ji Zhang; Dongxiao Liu; Wenbo Jiang - [69%] Fair ASR: Re-Evaluating Black-Box Jailbreaks under Shared Target-Call Budgets
Zhida He; Xiaoyu Wen; Han Qi; Ziyuan Zhou; Peng Yu; Jiajia Li; Chaochao Lu; Qiaosheng Zhang - [69%] TestifAI: Tomography-Based Testing for Deep Learning Systems
Arooj Arif; Tobias Hartung; Elena Botoeva; Alexandros Koliousis - [68%] Robust Watermarks Meet Backdoored Models: Evading Diffusion Semantic Watermarks via Stealthy Backdoor
Jinyuan Liu; Tianshuo Cong; Pei Li; Tianrui Wang; Xinlei He; Anyu Wang; Xiaoyun Wang - [67%] Reversible Unlearnable Examples: Towards the Copyright Protection in Deep Learning Era
Binze Wang; Jinyu Tian; Xingrun Wang; Xiaochen Yuan; Jianqing Li - [67%] BASIS: Breach-Aware Selective Prompt Injection Shielding with Prefill Attention Probes
Laiqiao Qin; Tianqing Zhu; Longxiang Gao; Wanlei Zhou - [67%] Benchmarking Quantum Machine Learning for Power-System Attack Detection: Evaluation Choices Decide the Outcome Before the Models Do
Md Rezwanul Islam - [66%] Catastrophic Learning: A New Attack Vector on Continual Learning Networks
Benedikt Kluss; Niklas Bunzel - [65%] Fast Object Removal Attacks on Safety-Critical Video-based Perception Systems
Mohammad Imtiaz Hasan; M Sabbir Salek; Nathan Jones; Mashrur Chowdhury; Rong Ge - [65%] When Efficiency Becomes Fragility: Exploiting Dynamic Routing Vulnerabilities in Adaptive UAV Tracking
Shaofeng Liang; Runwei Guan; Wenshuo Chen; Jiemin Wu; Bowen Tian; Haozhe Jia; Kaishen Yuan; Songning Lai; Daizong Liu; Yutao Yue - [65%] SysEvolve: An AI-native, safe, autonomous adversarial attack-defense co-evolutionary system
Yuhan Meng; Shaofei Li; Jionghao Huang; Jiandong Jin; Puyi Wang; Hanlin Jiang; Anis Yusof; Peng Jiang; Zhenkai Liang; Yao Guo; Ding Li - [65%] Text-Anchored Semantic Perturbations for Transferable Jailbreak Attacks on Multimodal Large Language Models
Wenyun Li; Guiping Cao; Xiangyuan Lan; Zheng Zhang - [64%] Adaptive Intrusion Detection System using Transformer-Based Neural Networks and Continual Learning Approach with Adversarial Investigation
Azizi Ariffin; Afif Haris; Faiz Zaki; Hazim Hanif; Nor Badrul Anuar - [64%] When Context Bites: Detecting RAG Poisoning via Document-Level Attention Collapse
Yingtao Ren; Ziyi Zhao; Yiwei Fu; Xiao Luo; Yu-Cheng Chang; Chin-Teng Lin - [64%] Kolmogorov–Arnold against bounded translations
Sviatoslav V. Dzhenzher - [63%] Breaking Customized LLMs for Coding: Automated Red Teaming for Instruction Backdoor Attacks
Yuchen Chen; Wei Cheng; Yuan Xiao; Wising Sun; Chunrong Fang; Yang Liu; Zhenyu Chen; Baowen Xu - [62%] Bagging Robustly Learns VC Classes with Linear Sample Complexity
Omar Montasser - [62%] Robustness of Anomaly Detection Models for Industrial Control Systems under Training-Time Data Contamination
Mustafa Umut Ozbek; Taiwo Ojo; Pooria Madani; Khalil El-Khatib; Li Yang - [62%] Poisoning Agentic Alpha: Adversarial Vulnerabilities Across Roles and Architectures in Multi-Agent Trading Systems
CheolWon Na; Hao Ni; Lukasz Szpruch; Zhangyang Wang; Dhagash Mehta; Saurabh Nagrecha; Alejandro Lopez-Lira; Chanyeol Choi; Yongjae Lee; Jee-Hyong Lee - [61%] No Single Neuron of Failure: Distributed Safety Alignment Against White-Box Attacks
Simiao Xie; Chuancheng Shi; Shangze Li; Wenhua Wu; Fei Shen; Ying Zhou; Zhiyong Wang; Tat-Seng Chua - [61%] Algebraic Attack on Convolutional Neural Networks with Max Pooling
Zirui Chen; Shi Tang; Zhengchao Gao; Yongjia Su; Lingyue Qin; Xiaoyang Dong - [61%] Tripwire: Triggering Aligned Refusal via Statistically Certified Safety Neurons
Wei Zhao; Zhe Li; Peixin Zhang; Jun Sun - [61%] Decomposition Attacks Across Unlinkable Identities: Limits of Stateful Defenses for LLM Services
Bowen Sun; Zhengyue Zhao; Xiaogeng Liu; Yinzhi Cao; Chaowei Xiao - [61%] STAIN-FL: Stealthy Targeted Attack Injection with Contextual Triggers in Federated Learning
Ashlinder Kaur; Purnima Murali Mohan; Zengxiang Li; Tram Truong-Huu - [60%] TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP Servers
Mehrdad Rostamzadeh; Sidhant Narula; Mohammad Ghasemigol; Daniel Takabi - [60%] EvoHarmBench: Breaking Content Moderation with Iterative Human-Like Evasion
Ruijie Jian; Benlei Cui; Ting Ma; Haidong Ding; Kangwei Liu; Ziwen Xu; Longtao Huang; Hui Xue; Ziqiang Zhu; Junjie Li; Haiwen Hong - [59%] Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure
Jianshuo Dong; Yiming Liu; Maosen Zhang; Nan Deng; Xu Peng; Xiaoping Zhang; Tianwei Zhang; Jie Zhang; Han Qiu - [59%] When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems
Neha Nagaraja; Amisha Bagari; Hayretdin Bahsi - [59%] Confusion-Geometry Rebalancing for Long-Tailed Adversarial Training
Mengnan Zhao; Geyong Min; Lihe Zhang; Tianhang Zheng; Jie Cui - [59%] MobileWorldSafety: Benchmarking GUI Agent Safety Against Environmental Injection Attacks in Android Apps
Sujin Chen; Lijun Li; Tianyi Du; Jing Shao - [59%] Breaking the Assumptions: Auditing Input-Side Jailbreak Defenses Against Semantic Attacks
Aaditya Pratap; Harsh Kasyap; Somanath Tripathy - [59%] Not to Break, but to Attest: Adversarial Probes for Privacy-Preserving LLM Verification
Cameron Wilding; Mina Shaker; Fatemeh Ganji - [58%] Steering the Flow: Inverting Face Recognition Models via Gradient-Guided Flow Matching
Ye Lu; Shen Wang; Zhaoyang Zhang; Yihan Yan; Li Liu; Runze Liu; Fanghui Sun - [58%] Breaking High Confidence: Practical Face Impersonation under High-Security Thresholds
Changjin Kim; Seunghun Paik; Dongsoo Kim; Jae Hong Seo - [58%] CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?
Zi Liang; Xiaoyu Xu; Yanyun Wang; Minxin Du; Qingqing Ye; Haibo Hu - [57%] TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models
Qi Lu; Zehui Guo; David Yuanda Gan; Zijing Li; Hengda Zhang; Weijun Xu; Qiankun Zhang - [56%] VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks
Dongfu Yin; Jinquan Zhang - [56%] No Unique Minimizer, No Problem: On the Consistency of Robust Neural Classifiers
Subhabrata Majumdar; Anand Deo; Partha Pratim Saha; Abhik Ghosh - [56%] SegPAR: Class-Centric Decision-Based Sparse Attack for Semantic Segmentation
Dongsu Song; DaeYun GO; Boseung Seo; Jay Hoon Jung - [56%] HarnessRisk: A Lifecycle-Oriented Benchmark for Agent Harness Safety
Yajing Bai; Jinhao Duan; Jie Peng; Xianfeng Wu; Sijia Liu; Song Wang; Tianlong Chen - [56%] Robust Validation to Geometric Perturbations for Autonomous Pose Estimation
Gregoire Theau; Melanie Ducoffe - [56%] Not All Tokens Are Equal: Region-Aware Consistency Repair of Backdoors in MLLMs
Jiali Wei; Ming Fan; Mingkun Zhang; Haoyu Wang; Jun Sun; Guoheng Sun; Xiaoning Ren; Haijun Wang; Ting Liu - [55%] TwinIR: Coordinated Invisible Dual-Point Attacks on Online HD Map Construction
Haibo Hu; Jianghuai Deng; Chen Tang; Yang Lou; Qian Xu; Jianping Wang - [55%] Uncertainty-Aware Ensemble Deep Randomized Neural Networks for Classification
M. Sajid; A. Quadir; A. Rahaman; P. N. Suganthan; M. Tanveer - [55%] SeFaR: Semantic Feature-aware Robustness Testing of Deep Neural Networks
Nusrat Jahan Mozumder; Divya Gopinath; Corina Pasareanu; Matthew Dwyer - [55%] Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs
Nimet Beyza Bozdag; Emre Can Acikgoz; Gokhan Tur; Dilek Hakkani-Tür - [55%] BackDFL: A Unified Benchmark For Backdoor Attacks and Defenses In Decentralized Federated Learning
Mouhamed Amine Bouchiha; Gregory Blanc; Yufei Han - [55%] CG4AI: A Column Generation Framework for Training AI Models Under Constraints
Youcef Magnouche; Abderrahmane Driouch; Sébastien Martin; Pierre Bauguion - [53%] Universal Concept Disruption for SAM3 Image Segmentation
Hao Wang; Yuxuan Zhang; Wei Yang - [53%] ElasticBack: Stealthy Conditional Backdoor in LLM-Agent Skills via Coupled Trigger-Rule Optimization
Hao Sui; Simeng Qin; Jie Liao; Xiaojun Jia; Bing Chen; Yang Liu - [53%] CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills
Mingxiao Liu; Zhoumian Jiang; Jianan Ma; Jian Zhang; Jialuo Chen; Xinhao Deng; Zhen Wang - [53%] Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation
Rujin Liang; Zhongpu Chen; Yuhao Lei; Xin Miao - [53%] Why Are LLM Backdoor Defenses Fragmented? A Feature-Level Explanation with Sparse Autoencoders
Yizhe Zeng; Chenxu Niu; Wei Zhang; Hao Huang; Yunpeng Li; Dongxu Han; Dan Du; Cheng Hong; Hequn Xian; Yuling Liu - [52%] Securing Contrastive mmWave-based Human Activity Recognition against Adversarial Label Flipping
Amit Singha; Ziqian Bi; Tao Li; Yimin Chen; Yanchao Zhang - [52%] Does the Competitive Component of Adversarial Self-Play Improve Legal Reasoning? A Controlled Negative Result
Miseog Shawn Kim - [52%] LaCache: Robust Semantic Caching for LLM Serving
Jiacheng Liang; Yuhui Wang; Tanqiu Jiang; Ting Wang - [52%] Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking
Jinquan Zhang; Dongfu Yin; Run Yang; Yufeng Yan; Zhen Tian; F. Richard Yu - [52%] CAM-Guided Saliency Cutout and Image-Based Malware Classification
Yasaman Ebrahimi; Martin Jurecek; Mark Stamp - [52%] Branch and Bound for Relational Verification of Neural Networks
Kota Fukuda; Zhenya Zhang; Guanqin Zhang; Jianjun Zhao - [52%] ROBBIN: Rowhammer-Based Backdoor Injection during Inference
Saion K. Roy; Yufei Wang; A. Adam Ding; Yunsi Fei - [51%] Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating
Tobias Braun; Jonas Grebe; Louis Rethfeld; Marcus Rohrbach - [51%] ICO: Enhancing Semantic-Shift Jailbreaks via Iterative Context Optimization
Hujian Zhu; Yihao Huang; Felix Juefei-Xu; Xinfeng Li; Peng Zeng; Simeng Qin; Qing Guo; Geguang Pu - [51%] Toward Metacognitive One-Shot Indirect Prompt Injection: Strategy Abstraction Via Outcome-Conditioned Reflection
Sihan Hou; Xinmeng Hou; Zhijun Zhang; Zehao Wang; Xuhong Ren; Sibo Qin; Kuntharrgyal Khysru; Qing Guo - [51%] COMA: A Compositional Misleading Attack Class on Security-RAG, and a Causal Counterfactual Defense
Chinmay Gondhalekar; Urjitkumar Patel - [51%] SIR: Self-improving Red-teaming for Compute Use Agents
Chen Xiong; Zhiyuan He; Pin-Yu Chen; Stjepan Picek; Tsung-Yi Ho - [50%] Subtype Robustness Is Not Just Accuracy: Calibration Under Unseen Subtype Shift
Hanyu Su; Carlota Julbe i Juanola; Yibo Hu - [50%] Not an A11y: How Android Accessibility Exposes Mobile AI Agents to Indirect Prompt Injection
Rahul Deivasigamani; Sayeda Faatin Alvi; Derqui Andrea; Kaushal Punjabi; Stjepan Picek - [50%] Query-Side Attacks on GNN-Based KGQA: Tracing Failures from Entity Linking to Answer Generation
Pankaj Kumar; Subhankar Mishra - [49%] When Explanations Betray Backdoors: Black-Box Auditing for Language Model Classifiers
Yang Liu; Ran Zou - [49%] Workspace Topology as an Attack Vector in Agentic Coding Assistants
Alexandre G. R. Day; Pradeep Yadlapalli; Sriram Venkatapathy; Thomas Paniagua; Nick Raines; Sahil Wadhwa; Himanshu Kumar; Andy Luo; Sudeep Panyam; Rikhiya Ghosh; Pranab Mohanty; Giri Iyengar - [49%] Certified but Private: Scalable Zero-Knowledge Proofs for Neural Network Guarantees
Youwei Zhong; Ben Merbaum; Timos Antonopoulos; Ning Luo; Charalampos Papamanthou; Katerina Sotiraki; Ruzica Piskac - [49%] Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation
Junyu Lu; Kaiyuan Liu; Jingyi Kang; Deyi Ji; Hailong Zhang; Lanyun Zhu; Qi Zhu; Bo Xu; Liang Yang; Hongfei Lin - [49%] Retrieved But Not Reliable: A Survey on Attacks, and Defenses in Retrieval-Augmented Generation
Minh Tran; Cuong Dang; Tuc Nguyen; Khanh-Tung Tran; Minh Huynh Nguyen; Trinh Chau; Kien Le; Do Xuan Long; Jiahao Zhang; Fali Wang; Hoang D. Nguyen; Thanh Le; Suhang Wang - [48%] SkillJack: Persistent Skill Backdoors in Self-Evolving Agents
Zonghao Ying; Xiangfan Wu; Huiyu Wu; Xing Zheng; Huangsheng Cheng; Xiaorong Shi; Jing Guo - [48%] Learning What to Fail On: Failure-Mode Contextual Bandits for Adversarial Data Curation
Roie Kazoom; Ofir Cohen; Rami Puzis; Asaf Shabtai; Ofer Hadar - [48%] Are Android GUI Agents Robust Against Runtime Anomalies? AnTrap: Evaluating Agents in Dynamic Adversarial Environments
Guo Gan; Yilun Zhao; Cong Chen; Jinbiao Wei; Tingyu Song; Zheyuan Yang; Lin Fu; Hong Zhou - [48%] DEFUSE: Generalizable Backdoor Defense for Self-Supervised Encoders with Generative Priors
Tuo Chen; Jie Gui; Minjing Dong; Lanting Fang; Ju Jia; Benlei Cui; Jian Liu - [47%] When Collaboration Becomes a Trigger: Collective Evidence-Threshold Backdoors in Multi-Agent Systems
Jia-Hao Xiao; Lei Feng; Min-Ling Zhang - [47%] The Neural Echo: A Signal Processing Perspective for Understanding Neural Networks
Chongbiao Wang; Daniel Gaa; Joachim Weickert; Karl Schrader - [47%] From Uncertainty to Failure Attribution: Self-Diagnosing Models for Failure Attribution under Distribution Shift
Yiyao Yang - [47%] Defending Retrieval-Augmented Intrusion Detection Against Knowledge Poisoning and Prompt Injection
Kaysarul Anas Apurba; Md. Hasibul Hasan; Mahedee Zaman Moon; Sk. Md. Mizanur Rahman; Atsuo Inomata - [47%] A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation
Dipankar Sarkar - [47%] Assessing Attack Surfaces in Generative Search Engines through Publisher Attributes: A Case Study in Political Domains
Riku Mochizuki; Shusuke Komatsu; Souta Noguchi; Kazuto Ataka - [47%] Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs
Roman Maksimov; Vladimir Aletov; Vladimir Solodkin; Dmitry Bylinkin; Daniil Medyakov; Aleksandr Beznosikov - [47%] TESTNAV: Pareto-Guided Search for Compositional Robustness Testing
Arooj Arif; Tobias Hartung; Elena Botoeva; Alexandros Koliousis - [47%] ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation
Linhan Cao; Siyuan Li; Jun Lan; Liangbo He; Guannan Li; Xiaolei Huang; Jun Jia; Shuheng Zhou; Huijia Zhu; Weiqiang Wang; Wei Sun - [46%] Characterizing the Variance Envelope: A Multi-Dimensional Analysis of Spectre Telemetry Across Architectures and Workloads
Jaya Keshava Chandra Kotha; Jean-Luc Gaudiot - [46%] Beyond Direct Access: Resource Hijacking in LLM Agents
Puyu Zeng; Qibing Ren - [46%] The Model's Tell: Measuring Context-Leakage Attack Signals with Behavior Gauges
Maosen Zhang; Jianshuo Dong; Boting Lu; Wenyue Li; Xiaoping Zhang; Tianwei Zhang; Jie Zhang; Han Qiu - [45%] Attacking and Defending Multi-Agent Collaborative Filtering Systems Through Connectivity
Anjun Hu; Hanting Xie; Saranya Govindan; Jas Kandola; Kurt Cutajar - [45%] MAFIA: Query-Only Memory Attacks via Probing and Factual Injection against Audited LLM Agents
Jiaming Chen; Yisen Gao; Yanping Li; Zifan Liu; Yumeng Zhang; Jun Zhang - [45%] The Sample Complexity of Distributionally Robust PAC Learning under Cressie–Read Divergences
Elad Aigner-Horev; Daniel Rosenberg; Roi Weiss - [45%] LoginTrap: Uncovering Task-Agnostic Phishing-Style Indirect Prompt Injection Attacks against LLM-based Web Agents
Longtao Guo; Zelin Zhang; Kaifeng Huang; Yang Shi - [45%] Breaking Planner Integrity Boundary: Enviroment State-Text Injection Attack on LLM-Driven Embodied Agents
Jiawei Liu; Jiacheng Guo; Tian Zhang; Yiwei Xu; Juan Wang; Jinlin Fan; Bowen Xiao; Chi Guo; Keyan Guo; Hongxin Hu - [44%] SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains
Fuyao Zhang; Jiaming Zhang; Che Wang; Boyang Chen; Yurong Hao; Xiongtao Sun; Guowei Guan; Blaise Delattre; Yang Cao; Wei Yang Bryan Lim - [44%] Robust Reputation-Driven Crowdsourced Federated Learning
Mouhamed Amine Bouchiha; Gregory Blanc - [44%] Pragmatic Attack Surface: Vulnerabilities of Implicit Context in Large Language Models
Bocheng Chen; Han Zi; Roucheng Ou; Yawei Liu; Minyue Chen; Zimo Qi; Rongrong Wang; Guangliang Liu - [44%] Uncovering the Limits of Proof Sharing for Neural Networks
Kanak Das; Shubham Ugare; Bor-Yuh Evan Chang; Sasa Misailovic; Gagandeep Singh; Manu Sridharan - [44%] A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families
Yu Zhe; Yixin Tan; Junhao Wei; Wang Chen - [44%] Beyond Global Scalars: Synergizing Token-Level Statistics and Deep Semantics for Adversarial AIGC Text Detection
Peiming Li; Yifan Wang; Zhiyuan Hu; Shiyu Li; Zheng Wei; Yang Tang - [44%] Audio-Driven Adversarial Defense for 3D Talking Face Generation with totally Visual Fidelity Preservation
Rui-Qing Sun; Chen-Hao Cui; Hui-Yang Zhao; Tian Lan; Zhijing Wu; Xian-Ling Mao - [43%] What the Detector Can See: Evaluating CPS Anomaly Detectors Independently of the Decision Rule
Peiran Shi; Jian Xiang; Xiang Zhang; Chenglong Fu - [43%] ActBench: Self-Evolving Benchmark of Behavioral Safety in Cowork Agents
Hongwei Yao; Yiming Liu; Meihui Chen; Jieling Chen; Zikun Chen; Yiling He; Wangze Ni; Cong Wang; Kui Ren - [43%] Measuring the Wrong Thing: Internal Harmfulness Scores Anti-Rank Successful Jailbreaks
Mingyu Luo; Ming Deng; Zilang Qiu; Yiming Cheng; Ci Tao; Xue Tan; Sijin Sun; Yangfu Li; Ping Chen; Jun Dai; Xiaoyan Sun - [43%] A Formal Methodological Framework for Auditing Robustness and Fidelity in Explainable AI: From Application to Trust Certification
Rosa Elysabeth Ralinirina; Jean Christian Ralaivao; Niaiko Michaël Ralaivao; Alain Josué Ratovondrahona; Thomas Mahatody - [43%] ContextLeak: Exfiltrating LLM Agent Context via Malicious Tools
Yuqi Jia; Ruiqi Wang; Patrick Li; Yuepeng Hu; Peinian Li; Neil Gong - [42%] Analysis of Federated Aggregation under Model Poisoning and Backdoor Attacks: A Reconstructed Cross-Dataset and Cross-Architecture Benchmark
Soumya Mazumdar; Vineet Kumar Rakesh; Tapas Samanta - [42%] Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened
Md Habibur Rahman; Jaeho Kim - [42%] SkillShield: Prompt-Space Security Skills for LLM Coding Agents
Xiaodong Wu; Zhimin Zhao; Qi Li; Xiangman Li; Yu Shi; Bram Adams; Jianbing Ni - [41%] A Constitution-Grid Instrument for Data-Efficient RL Alignment (C-Guard)
Xianling Zhang - [41%] Safety in Batches? Understanding and Mitigating Safety Failures in Batch Prompting
Kihyun Kim; Hee-Seon Kim; Wonjun Lee; Changick Kim - [41%] Capability-Routed Guard: Defending Large Reasoning Models Against Reasoning-Centric Jailbreaks
Yiyong Liu; Yixin Wu; Jun Sakuma - [41%] MarkNull: Model-Agnostic Watermark Removal in AI-Generated Images via On-Manifold Latent Manipulation
Jie Cao; Qi Li; Zelin Zhang; Xiaodong Wu; Lingshuang Liu; Xiangman Li; Jianbing Ni - [41%] Threat-guided Policy-aware Scene Perturbation for Safe Autonomous Driving with Online Reinforcement Learning
Xincong Hu; Lei Ou; Maosen Li; Jingtao Zhang; Liguo Hou; Zongzhang Zhang - [41%] AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss
Mingju Gao; Jingkai Zhou; Kun Gai; Changqian Yu; Hao Tang - [41%] Clustered Randomized Smoothing for Stochastic Prediction Functions
Eduardo Figueiredo; Frederik Mathiesen; Julian Schumann; Jens Kober; Arkady Zgonnikov; Luca Laurenti - [41%] LongPIBench: A Long-Context Benchmark for Prompt Injection
Yupei Liu; Yuqi Jia; Neil Zhenqiang Gong; Jinyuan Jia - [41%] ECLIPSE: Self-Evolving Stealthy Prompt Injection Attack against Long-Horizon Agentic Systems
Shiqian Zhao; Yangfan Zhou; Xinfeng Li; Runyi Hu; Yechao Zhang; Yi Xie; Tianwei Zhang; Luu Anh Tuan - [40%] DeepInvert: Semi-Supervised Embedding Inversion Against Obfuscated Language Models
Zhicong Huang; Cheng Hong; Tao Wei - [40%] AndroidReality: How Far Are Mobile Agents from the Real World?
Xiaoou Liu; Longchao Da; Hanyang Chen; Yuan Ling; Hua Wei - [40%] PEAK: Precise and Persistent Concept Erasure via k-Sparse Autoencoders
Man Jiang; Ouxiang Li; Weibao Xue; Zhenhua Tang; Yuan Wang; Shuo Wang; Yanbin Hao - [40%] Trojaning the Alignment: Stealthy Backdoor Attacks against Graph Foundation Models
Minhua Lin; Zhicheng Gao; Yilong Wang; Hanqing Lu; Xiang Zhang; Suhang Wang - [40%] Networked Multi-Resource Defense Capabilities in a General Lotto Game
Faezeh Shojaeighadikolaei; Keith Paarporn
2026-07 (220 papers)
- [100%] Binary Iterative Method for Non-targeted Adversarial Attack
Naman Goyal; Milan Chaudhari - [100%] LipSSD: Lipschitz-Constrained Single-Shot Detection for Adversarially Robust Object Detection
Vincent Lébé; Yannick Prudent; Corentin Friedrich; Thomas Massena; Ronan Sicre; Franck Mamalet - [100%] Random Logit Scaling: Defending Deep Neural Networks Against Black-Box Score-Based Adversarial Example Attacks
Hamid Dashtbani; Mehdi Dousti Gandomani; AmirMahdi Sadeghzadeh - [100%] A Multi-Model Hybrid Defense Approach Against White-box Adversarial Attacks in Computer Network Traffic
Khushnaseeb Roshan - [100%] Shared Vulnerabilities in Robustness-Optimized Defenses: One Breach Exposes the Family
Hanrui Wang; Ruihao Zheng; Shuo Wang; Isao Echizen; Xingbo Dong; Zhe Jin - [99%] Robustness Meets Uncertainty: Evidential Adversarial Training for Robust Selective Classification
Nicolas Sournac; Ahmed Baha Ben Jmaa; Bertrand Braeckeveldt - [99%] Defending from GeoLocalization through Adversarial Road Trips
Niccolò Niccoli; Federico Becattini; Lorenzo Seidenari - [99%] Statistically Undetectable Backdoors in Deep Neural Networks
Andrej Bogdanov; Alon Rosen; Neekon Vafa - [99%] Adversarial Attacks on Online Handwriting using Salience-based Temporal Editing
Yataro Tamura; Brian Kenji Iwana; Jiseok Lee - [99%] A New Kind of Adversarial Example: Measuring the Human-Model Gap, and Its Relationship to OOD Detection
Ali Borji - [99%] Revisiting the Adversarial Robustness of Graph-Based Traffic Forecasting
Qingzhao Zhang - [99%] Improving the Robustness/Accuracy Tradeoff Against Adversarial Attacks Using Information Bottleneck Distillation Through Dual Teachers
Vincent Ryusuke Takahashi; Yoshinari Takeishi; Jun'ichi Takeuchi; Kave Salamatian - [98%] Adversarial Decoys: Misdirecting Attention-Based Defenses in ViT
Giulia Marchiori Pietrosanti; Giulio Rossolini; Giorgio Buttazzo - [97%] Beyond Gradient-Based Attacks: Adversarial Robustness and Explainability Stability in Cybersecurity Classifiers
Mona Rajhans; Vishal Khawarey - [97%] Adversarially Guided Diffusion for LiDAR Range Image Synthesis
Stavros Bouras; Antonios Makris; Alexandros Gkillas; Aris S. Lalos; Konstantinos Tserpes - [97%] GhostPrompt: Cross-Image Adversarial Prompt for Vision-Language Models
Li Zeng; Zeyu Ye; Meng Xie; Hangtao Zhang; Xianlong Wang; Yanchun Li; Zhetao Li - [96%] Detecting Adversarial Evasion Attacks Against Autoencoder-Based Network Intrusion Detection Systems
Niklas Bunzel; Ashim Siwakoti - [96%] Does Demand Response Increase Vulnerability to Cyber Attacks by Adversarial Data Modifications?
Clemens Kortmann; Eike Cramer - [96%] GeoDetect: Geometric Adversarial Detection for VLPs
Afsaneh Hasanebrahimi; Hanxun Huang; Christopher Leckie; James Bailey; Sarah Erfani - [96%] Certified Training for Convolutional Perturbations
Benedikt Brückner; Alessio Lomuscio - [96%] Intelligent Disruption: Undetectable Attacks on Wireless Autoencoders
Han Jiang; Jifa Zhang; Hu Jin; Nan Zhao; Mingqian Liu; Yunfei Chen - [96%] Evaluation of Adversarial Robustness in Arabic Language Models
Anwar Alajmi; Ayed Salman; Imtiaz Ahmad - [95%] Comprehensive Robustness Analysis of LiDAR-based 3D Object Detection in Autonomous Driving
Adwait Chandorkar; Kai Krink; Yerdana Maulenbay; Hasan Tercan; Tobias Meisen - [95%] On Adversarial Vulnerability of Vision-Language Models through the Lens of Intermediate Spectral Subspaces
Chethan Krishnamurthy Ramanaik; Tobias Callies; Michael Hecht; Eirini Ntoutsi - [95%] Triggering Stealthy Feature Map Backdoors via Physical Fault Injection in Embedded Neural Networks
Steyn Hommes; Vincent Dankbaar; Tanguy Stekke; Xiaomeng Wang; Lisanne Weidmann; Senna van Hoek; Durba Chatterjee; Lejla Batina; Zhuoran Liu - [95%] LLM-Guided Program Evolution for Targeted Black-Box Attacks on Perceptual Hash Algorithms
A. Krylov; D. Rakhov; V. Veselova; D. Bolokhov; Oleg Y. Rogov - [95%] Reducing information dependency does not cause training data privacy. Adversarially non-robust features do
Rasmus Torp; Shailen K. Smith; Adam Breuer - [95%] BadWAM: When World-Action Models Dream Right but Act Wrong
Qi Li; Xingyi Yang; Xinchao Wang - [95%] Natural Backdoor Attacks on Speech Recognition Models
Jinwen Xin; Xixiang Lyu; Jing Ma - [95%] Hiding in Plain Sight: An Effective Physical Adversarial Patch Attack against Visual-Infrared Fused Face Detection
Qiucheng Yu; Tao Ni; Yihe Zhou; Jiayimei Wang; Qingchuan Zhao - [94%] DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning
Yueming Huang; Wenhan Yao; Fen Xiao; Xiarun Chen; Weiping Wen - [94%] Efficient Safety Alignment of Language Models via Latent Personality Traits
Mohamed Amine Merzouk; Nolan Smyth; Damiano Fornasiere; Linh Le; David Williams-King; Adam Oberman - [94%] Adversarial Frontiers: Minimum-Norm Attack Ensembles for Robustness Evaluation
Luca Scionis; Luca Melis; Maura Pintor; Fabio Brau; Ambra Demontis; Giorgio Fumera; Fabio Roli; Battista Biggio - [94%] Detectors Learn the Wrong Thing: Shortcut-Resistant Adversarial Training Against Physically Realizable Attacks
Yuanhao Huang; Yilong Ren; Jinlei Wang; Xuesong Bai; Zheng Zhang; Haiyang Yu - [94%] Unifying Adversarially Robust Model Experts in Vision-Language Models
Nguyen Duc Thai; Junhao Dong; Sua Qi Rong; Hua Yu; Yew-Soon Ong - [93%] A Step Towards Robust Unsupervised Domain Adaptation via Fine-Tuning and Reinforcement Learning
Sushant Dagaji Desale; Rahul Mishra; Ashutosh Kumar Sinha - [93%] ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments
Zixuan Wu; Cristina Nita-Rotaru - [92%] AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models
Cong Su; Jiaju Han; Xuemeng Sun; Chengyin Hu; Qike Zhang; Jiujiang Guo; Yiwei Wei; Jiahuan Long - [92%] AdvNav: Behavior-Guided Black-Box Adversarial Attacks on Vision-Language Navigation
Chenyang Li; Kaige Li; Zeyu Jiang; Changhao Chen - [92%] Do Agents Dream of False Memories? Black-box Visual Attacks on Long-term Memory in Multimodal AI Agents
Halima Bouzidi; Mboutidem Ekemini Mkpong; Mohammad Abdullah Al Faruque - [92%] DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection
Weiwei Qi; Zefeng Wu; Zhilin Guo; Tianhang Zheng; Chaochao Lu; Liang He; Zhan Qin; Kui Ren - [92%] GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation
Yimin Fu; Yuefeng Bai; Baicheng Pan; Zhunga Liu; Michael K. Ng - [91%] Assessing the Operational Impact of Poisoning Attacks over Augmented 3D Point Cloud Public Datasets for Connected and Autonomous Vehicles
Marwan Lazrag; Badis Hammi; Lorena Gonzalez-Manzano; Joaquin Garcia-Alfaro - [91%] Structural Adversarial Attacks on Relational Deep Learning under Integrity Constraints
Alan Gany; Bogdan Cautis; Silviu Maniu - [90%] TIER: Trajectory-Invariant Explanation Regularization for Membership Privacy
Varun Sharma; Kar Wai Fok; Vrizlynn L. L. Thing - [90%] Statistical Adversaries: Natural Backdoor-like Features in Vision Datasets
Paul K. Mandal; Pavan Reddy; Tristan Malatynski - [90%] Boundary-Seeking GAN-Augmented TabTransformer for Adversarially Robust Intrusion Detection
Raihan Sultan Pasha Basuki; Aliyah Kurniasih - [90%] Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model
Sibo Wang; Jie Zhang; Shiguang Shan; Xilin Chen; Wen Gao - [90%] Just Testing, Move Along: Evasion of LLM-based System Log Interpretation by Prompt Injection
Max Landauer; Florian Skopik; Markus Wurzenberger; Franciszek Górski; Mateusz Krzysztoń - [90%] SignDeepSC: A Semantic Signature-based Approach for Robust Semantic Communication
Khalil Alhaj; Razane Tajeddine; Hadi Sarieddeen - [90%] Efficient LLM Adversarial Training via Low-Rank Defense and Circuit-Guided Surrogates
Weiyi He; Yuping Lin; Jiliang Tang; Yue Xing - [89%] KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems
Chanwoo Choi; Euntae Kim; Kyuho Lee; Youngsam Chun; Jinhee Jeong; Eunmi Kim; Myunggyo Oh; Junseo Jang; Buru Chang - [89%] AMRM-Pure: Semantic-Preserving Adversarial Purification
Zhihao Dou; Zhiqiang Gao; Dongfei Cui; Weida Wang; Qinjian Zhao; Dinggen Zhang; Jun Yan; Zeke Xie; Shufei Zhang - [89%] UTS at ELOQUENT 2026 Voight-Kampff: structural shifts in AI writing bypass state-of-the-art detectors
Dima Galat; Marian-Andrei Rizoiu - [88%] Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack
Yueming Huang; Wenhan Yao; Fen Xiao; Xiarun Chen; Weiping Wen - [88%] InfraQR: Edge-Placed QR-Inspired Structured Patch Attacks on Infrared Vision-Language Models
Xin Li; Jiaju Han; Ma Yaqi; Chengyin Hu; Yingying Zhao; Jiahuan Long; Fengyu Zhang; Yahui Chai - [88%] I2VShield: An Efficient Proactive Defense Framework against DiT-based Image-to-Video Models
Yimao Guo; Zuomin Qu; Wei Lu - [88%] Physically Real-time Infrared Attack against Optical Flow Estimation Networks
Shen You; Wei Jiang; Jiarui Liu; Yijian Ye; Qiuzhen Lin; Xiangtao Li; Ka-Chun Wong - [88%] DiffAttack: Evasion Attacks Against Face Recognition via Latent Diffusion Models
Omid Ahmadieh; Nima Karimian - [87%] Generative Testing of Automated Speech Recognition Systems
Yanis Xabier Wilbrand Peña; Oliver Weißl; Andrea Stocco - [87%] VanillaBench: The Hidden Accuracy Cost of Adversarial Robustness
Niklas Bunzel - [86%] T5-CSBoost: Adversarial Perturbation Resistant LLM Fingerprinting
Gayan K. Kulatilleke; Mahsa Baktashmotlagh; Siamak Layeghy; Marius Portmann - [86%] Target-Aware Interaction-Guided Reinforcement Learning for Black-Box Node Injection Attacks on Graph Neural Networks
Yi Lan; Ye Yuan - [86%] Controllability-Aware Adversarial Examples Against LLM-Based Network Traffic Classifiers
Zhenpeng Li - [86%] SpeechGuard: Online Defense against Backdoor Attacks on Speech Recognition Models
Jinwen Xin; Xixiang Lv - [86%] AdvSerial: Physical Adversarial Attacks on Infrastructure-mounted Pedestrian Detectors via Semantic Feature Suppression
Yuanhao Huang; Yilong Ren; Jinlei Wang; Xuesong Bai; Jinchuan Zhang; Haiyang Yu - [84%] Banshee: Target Switch Attacks on Gimbal-Stabilized Visual Tracking Systems via Acoustic Injection
Jiarui Li; Joseph Brewington; Qingzhao Zhang; Z. Morley Mao - [84%] Imperceptible and Reversible Adversarial Examples against Vision-Language Models for Privacy Protection
Qi Lu; Ziqi Zhou; Yufei Song; Zijing Li; Lulu Xue; Minghui Li; Shengshan Hu; Leo Yu Zhang - [84%] ALLUDE: A Unified Evaluation System for Configurable Attacks in Differentiable Environments
Mansi Phute; Alexander Greenhalgh; Matthew Hull; Haoran Wang; Alec Helbling; ShengYun Peng; Elliott Faa; Willian Lunardi; Martin Andreoni; Wenke Lee; Duen Horng Chau - [84%] Generalization and Trade-off in Adversarial Training: An RKHS Perspective via Kernel Integral Operators
Yiling Xie; Xiaoming Huo - [83%] ISPCloak: Weaponizing ISP for Optimization-Free Physical Camouflage against Deepfake Detectors
Jiale Zhao; Jiajun Wan; Lei Tang; Ye Qin; Kebing Jin; Jinghui Qin - [81%] Occluding the Solution Space: Planner-Agnostic Adversarial Attacks on Tolerance-Aware Manipulation
Keke Tang; Tianyu Hao; Weilong Peng; Hao Jiang; Feng Wu; Peican Zhu; Jianmin Ji; Zhihong Tian - [81%] Mechanistic Interpretability of LLM Jailbreaks via Internal Attribution Graphs
Anupam Wagle; Ifrat Ikhtear Uddin; Chaowei Zhang; Longwei Wang - [81%] EXE-Bench: Ranking the Tradeoffs of AI-based Windows Malware Detectors for Real-World Usability
Andrea Ponte; Daniel Gibert; Matous Kozak; Dmitrijs Trizna; Maura Pintor; Battista Biggio; Fabio Roli; Luca Demetrio - [81%] Temporal Poisoning: Clean-Label Backdoors via Event Redistribution in SNNs
Roberto Riaño; Gorka Abad; Stjepan Picek; Aitor Urbieta - [80%] Embedding Inference Attack
Cedric Fitiavana Raelijohn; Sébastien Gambs; Jean-Francois Rajotte - [80%] Adversarial LassoNet: Robust Feature Selection via Stability-Driven Sparse Learning
Zhen Huang; Peicheng Xu; Junbiao Pang; Yulong Zheng - [79%] When cheap gradients fail: the measurement cost of attacking quantum classifiers
Bacui Li; Chandra Thapa; Tansu Alpcan; Udaya Parampalli - [79%] Input-Aware Dynamic Backdoor Attack Against Quantum Neural Networks
Junrui Zhang; Zemin Chen; Lusi Li; Mohammad Ghasemigol; Daniel Takabi; Rui Ning - [79%] Code-Poisoning Property Inference Attacks
Xukun Luan; Yuhui Gong; Gang Zhang; Zixuan Huang; Yuanguo Bi; Xuesong Li; Jinyan Liu - [79%] Lilith: Backdoor Generalization under Training-Inference Trigger Shift
Zhou Feng; Jiahao Chen; Chunyi Zhou; Yuan Su; Tianyu Du; Yuwen Pu; Jianhai Chen; Jinbao Li; Shouling Ji - [78%] Technical Report on the CVPR 2026@AdvML Workshop Challenge
Tianyuan Zhang; Zonglei Jing; Jiangfan Liu; Ligong Zhang; Ke Ma; Chengzhi Sun; Xiaohai Xu; Zhirui Zhang; Qianqian Xu; Qingming Huang; Hanyu Fang; Junhua Liu; Zheng Wang; Xiaoliang Liu; Yuanbo Li; Shuai Gui; Bin Wang; Menghe Zheng; Jing Nie; Hanyang Meng; Zeyang Zhang; Xiang Zhang; Yongxuan Zhu; Rui Ding; Hainan Li; Yongkang Zhang; Zhilei Zhu; Xianglong Kong; Jin Hu; Zonghao Ying; Yisong Xiao; Lei Chen; Haotong Qin; Jiakai Wang; Aishan Liu; Ruikai Li; Julia Karbing; Yinpeng Dong; Zhenfei Yin; Shao Jing; Xia Hu; Jingyi Xu; Juntao Dai; Xinyun Chen; Vishal M. Patel; Xianglong Liu; Dawn Song; Alan Yuille; Philip H. S. Torr; Dacheng Tao - [77%] PRA-RAG: Provably Robust Aggregation in Retrieval-Augmented Generation against Retrieval Corruption
Xue Tan; Yi Zheng; Chang Huo; Yunruo Zhang; Yu Liu; Hao Luan; Zhuyang Yu; Xiaoyan Sun; Ping Chen; Jun Dai - [77%] Fixed-Set Robustness in Programming by Example: Example Corruption and Semantic Partition Recovery
Yuan Si; Jialu Zhang - [77%] Probabilistic Robustness in Medical Image Classification
Yi Zhang; Siddartha Khastgir; Xingyu Zhao - [77%] Higher-Order Certified Robustness for Regression
Jie Zhang; Natalie Frank - [77%] RAGuard: A Layered Defense Framework for Retrieval-Augmented Generation Systems Against Data Poisoning
Pushkal Kumar; Tucker Nielson; Tanish Kolhe; Shubham Zala; Vincent Li - [77%] Recover, Decode, Reguard: Guard-Agnostic Defense Amplification againstEncoded VLM Jailbreaks
Haoyu Zhang; Zhuoxi Wang; Shibo Zheng; Zijian Xiao; Xiangchen Guan; Mohammad Zandsalimy; Shanu Sushmita - [77%] IGME: Efficient Chained Method Ensemble for Transferable Semantic Segmentation Attacks
Mengqi He; Jing Zhang - [75%] Adversarial Deepfake Generation and an Investigation of Purification-Based Adversarial Detection
Junghyun Kim; Seunghyun Kim; Jiyoung Woo - [75%] Driving up Inference Energy on SNNs: Per-Sample and Universal Sponge Attacks
Spyridon Raptis; Haralampos-G. Stratigopoulos - [74%] Replicating the Signature: Unsupervised Targeted Impersonation Attack on RF Fingerprinting
Haytham Albousayri; Bechir Hamdaoui - [74%] The Power of Backdoor Absorption in Community Training
Issam Seddik; Sami Souihi; Mohamed Tamaazousti; Sara Tucci Piergiovanni - [74%] CPInj: Uncovering Prompt Injection Risks in Textual Collaborative Prompt Optimization
Xinting Liao; Behnoosh Zamanlooy; Masoumeh Shafieinejad; David B. Emerson; Ruinan Jin; Deval Pandya; Xiaoxiao Li - [74%] GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning
Zhaoqi Wang; Zijian Zhang; Xiaomei Yuan; Pengtao Kou; Jiamou Liu; Zhen Li; Liehuang Zhu - [73%] LBA: Textual Hard-Label Adversarial Attack under Low Query Budgets
Shixin Guo; Ming Zhong; Xuhong Zhang; Dandan Zhao; Zhe Wang; Bo Zhang; Shouling Ji; Hao Peng - [73%] Rethinking Brain Decoding with CLIP: The Role of Adversarial Robustness
Byeongseo Bok; Futa Waseda; Jun Liu; Isao Echizen - [73%] Robustifying Vision-Language Models via Test-Time Prompt Adaptation
Xingyu Zhu; Huanshen Wu; Shuo Wang; Beier Zhu; Jiannan Ge; Jiaheng Zhang; Long Chen - [73%] Defense Against LLM Backdoors using Critical Neuron Isolation Pruning
Yuxi Li; Zhibo Zhang; Kailong Wang; Xingshuo Han; Ling Shi; Haoyu Wang - [73%] TIGA: Trajectory-Injected Generative Attack against Black-box AIGC Detectors
Xia Du; Zhuosen Bao; Zheng Lin; Jizhe Zhou; Jiawei Lian; Chi-man Pun; Jun Luo; Wei Ni; Symeon Chatzinotas - [73%] ToxScreen: Detecting Whether an LLM Has Been Poisoned
Anthony Hughes; Nicole Xing; Collin Francel; Andy Kim; Andrew Draganov - [73%] Benign on Label, Malicious by Design: Clean-Label Dormant-to-Activated Backdoor via Machine Unlearning with Removable Camouflage
Dongdong Zhao; Can Li; Xiang Yao; Fan He; Qihang Ge; Baogang Song - [72%] RoME: Robust Mixture of Low-Rank Experts against Multiple Adversarial Perturbations
Woo Jae Kim; Kyle Min; Suhyeon Ha; Joonsung Jeon; Sung-eui Yoon - [72%] Adversarial Prompting Framework for AI Safety Assessment
Yash Bhatnagar; Kunal Banerjee; Anirban Chatterjee - [72%] On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline
Yuchen Ren; Zhengyu Zhao; Chenhao Lin; Bo Yang; Chao Shen - [71%] Signal-based Model Access Risk Analysis for AI System Operations Security
Maria Mahbub; Steven Young; Amir Sadovnik; Edmon Begoli; Chris Rugenstein; Donald Coulter; Anthony Ayodele - [71%] How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions
Yukai Zhou; Feiyang Lu; Xiaokai Mao; Jinfei Liu; Wenjie Wang - [70%] Unlearnable Faces: Privacy Protection Surviving Extraction Pipeline
Byunghoon Oh; Sunghwan Park; Jaewoo Lee - [70%] Optimized Instance Alteration for Explaining and Assessing Robustness of Classifiers
Evgenii Kuriabov; David Miller; Jia Li - [70%] Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation
Genglin Liu; Muye Zhang; Krishnamurthy Viswanathan; Nichole J. Hansen; Blaž Bratanič; Nathan L Clement; Shalini Ghosh; Ariel Fuxman - [69%] Can Watermarking Techniques Help Prevent LLM Model Stealing?
Elette Boyle; MohammadTaghi Hajiaghayi; Keivan Rezaei; Suho Shin; Amos Stern - [69%] PhantomSeal: Proactive Deepfakes Defense with Identity/Context Protection and Forensic Tracing
Liangqin Ren; Zeyan Liu; Ye Wang; Yuxin Chen; Fengjun Li; Bo Luo - [68%] Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models
Dongdong Yang; Deyue Zhang; Zhao Liu; Zonghao Ying; Wenzhuo Xu; Jiankai Jin; Xiangzheng Zhang; Quanchen Zou - [67%] Adversarial Robustness of Phishing Email Detection: A Comparative Study of TF-IDF + Logistic Regression and Fine-Tuned DistilBERT
Tanveer Ahmed; Seyedali Pourmoafil - [67%] SoK: Adversarial Robustness of the Variational Quantum Eigensolver via Red-Teaming
Ahmed Azaz Humdoon; Cheng Chu; Lei Jiang; Qian Lou; Mengxin Zheng - [66%] Bad Memory: Evaluating Prompt Injection Risks from Memory in Agentic Systems
Soham Gadgil; David Alexander; Sai Sunku; Franziska Roesner - [66%] Anti-Backdoor Coreset Selection via Cumulative Entropy
Qi Zhao; Christian Wressnegger - [66%] Piggybacking on Perception: Stealthy Concurrent Audio Prompt Injections against Multimodal LLM Agents
Mingxiao Liu; Yitong Li; Haoren Zhao; Yaoxiang Bian; Jianan Ma; Jian Zhang; Jialuo Chen; Xinhao Deng; Zhen Wang - [65%] Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems
Qiang Han; Jie Wu; Bo Chen - [65%] Two Sides of the Same Coin: Learning the Backdoor to Remove the Backdoor
Qi Zhao; Christian Wressnegger - [65%] Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models
Tuan Duong Trinh; Naveed Akhtar; Basim Azam - [65%] Beyond the Bidirectional Promise: Re-evaluating the Robustness of Diffusion Language Models
Saurabh Yadav; Badri Narayana Patro; Vijay Srinivas Agneeswaran - [64%] Chameleon: Recovering Cyber-Physical Systems from Memory Corruption Attacks via ML Surrogates
Mohsen Salehi; Karthik Pattabiraman - [64%] Burst Spiking Neural Networks
Jiahong Zhang; Sijun Shen; Man Yao; Han Xu; Mingqiang Huang; Yonghong Tian; Bo Xu; Guoqi Li - [64%] Optimizing Against Safety Representations: Activation-Guided Adversarial Suffixes and the Geometry of Refusal
Ege Çakar; Hannah Guan; Kayden Kehe - [64%] Event Burst Trigger: An Availability Backdoor Attack on Event-Based SNN Object Detection
Jaesun Baek; Chanwook Lee; Eun-Kyu Lee - [64%] DiffUE: Enhancing Utility-Unlearnability Trade-off of Unlearnable Examples via Diffusion Autoencoders
Syed Irfan Ali Meerza; Oktay Ozturk; Amir Sadovnik; Jian Liu - [64%] Salience Induction against Multi-Hop RAG Agents: Threat and Defense
Xingfu Zhou; Pengfei Wang; Yuan Zhou; Wei Xie; Xu Zhou - [63%] Interval Certifications for Multilayered Perceptrons via Lattice Traversal
Merkouris Papamichail; Konstantinos Varsos; Giorgos Flouris; João Marques-Silva - [63%] ChannelGuard: Safe Models Do Not Compose into Safe Multi-Agent Systems
Elias Hossain; Md Mehedi Hasan Nipu; Fatema Tuj Johora Faria; Tasfia Nuzhat Ornee; Maleeha Sheikh - [63%] GLST: Defending Confidence-Driven V2X Collaborative Perception Against Stealthy Multi-Attacker Feature Injection
Ji He; Ying Wang; Lijie Zheng; Xinghui Zhu; Yulong Shen; Xiaohong Jiang - [63%] Borrowed Strength: Best-of-N Search over a Code EncodingBreaks Self-Check Jailbreak Defenses
Haoyu Zhang; Shibo Zheng; Xiangchen Guan; Zhuoxi Wang; Zijian Xiao; Mohammad Zandsalimy; Shanu Sushmita - [62%] Formal Mechanisms for Market Stability in Self-Interested Agent Societies: A Marketplace Simulation Study
Eugene Ng Yi Sheng; Bingquan Shen - [62%] ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors
Christos Korgialas; Gabriel Lee Jun Rong; Dion Jia Xu Ho; Pai Chet Ng; Xiaoxiao Miao; Konstantinos N. Plataniotis - [62%] Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models
Xingkai Peng; Jun Jiang; Jiayang Liu; Kejiang Chen; Weiming Zhang - [62%] Defending Against Backdoor Attacks via Alignment Checking in Model-Contrastive Federated Learning
Hongliang Zhang; Zhongyuan Yu; Guijuan Wang; Tianqing He; Wenshuo Ma; Xiaosong Zhang; Jiguo Yu - [61%] Intentional Electromagnetic Interference Attacks on Facial Recognition
Tyler Fitzsimmons; Adam Czajka - [60%] FedCVESA: Taking Away Training Data in Federated Learning via Correlation Value Encoding and Segmented Aggregation
Chongkai Li; Bang Zhang; Wenjian Luo - [60%] Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting
Aya Spira; Stav Cohen; Elad Feldman; Ron Bitton; Avishai Wool; Ben Nassi - [60%] World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning
Tong Nie; Yuewen Mei; Junlin He; Yihong Tang; Jian Sun; Wei Ma - [59%] ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models
Zhihao Dou; Qinjian Zhao; Zhiqiang Gao; Sumon Biswas - [59%] Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes
Weiying Chen; Junlong Shen; Zhanyuan Guo; Xiaoou Zhou - [59%] QR-Structured Thermal Triggers for Targeted Semantic Attacks on Infrared Vision-Language Models
Xiang Chen; Yingying Zhao; Chao Li; Jiaju Han; Ben Zhang; Ang Li; Jiahuan Long; Yiwei Wei; Jiujiang Guo; Chengyin Hu - [58%] Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces
Junlong Liu; Haobo Wang; Weiqi Luo; Xiaojun Jia - [58%] ADS-C: Antidistillation Sampling for Classification
Khawaja Abaid Ullah; Mohammad Javad Khojasteh - [58%] Pangram 4 Technical Report
Ben Glickenhaus; Katherine Thai; Jenna Russell; Elyas Masrour; Yue Han; Max Spero; Bradley Emi - [57%] Privacy-Preserving and Verifiable Approximate Distributed Coded Computing
Xavier Martínez-Luaña; Alba Gude-Santos; Manuel Fernández-Veiga; Rebeca P. Díaz-Redondo - [57%] Towards Robustness against Typographic Attack with Training-free Concept Localization
Bohan Liu; Wenqian Ye; Guangzhi Xiong; Zhenghao He; Sanchit Sinha; Aidong Zhang - [57%] On the Principles of Deep Feedforward ReLU Networks
Changcun Huang - [57%] Securing Autonomous Vehicle Systems via Twin-Aware Federated Reinforcement Learning
Zifan Zhang; Minghong Fang; Dianwei Chen; Zhuqing Liu; Prashant Khanduri; Xianfeng Yang; Anupam Das; Yuchen Liu - [57%] Maximally Robust Satisficing Bayesian Optimization
Samuli Kinnunen; Petrus Mikkola; Antti Niskanen; Arto Klami - [57%] Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation
Fazhong Liu; Zhuoyan Chen; Haozhen Tan; Yan Meng; Guoxing Chen; Haojin Zhu - [56%] OpenEvoShield: Dual Non-Stationary Continual Defense for Open-World Multi-Agent System Attacks
Litian Zhang; Chaozhuo Li; Yuting Zhang; Zejian Chen; Bingyu Yan; Qiwei Ye - [56%] Steal the Patch Size: Adversarially Manipulate Vision-Language Models
Kai Hu; Akash Bharadwaj; Weichen Yu; Matt Fredrikson - [56%] Cross-Domain Generalization Failure in Lightweight Intrusion Detection Models for IIoT Networks
MD Azizul Hakim; Md Shihab Uddin; Talha Ibne Anis - [55%] Securing Multimodal AI through Internal Information Decomposition
Jehyeok Yeon; Hyeonjeong Ha; Qiusi Zhan; Heng Ji - [55%] AGVBench: A Reliability-Oriented Benchmark of Data Augmentation for Vein Recognition
Haiyang Li; Yuming Fu; Qun Song; Hongchao Liao; Jing Chen; Mounim A. EI-Yacoubi; Yang Liu; Siyuan Ma; Xin Jin - [55%] Security Analysis for SCONE Logic Locking
Akashdeep Saha; Mohammed Nabeel; Johann Knechtel; Michail Maniatakos; Ozgur Sinanoglu - [55%] ORAN-DEFEND: Subspace Detection and Sanitization of Backdoor DRL xApps in Open RAN
Md Raihan Uddin; Fatemeh Lotfi; Tolunay Seyfi; Fatemeh Afghah - [55%] (A)iSpy: Parasitic Trojans for Machine Learning Infrastructure
Habibur Rahaman; Qipan Xu; Zafaryab Haider; Prabuddha Chakraborty; Swarup Bhunia; Fnu Suya - [55%] Self-State Attacks on Self-Hosted AI Agents: How Far Can OS Defenses Go?
Yimeng Chen; Nathanaël Denis; Roberto Di Pietro; Jürgen Schmidhuber - [54%] ShadowPickle: Evading Machine Learning Model Scanners via Stealthy Pickle Deserialization Attacks
Dhruv Pradhan; Sarang Nambiar; Ezekiel Soremekun - [53%] Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization
Bingjun Luo; Jialin Guo; Yue Yao; Xinpeng Ding - [53%] Fast SDP certification of neural networks : towards large multi-class datasets
Margot Boyer; Clément Rambour; Zacharie Alès; Amélie Lambert - [53%] Robust Bayesian Decision Making under Adversarial Uncertainty
Haripriya Harikumar; Sammie Katt; Yasir Zubayr Barlas; Samuel Kaski - [53%] CDN Tsunami: Exploiting HTTP/3-HTTP/1.1 Conversion for DoS Attacks
Ziyu Lin; Tianlong Su; Yingjie Lin; Prosanta Gope; Yinzhi Cao; Ximeng Liu; Biplab Sikdar - [52%] Knowledge Base Poisoning Attacks and Defense for Policy-Aware LLM-RAG Framework
Om Solanki; Lopamudra Praharaj; Deepti Gupta; Maanak Gupta - [52%] Active Learning on Adversarially Corrupted Graphs
Marco Bressan; Nicolò Cesa-Bianchi; Tommaso d`Orsi; Emmanuel Esposito; Silvio Lattanzi - [52%] Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation
Rabimba Karanjai; Yang Lu; Hemanth Hegadehalli Madhavarao; Lei Xu; Weidong Shi - [52%] Inpainting Insights: Elevating Visual XAI with Photorealistic Perturbations
Josef Lindl; Mariana Chaves; Damien Garreau - [52%] Are the High-weight Neurons the Important Ones in Image Classification Neural Networks?
Qitao Chen; Dongfu Yin; F. Richard Yu - [51%] TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG
Chahana Dahal; Zuobin Xiong - [51%] AEGIS: A Mechanism-Guided Defense against Visual Synonym Jailbreaks in Text-to-Image Models
Yuanmin Huang; Zhenfei Zhang; Mi Zhang; Geng Hong; Qinqin He; Jialing Tao; Hui Xue; Min Yang - [51%] LiST: Lipschitz Scaling Training for Robust and Calibrated Neural Networks
Arthur Chiron; Franck Mamalet; Thomas Massena; Thomas Deltort; Mathieu Serrurier - [51%] Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices
Yaxin Li; Hao Wang; Yanda Shao; Shuhao Zhang; Yan Long - [51%] Distributed Denial of Science: How Indirect Data Poisoning of AI Systems Can Industrialize Scientific Fraud
Bálint Gyevnár; Atoosa Kasirzadeh; Nihar B. Shah - [50%] A Comparison of Data Augmentation Methods for Training Deep Neural Networks on Synthetic Aperture Sonar
C. J. Moore; Gregory D. Vetaw; Jordan Malof - [50%] TYPO: Instruction-Dense Visual Jailbreaks against Commercial Closed-Source Image-Generation Models
Meng Xie; Li Zeng; Hangtao Zhang; Xianlong Wang; Ziqi Zhou; Pengpeng Qiao; Zhetao Li - [49%] Beware What You Autocomplete: Forensic Attribution of Backdoored Code Completions
Anjun Gao; Yueyang Quan; Zhuqing Liu; Minghong Fang - [48%] Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring
William Hackett; Peter Garraghan - [48%] Overloading Large Vision-Language Models for Jailbreaking
Haoyu Zhang; Yangyang Guo; Mohan Kankanhalli - [48%] 1-Lipschitz Neural Networks on Hadamard Manifolds
Davide Murari; Marta Ghirardelli; Ben Adcock; Elena Celledoni; Brynjulf Owren; Carola-Bibiane Schönlieb - [48%] VulnGym: Evaluating Vulnerability Management Strategies against Advanced Persistent Threats
Sofia Della Penna; Lorenzo Parracino; Luciano Pianese; Vittorio Orbinato; Roberto Natella - [47%] !Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics
Stefan Bühler; Mark Schutera - [47%] Ball Differential Privacy: How to Mitigate Data Reconstruction with Less Noise
Joseph Margaryan; Nirupam Gupta - [47%] Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization
Yuxin Huang; Ziming Hong; Mingming Gong; Wanyu Wang; Jing Zhang; Tongliang Liu - [47%] Rethinking Penetration Testing for AI-Enabled Systems: From Resource Compromise to Behavioral Objective Violation
Mohammad Allahbakhsh; Mohammad Hassan Bahari; Moslem Attar-Raouf - [47%] Adversarial Prompts for Acceptance Collapse in Speculative Decoding
Run Wang; Chaoyi Zhou; Xi Liu; Yi Zhu; Amir Salarpour; Pedram MohajerAnsari; Zhi-Qi Cheng; Feng Luo; Siyu Huang; Mert D. Pesé - [47%] GPT-Red: Automated Red Teaming via Self-Play at Scale
Eric Wallace; Christopher A. Choquette-Choo; Nikhil Kandpal; Sam Toyer; Dylan Hunn; Stephanie Lin; Yuxin Wen; Xiangyu Qi; Christopher Wolff; Zizhao Wang; Milad Nasr; Sicheng Zhu; Chuan Guo; Juan Felipe Cerón Uribe; Kaiwen Wang; Aiden Low; Kai Xiao; Kai Chen - [47%] Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation
Marco Alecci; Francesco Marchiori; Iyiola Emmanuel Olatunji; Tegawendé F. Bissyandé; Jacques Klein - [46%] SoK: Federated Learning for Intrusion Detection in Vehicular Networks
Yahya Shahsavari; Reza Nourmohammadi; Sara Rouhani; Kaiwen Zhang - [46%] Robust Estimation of Sparse Numerical Vectors under Local Differential Privacy
Puning Zhao; Zhikun Zhang; Shaowei Wang; Sheng Yue; Bangzhou Xin; Tianhang Zheng; Pengfei Zhang; Xiaochun Cao - [44%] On the Limits of Support-Preserving Alignment and Bounded Filtering
Aryan Dutt; Rui Mao; Anupam Chattopadhyay - [44%] Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models
Zikai Zhang; Rui Hu; Olivera Kotevska; Jiahao Xu - [44%] MOSAIC: Knowledge-Guided CLI Command Composition Attack in LLM Coding Agents
Jiangrong Wu; Huaijin Wang; Yihao Zhang; Yuhong Nan; Shuai Wang - [44%] Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring
Jennifer Za; Julija Bainiaksina; Nikita Ostrovsky; Tanush Chopra; Victoria Krakovna - [44%] Attacking Graph Foundation Models Through Their Shared Representation
Pankaj Kumar; Subhankar Mishra - [44%] Do LLMs Know Their Vulnerable Scenarios?
Ziheng Peng; Huiqi Deng; Haoran Jing; Xuankun Rong; Jiahui Han; Xiting Wang; Na Zou; Xia Hu - [43%] Concept-based Visual Counterfactual Explanations with Diffusion Models
Yassine Oueslati; Daniil Kirilenko; Martin Gjoreski; Marc Langheinrich - [43%] Distributed Attacks in Persistent-State AI Control
Josh Hills; Ida Caspary; Asa Cooper Stickland - [43%] Multi-Agent AI Control: Distributed Attacks Hamper Per-Instance Monitors
Oliver Makins; Orazio Angelini; Zohreh Shams; Mary Phuong - [43%] Enhanced Byzantine-Robust Federated Learning Via Truncated-Quadratic Loss for Heterogeneous Data
Zhi-Yong Wang; Hao Nan Sheng; Werner Stefan; Hing Cheung So; Linqi Song; Weitao Xu - [43%] MemPoison: Uncovering Persistent Memory Threats and Structural Blind Spots in LLM Agents
Jifeng Gao; Kang Xia; Yi Zhang; Xiaobin Hong; Mingkai Lin; Xingshen Wei; Wenzhong Li; Sanglu Lu - [43%] IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests
Ankur Singh; Jinqiu Yang; Tse-Hsun Chen - [43%] MiSS: A Logic-Driven Explanation of Minimal Sufficient Coalitions for Point Cloud Classifiers
Mengda Xing; Jean-Marie Lagniez - [43%] The Grokked Illusion: True Equilibrium Mitigates Catastrophic Forgetting
Xiaotian Zhang; Lai Shun Chan; Yue Shang; Entao Yang; Ge Zhang - [42%] When Routes Run Out: Adversarial Co-Learning and Explainable Robustness in Quantum Repeater Networks
Brennan Bell; Inti Gabriel Mendoza Estrada; Andreas Trügler; Paul Erker - [42%] Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability
Lingwei Wei; Dou Hu; Wei Zhou; Songlin Hu; Philip S. Yu - [42%] CoG-Guided Weight Correction for Fault-Tolerant Deep Neural Networks
Bahram Parchekani; Samira Nazari; Ali Azarpeyvand; Mohammad Hasan Ahmadilivani; Tara Ghasempouri; Jaan Raik - [42%] End-to-End Differential Privacy in Training Deep Neural Network Classifiers
Huaiyuan Rao; Calvin Hawkins; Alexander Benvenuti; Matthew Hale - [41%] Robust Critics: Defending LLMs Against Multi-Turn Attacks
Roman Belaire; Arunesh Sinha; Pradeep Varakantham - [41%] MusicMark: A Robust Generative Watermarking Framework for Music Generation
Seohwan Yun; Jeeyoung Yun; Yongjin Kim; Juyeon Lee; Sungwoong Kim - [41%] Interleaved Noise Injection Improves Clean, Corrupted, and OOD Performance
Matt L. Wiemann; Peter Melchior; Andrew K. Saydjari - [41%] TriShieldRAG: A Three-Ring Defense-in-Depth Framework Against Knowledge Corruption in Retrieval-Augmented Generation
Susil Kumar Mohanty; Rohit Patel; Kosuru Yuvaraj; Jeenal Chaudhary; Disha Singhania - [40%] Population-Based Multi-Objective Training of Discriminators for Semi-Supervised GANs
Francisco Sedeño; Francisco Chicano; Jamal Toutouh - [40%] An Exploratory Study of Malicious Link Posting on Social Media Applications
Muhammad Hassan; Mahnoor Jameel; Masooda Bashir - [40%] Verification of Dynamic Holographic Behavior in Identity Documents
Glen Pouliquen; Joseph Chazalon; Guillaume Chiron; Thierry Géraud; Ahmad Montaser Awal - [40%] When Data Imbalance Helps: Robust Generalization Through Shortcut Saturation
Cheng-Ting Chou; Duc Binh Hoang - [40%] Lipschitz Continuity in Deep Learning: A Systematic Review of Theoretical Foundations, Estimation Methods, Regularization Approaches, and Certifiable Robustness
Róisín Luo; James McDermott; Colm O'Riordan - [40%] Enhancing Attack Detection Capabilities in BACnet/IP Networks Using Machine-Learning Models
Derek Manzella; John D. Hastings
2026-06 (295 papers)
- [100%] CEAR: Certified Ensemble Adversarial Robustness in DNNs
Daniel Sadig; Mohammadreza Maleki; Hamed Karimi; Reza Samavi - [100%] Beyond Waveform Robustness: Robust Feature-Vocoder Adversarial Attacks on Automatic Speech Recognition
Yifan Liao; Zongmin Zhang; Zhen Sun; Yuhui Sun; Xinhu Zheng; Xinlei He - [100%] MAPE: Defending Against Transferable Adversarial Attacks Using Multi-Source Adversarial Perturbations Elimination
Xinlei Liu; Jichao Xie; Tao Hu; Peng Yi; Yuxiang Hu; Shumin Huo; Zhen Zhang - [99%] A combination of noise and bilateral filters achieve supralinear and scalable adversarial robustness in CNNs
Nicolas Stalder; Benjamin F. Grewe; Matteo Saponati; Pau Vilimelis Aceituno - [99%] Adversarial Attacks Already Tell the Answer: Directional Bias-Guided Test-time Defense for Vision-Language Models
Liangsheng Liu; Si Chen; Jiamin Wu; Weiwei Feng; Zhixin Cheng; Xiaotian Yin; Wenfei Yang; Tianzhu Zhang - [99%] Reinforcement Learning Disrupts Gradient-Based Adversarial Optimization
Xinhai Zou; Chang Zhao; Alireza Aghabagherloo; Dave Singelée; Robin Degraeve; Bart Preneel - [99%] A Classifier-Agnostic Zero-Shot Adversarial Attack Detection via CLIP
Hodaya Krakover; Meir Yossef Levi; Eyal Gofer; Guy Gilboa - [98%] Investigating Adversarial Robustness of Multi-modal Large Language Models
Hashmat Shadab Malik; Muzammal Naseer; Salman Khan - [98%] Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models
Hashmat Shadab Malik; Muzammal Naseer; Salman Khan - [98%] Robust Ensemble of Selectively Strengthened and Augmented Predictors
Parsa Memarzadehsaghezi; Zahra Hashemi; Pooria Madani; Mehran Ebrahimi - [98%] Mirage: a Clean-Label Backdoor against LiDAR 3D Object Detection
Ziba Parsons; Ang Li - [98%] Vulnerability of Natural Language Classifiers to Evolutionary Generated Adversarial Text
Manjinder Singh; Alexander E. I. Brownlee; Mohamed Elawady - [97%] Making Brain-Computer Interfaces More Secure
Md Fahimul Kabir Chowdhury; Gahangir Hossain - [97%] Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction
Lijia Yu; Jiuxin Cao; Yuchen Qiang; Changhao Chen; Yifei Huang; Bo Liu - [97%] Categorical Robustness Assessment for Machine Learning based Network Intrusion Detection Systems
Mayank Raj; Nathaniel D. Bastian; Lance Fiondella; Gokhan Kul - [97%] Quality-Preserving Imperceptible Adversarial Attack on Skeleton-based Human Action Recognition
Ziyi Chang; Kanglei Zhou; Xiaohui Liang; Hubert P. H. Shum - [97%] Defending against Adaptive Prompt Injection Attacks via Reasoning-enabled Task Alignment
Lipeng He; Yihan Wang; Jiawen Zhang; N. Asokan - [97%] Veriphi: Attack-Guided Neural Network Verification with Dataset-Dependent Training Methods
Pratik Deshmukh; Kartik Arya; Vasili Savin - [97%] TrajRS: Towards Certified Robustness in Pedestrian Trajectory Prediction
Liang Zhang; Gaojie Jin; Yao Shi; Quanzhi Li; Cheng-Chao Huang; David N. Jansen; Lijun Zhang - [97%] Clustering Unsupervised Representations as Defense against Poisoning Attacks on Speech Commands Classification System
Thomas Thebaud; Sonal Joshi; Henry Li; Martin Sustek; Jesus Villalba; Sanjeev Khudanpur; Najim Dehak - [97%] Improving Certified Robustness via Adversarial Distillation
Matteo Melis; Jesus Martinez Del Rincon; Vishal Sharma - [96%] SORA: Free Second-Order Attacks in Fast Adversarial Training
Mazdak Teymourian; Ramtin Moslemi; Farzan Rahmani; Mohammad Hossein Rohban - [96%] Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable… Attacks Are All You Need to Break LLMs
Vincent Limbach; Jonas Dornbusch; David Lüdke; Stephan Günnemann; Leo Schwinn - [96%] SHIELD-IDS: Structurally Heterogeneous Ensemble with Integrated Layered Defense for Intrusion Detection Systems
Maryam Zaman; Muhammad Khuram Shahzad - [96%] Toward Trustworthy AI: Multi-Target Adversarial Attacks and Robust Defenses for Continuous Data Summarization
Yuefang Lian; Longkun Guo; Zhongrui Zhao; Zhigang Lu; Yanan Cai; Shuchao Pang; Dachuan Xu; Jason Xue - [96%] Neural Variability Enhances Artificial Network Robustness
Robin Preble; Praveen Venkatesh; Stefan Mihalas; Kameron Decker Harris - [96%] Pseudo-Feature Padding: A Lightweight Defense Against False Data Injection in Power Grids
Farhin Farhad Riya; Shahinul Hoque; Yingyuan Yang; Jinyuan Sun; Kevin Tomsovic - [96%] Color Matters: Trigger Color Affects Success in Federated Backdoor Attacks
Kavindu Herath; Joshua C. Zhao; Saurabh Bagchi - [96%] The Role of Input Dimensionality in the Emergence and Targeted Control of Adversarial Examples
Nasrin Malekzadeh Goradel; Niccolo Pancino; Yaser Gholizade Atani; Benedetta Tondi; Giovanni Bellettini; Mauro Barni - [96%] PLAA: Packet-level Adversarial Attacks in Network Traffic Detection
Jinhao You; Zan Zhou; Shujie Yang; Yi Sun; Lei Zhang; Changqiao Xu - [95%] Adversarial Attacks on Robot Localization Systems via Deep Feature Perturbation
Zhenyu Li; Tianyi Shang - [95%] ATLAS: A Large-Scale Evaluation Benchmark for Adversarial LiDAR Perception
Mellon M. Zhang; Siddhant Panse; Zimo Fan; Akshal Dhal; Rishit Sarkar; Glen Chou - [95%] The Confidence Trap: Calibration Attacks for Graph Neural Networks
Cuong Dang; Jiahao Zhang; Hieu Ta Quang; Dung Le; Lu Cheng; Suhang Wang - [95%] Enhancing Stateful Detection of Adversarial Attacks with Soft-labels' Temporality and Robust Similarity Approximations
De Zhang Lee; Han Fang; Ee-Chien Chang - [95%] Transferable Attack against Face Swapping in an Extended Space
Mingzhi Lyu; Yi Huang; Jun Xie; Zihao Zhao; Hong Xu; Adams Wai-Kin Kong - [95%] AEGIS: A Semantic GAN and Evidential Learning Frameworkfor Robust Adversarial Detection in Vision Sensors
Maher Boughdiri; Mounira Msahli; Albert Bifet - [94%] Digital-to-Physical Transfer of Adversarial Patches for Aerial Vehicle Detection
Jung Heum Woo; Eun-Kyu Lee - [94%] BYORn: Bootstrap Your Own Responses to Defend Large Vision-Language Models Against Backdoor Attacks
Ivan Sabolić; Marin Oršić; Josip Šarić; Sven Lončarić - [94%] Toward a Generalized Defense Across Sparse, Continuous, and Structured Parameter Attacks
Bin Duan; Zeyu Bai; Guowei Yang - [94%] MorphStrata: Layer-Specific Perturbations for Generating Morphence Students in Time-Series Moving Target Defense
Abhishek Bhardwaj; Arnav Doshi; Anusri Nagarajan; Thanh Quynh Nhu Ta; Mohammad Masum; Robert Chun; Jaydip Sen; Saptarshi Sengupta - [94%] Blackknife: Hard-Label Query-Limited Black-Box Attacks on Heterogeneous Graph Neural Networks
Honglin Gao; Junhao Ren; Lan Zhao; Yue Yang; Jindong Chang; Gaoxi Xiao - [93%] GJDNet: Robust Graph Neural Networks via Joint Disentangled Learning Against Adversarial Attacks
Canyixing Cui; Tao Wu; Xingping Xian; Xiao-Ke Xu; Mao Wang; Weina Niu - [93%] Patcher: Post-Hoc Patching of Backdoored Large Language Models
Anjun Gao; Yueyang Quan; Yufei Xia; Zhuqing Liu; Minghong Fang - [93%] Measuring Model Robustness via Fisher Information: Spectral Bounds, Theoretical Guarantees, and Practical Algorithms
Chong Zhang; Xiang Li; Jia Wang; Qiufeng Wang; Xiaobo Jin - [93%] Adversarial Attack and Disturbance Detection by Hadamard-Coded Output Representations for Object Detection and Semantic Segmentation
Lucas Görnhardt; Timo Bartels; Niklas Schwarz; Tim Fingscheidt - [93%] Rapid Poison: Practical Poisoning Attacks Against the Rapid Response Framework
David Huang; Jaewon Chang; Avidan Shah; Prateek Mittal; Chawin Sitawarin - [93%] BadWorld: Adversarial Attacks on World Models
Linghui Shen; Mingyue Cui; Xingyi Yang - [93%] Your Privacy My Cloak: Backdoor Attacks on Differentially Private Federated Learning
Xiaolin Li; Ning Wang; Ninghui Li; Wenhai Sun - [93%] Improving Adversarial Robustness via Activation Amplification and Attenuation
Taïga Gonçalves; Yongsong Huang; Tomo Miyazaki; Shinichiro Omachi - [92%] Sensitivity as a Double-Edged Sword: A Trade-off Between Discriminability and Adversarial Robustness
Kai Wang - [92%] On Improving Robustness of Deepfake Image Detectors
Abu Taib Mohammed Shahjahan; Mohammad Mannan; Abdessamad Ben Hamza; Amr Youssef - [92%] SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks
Seungwon Jeong; Jiwoo Jeong; Hyeonjin Kim; Yunseok Lee; Woojin Lee - [92%] Defending Against Malicious Finetuning by Scaling Train-time Adversarial Attacks
Haoming Wen; Shi Chen; Qingyu Shi; Siyuan Liu; Minrui Luo; Jingzhao Zhang; Tianxing He - [92%] Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance
Bohdan Turbal; Blossom Metevier; Max Springer; Aleksandra Korolova - [92%] Automated jailbreak attack targeting multiple defense strategies
Qi Wang; Chengcheng Wan; Weijia He; Yanqing Li; Hanqi Sun; Xiaodong Gu; Jiangtao Wang - [92%] TaFD: Threat-Aware Frequency Decoupling for Adversarial Robustness against Heterogeneous Attacks
Mengda Xie; Yiling He; Meie Fang - [92%] DroidBreaker: Practical and Functional Problem-Space Attacks on Machine-Learning Android Malware Detectors
Christian Scano; Diego Soi; Angelo Sotgiu; Luca Demetrio; Davide Maiorca; Giorgio Giacinto; Fabio Roli; Battista Biggio - [92%] AdvScan: Black-Box Adversarial Example Detection at Runtime through Power Analysis
Robi Paul; Michael Zuzak - [92%] A Novel Latent-Class Attack and its Detection by Class Subspace Orthogonalization
Guangmingmei Yang; David J. Miller; George Kesidis - [92%] RoAd-RL: A Unified Library and Benchmark for Robust Adversarial Reinforcement Learning
Adithya Mohan; Daniel Kriegl; Torsten Schön - [92%] The Spectrum Strikes Back: Infrared POV Attacks on Traffic Sign Classification
Michael Kühr; Mevlüt Yildirim; Maximilian Luedecke; Mohammad Hamad; Sebastian Steinhorst - [91%] Adversarial Robustness of Activation Steering in Large Language Models
Kien Le; Thai Le - [91%] Assessing Automated Prompt Injection Attacks in Agentic Environments
David Hofer; Edoardo Debenedetti; Florian Tramèr - [91%] Risk Under Pressure: Compute-Aware Evaluation of Adversarial Robustness in Language Models
Malikeh Ehghaghi; Boglárka Ecsedi; Marsha Chechik; Colin Raffel - [91%] ARB4WM: An Adversarial Robustness Benchmark for World Models in Continuous Control
Junjian Zhang; Hao Tan; Ruonan Li; Dong Zhu; Aiping Li; Zhaoquan Gu - [91%] Convex training of Lipschitz-regularized shallow neural networks
Chao Yin; Antoine Lesage-Landry - [90%] On the Adversarial Robustness of Multimodal LLM Judges
Zihan Wang; Guansong Pang; Zelin Liu; Wenjun Miao; Jin Zheng; Xiao Bai - [90%] Differential Zonotopes for Verifying Global Robustness of DNNs
Anagha Athavale; Samuel Teuber; Matteo Maffei; Ezio Bartocci; Dejan Nickovic; Georg Weissenbacher - [90%] The Scissors Effect: When Resize-Based Input Diversity Helps or Hurts Transfer Attacks
Yuhang Jiang; Xiaojing Chen - [90%] Robustness of neural networks to random noise perturbations of their inputs
Mark Levene; Martyn Harris - [89%] What the Eyes See, the LLMs Miss: Exploiting Human Perception for Adversarial Text Attacks
Qin Yang; Lu Malloy; Joshua Lee; Xiaohan Chang; Meisam Mohammady; Doowon Kim; Yuan Hong - [89%] Scratched Lenses, Shifted Depth: Passive Camera-Side Optical Attacks
Qinlin He; Zeming Zhuang; Yongji Wu; Lan Zhang; Xiaoyong; Yuan - [89%] Robustness Cannot be Reduced to Regularization: Studying Adversarial Training Beyond the Linear Case
David A. R. Robin; Rafael Pinot; Yann Chevaleyre - [89%] Learning to Evade: Adaptive Attacks on Audio Watermarking
Weikang Ding; Hanqing Guo; Rui Duan; Guangjing Wang; Yuanda Wang; Mingzhe Chen; Qiben Yan - [89%] PHANTOM: A Large-Scale Dataset of Multimodal Adversarial Attacks for Vision-Language Models
Simone Gallivanone; Hossein Khodadadi; Mauro Dore; Mauro Medda; Nicola Franco - [89%] What Does It Mean to Break a Distillation Defense?
Lena Libon; Pura Peetathawatchai; Michael Aerni; Daniel Paleka; Florian Tramèr - [88%] Model Poisoning Against Federated Model Adaptation with Chain of Bit-Flips
Bastien Vuillod; Kevin Hector; Pierre-Alain Moellic; Jean-Max Dutertre; Olivier Potin - [88%] AutoDojo: Adaptive Black-Box Attacks Reveal the Limits of IPI Defenses and Task-Specification Effects in LLM Agents
Xinhang Ma; Taoran Li; Chaowei Xiao; Zhiyuan Yu; Ning Zhang; Yevgeniy Vorobeychik - [88%] Budget-Aware Adaptive Adversarial Patches for Black-Box Object Detection
Pedram MohajerAnsari; Amir Salarpour; David Fernandez; Mert D. Pesé - [88%] Adversarial observations in probabilistic State-Space Models for robust Reinforcement Learning
M. Santos-Pascual; D. Ríos Insua - [88%] Exploiting Neural Audio Codec Latents for Adversarial Audio Attacks
Sameek Bhattacharya; Bharath Krishnamurthy; Ajita Rattani - [88%] Explainability-Aware Frustum Attack: Exposing Structural Vulnerabilities in LiDAR-Based 3D Object Detectors
Chengzeng You; Binbin Xu; Soteris Demetriou - [87%] Rethinking Backdoor Adversarial Unlearning through the Lens of Catastrophic Forgetting in Continual Learning
Zhenqian Zhu; Yamin Hu; Yujiang Liu; Luping Wei; Wenbo Hou; Bin Li; Haodong Li; Wenjian Luo - [87%] The Platonic Defense: Backdoor Defense for Self-Supervised Encoders in the Era of Large Scale Pre-training
Tuo Chen; Minjing Dong; Benlei Cui; Jian Liu; Jie Gui - [86%] CHASE: Adversarial Red-Blue Teaming for Improving LLM Safety using Reinforcement Learning
Rahul Markasserithodi; Aditya Joshi; Yuekang Li; Ishmanbir Singh; Chris Yoo; Alan Niu - [86%] Context-Based Adversarial Attacks on AI Code Generators: Vulnerability Analysis and Implications
Walther A. Del Orbe; John D. Hastings; Varghese Vaidyan - [86%] S-GBT: Smooth Growth Bound Tensor for Certified Robustness Against Word Substitution Attacks in NLP
Mohammed Bouri; Mohammed Erradi; Adnane Saoud - [86%] REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs
Yifei Zhao; Qian Lou; Mengxin Zheng - [85%] MultiTurnPSB: Evaluating Multi-Turn Jailbreak Attacks an dClassifier-Based Defenses for Medical AI Safety
Anushka Sheoran; Yiduo Hao - [85%] Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models
Abrar Alotaibi; Moataz Ahmed - [84%] A Mechanistic Analysis of Adversarial Fine-tuning of Vision Transformers
Hannah Gao; Isha Agarwal; Dylan Hadfield-Menell; Rachel Ma - [84%] Post-Hoc Robustness for Model-Based Reinforcement Learning
Siemen Herremans; Ali Anwar; Siegfried Mercelis - [84%] GRAFT: Graphlet-Triggered Backdoor Attack on GNN-Based Hardware Security Systems
Sanaz Kazemi Abharian; Sai Manoj Pudukotai Dinakarrao - [84%] T-VSS: Test-Time Visual Subspace Steering for Adversarial Robustness of Vision-Language Models
Jaehyuk Jang; Minseok Seo. Seungju Cho; Kangwook Ko; Changick Kim - [83%] PAC-Bayesian Adversarially Robust Generalization for Message Passing Graph Neural Networks: A Sensitivity Analysis
Ziling Liang; Xinping Yi; Qingsong Wen; Shi Jin - [83%] GRAPE: Guided Parameter-Space Evolution for Compact Adversarial Robustness
Zhiyuan Ye; Xiangyu Zhou; Ji Qi; Hao Zhang; Yi Zhou - [82%] Hybrid Adversarial Defence for Natural Language Understanding Tasks
Manar Abouzaid; Yang Wang; Chenghua Lin; Stuart E. Middleton - [82%] Towards Robust Personalized Federated Learning: Vulnerability Assessment and Defense Co-Design
Mingyuan Fan; Cen Chen - [82%] How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring
Yang Gao - [82%] Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models
Yanchen Yin; Dongqi Han; Linghui Li - [81%] When Poison Fails After Retrieval: Revisiting Corpus Poisoning under Chunking and Reranking Pipelines
Xi Nie; Hongwei Li; Shenghao Wu; Mingxuan Li; Jiachen Li; Wenbo Jiang - [81%] MemVenom: Triggered Poisoning of Multimodal Memories in Web Agents
Yv Zhang; Hao Sun; Hao Fang; Kuofeng Gao; Fan Mo; Bin Chen; Shu-Tao Xia; Yaowei Wang - [81%] DE-FIVE: Detecting Malicious Image Prompts via Fourier Features and Image Vector Embeddings
Xingwei Zhong; Varun Sharma; Kar Wai Fok; Vrizlynn L. L. Thing - [81%] TooBad: Backdoor Diffusion Models with Ultra-Low Poison Rate and Imperceptible Trigger
Vu Tuan Truong; Long Bao Le - [81%] Are Safety Guarantees in Neural Networks Safe? How to Compute Trustworthy Robustness Certifications
Merkouris Papamichail; Konstantinos Varsos; Giorgos Flouris; João Marques-Silva - [80%] When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness
Sunoh Kim; Daeho Um - [80%] Hybrid Robustness Verification for Spatio-Temporal Neural Networks
Sherwin Varghese; Matthew Wicker; Alessio Lomuscio - [80%] Dummy Backdoor as a Defense: Removing Unknown Backdoors via Shared Internal Mechanisms for Generative LLMs
Kazuki Iwahana; Masaru Matsubayashi; Takuma Koyama; Toshiki Shibahara; Kenichiro Omintato; Akira Ito - [80%] Backdoor Attacks on Speech Emotion Recognition via TTS-Generated Poisoning
Yongbin Huang; Xihao Xie; Jia Zhang - [80%] Reliability-Guided Adaptive Ensembling for Robust Test-Time Adaptation
Adam Koziak; Yuhong Guo - [80%] CITADEL: CSI-Based Jamming Detection and Open-Set Classification for IIoT Networks
Aymen Bouferroum; Ildi Alla; Valeria Loscri; Abderrahim Benslimane; Vincent Lenders - [80%] Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats
Poojitha Thota; Yun Lei; Santhosh Thangaraj; Siddhartha Reddy Jonnalagadda; Shirin Nilizadeh - [80%] Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents
Praneeth Narisetty; Shiva Nagendra Babu Kore; Uday Kumar Reddy Kattamanchi; Jayaram Kumarapu - [79%] NeuroArmor: Safe-Variant-Guided Representation Consistency for Selective Re-Anchoring in Jailbreak Defense
Zhongyang Lin; Ziran Zhao; Feifei Zhai; Pengyuan Liu - [79%] Stain-Aware Wavelet Regularization for Instant Adversarial Purification in Histopathology
Zhe Li; Bernhard Kainz - [79%] Evaluating Prompting-Based Defenses Against Domain-Camouflaged Injection Attacks
Aaditya Pai - [78%] Does AI Reviewer See the Full Picture? Attacking and Defending Multimodal Peer Review
Xinyu Zhao; Rana Muhammad Shahroz Khan; Zhen Xu; Zhen Tan; Tianlong Chen - [78%] PolicyGuard: Towards Test-time and Step-level Adversary (Backdoor) Defense for Reinforcement Learning Agent
Junfeng Guo Heng Huang - [77%] Anti-Hyperspectral Anomaly Detection: A First Study on Stealthy Lipschitz-Forcing Perturbations Against Unknown Detectors
Chia-Hsiang Lin; Si-Sheng Young; Jon Atli Benediktsson - [77%] Steering Vectors are an Adversarial Attack Surface
Abzal Aidakhmetov; Donato Crisostomi; Tommaso Mencattini; Adrian Robert Minut; Iacopo Masi; Emanuele Rodolà - [77%] Secure-CHG: A Comprehensive Framework for Robust and Fair Federated Learning via Hybrid Defense and Contribution-Aware Trust
Guanming Che; Qiang Wang; Jian Xu; Fucai Zhou - [76%] GAS-Leak-LLM: Genetic Algorithm-Based Suffix Optimization for Black-Box LLM Jailbreaking
Aman Anifer; Vignesh Kumar Kembu; Vishnu M; Antonino Nocera; Vinod P.; Amal Murali PK; Akshay S Rajan - [76%] Decoherence as Defence and the Magnitude of Noise Regularisation: A Rigorous N -Qubit Theory of Stochastic Quantum Neural Networks for Adversarially Robust Network Intrusion Detection
Gautier-Edouard Edouard Filardo - [76%] USAD: Uncertainty-aware Statistical Adversarial Detection
Zhijian Zhou; Xunye Tian; Jiacheng Zhang; Zesheng Ye; Yiyi Guo; Donghao Zhang; Liuhua Peng; Feng Liu - [76%] Theory of Continual Learning Against Data Poisoning Attacks
Yiting Hu; Lingjie Duan - [75%] Rethinking Evaluation Paradigms in IBP-based Certified Training
Konstantin Kaulen; Hadar Shavit; Holger H. Hoos - [75%] Stealthy World Model Manipulation via Data Poisoning
Yibin Hu; Xiaolin Sun; Zizhan Zheng - [74%] Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks
Omid Ahmadieh; Nima Karimian - [74%] Beyond Attack Success Rate: Examining Trigger Leakage in Vision-Language Agentic Systems
Jiamin Chang; Salil Kanhere; Piotr Koniusz; Jason; Xue; Hammond Pearce - [74%] ERTS: Adversarial Robustness Testing of Ethical AI via Semantic Perturbation in a Bounded Consequence Space
Pratyush Chaudhari - [74%] Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems
Reza Soosahabi; Vivek Namsani - [74%] Mind the Intention: Task-Aware Backdoor Attacks for Forecast-Driven Distribution Network Operations
Yuxuan Chen; Haipeng Xie; Yichi Zhang; Shuo Dai; Zhaohong Bie - [74%] SCRUB-FL: Sanitizing and Cleansing Representations via Unlearning of Backdoors
Osama Wehbi; Sarhad Arisdakessian; Omar Abdel Wahab; Azzam Mourad; Hadi Otrok - [74%] TEMPO-Diffusion: Temporally Exposed Malicious Poisoning of Diffusion Models
William Aiken; Paula Branco; Guy-Vincent Jourdan; Iosif-Viorel Onut - [73%] Influence Factors on RAG Poisoning
Pedro Pereira; Eva Maia; Isabel Praça; Adrien Bécue - [73%] Breaking TinyML: Why Quantized Neural Networks Need Domain-Specific Security Analysis
Jacob Huckelberry; Andrea Mattia Garavagno; Yuke Zhang; Peter A. Beerel; James Mickens; Vijay Janapa Reddi - [73%] DoubtProbe: Black-Box Jailbreak Defense via Structural Verification and Semantic Auditing
Xuanyu Yin; Yilin Jiang; Jun Zhou; Kai Chen; Zhengfu Cao; Xiaolei Dong - [72%] DiscourseFlip: An Oblique Discourse-Level Opinion Manipulation Attack against Black-box Retrieval-Augmented Generation
Yuyang Gong; Miaokun Chen; Jiawei Liu; Zhuo Chen; Guoxiu He; Wei Lu; XiaoFeng Wang; Xiaozhong Liu - [72%] Repurposing Adversarial Perturbations for Continual Learning: From Defense to Active Alignment
Ran Liu; Min Yu; Mingqi Liu; Jianguo Jiang; Gang Li; Rongsheng Li; Ning Li; Zhen Xu; Weiqing Huang; Ming Liu - [72%] Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies
Zi Yin; Peilin Chai; Siyuan Huang; Zhanhao Hu - [71%] Robust Auto-associative Memory via Convolutional Restricted Hopfield Networks
Ci Lin; Tet Yeap; Iluju Kiringa - [71%] LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity
Kexin Li; Xiao Hu; Ilya Grishchenko; David Lie - [70%] Flux-Guard: Facial Identity Protection using diffusion models
Jie Wang; Tao Wang; Ru Zhang; Jianyi Liu - [69%] Fair Finetuning Mitigates Distribution Inference Attacks
Rakshit Naidu - [69%] Securing Code Understanding: Detecting Natural Backdoor Vulnerability in Code Language Models
Yuchen Chen; Weisong Sun; Haocheng Huang; Yuan Xiao; Chunrong Fang; Yiran Zhang; Tingting Xu; Zhenpeng Chen; An Guo; Peizhuo Lv; Xiaofang Zhang; Zhenyu Chen; Yang Liu; Baowen Xu - [69%] AutoPRAC: Automating Attack Discovery for PRAC-Based Rowhammer Defenses using Model Checkers
Joyce Qu; Gururaj Saileshwar - [68%] Forced Deferral: Manipulating Routing Decisions in Multimodal LLM Cascades
Zhongye Liu; Yaopei Zeng; Yurui Chang; Lu Lin - [68%] Triospect: A Three-Dimensional Framework for Robust Statistical AI-Generated Text Detection Against Diverse Attacks
Guangsheng Bao; Lihua Rong; Yanbin Zhao; Xiao Yu; Qiji Zhou; Yue Zhang - [67%] Position Paper: Post-Solve Robustness in Decision Engines: Feasible Regions and Smoothness Under Perturbations
Yi-Xiang Hu - [67%] MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents
Xuelong Dai; Jianyu Ma; Boyang Ma; Biwei Yan; Yijun Yang; Yue Zhang - [67%] A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models
Nicola Franco - [67%] Generalised Eigenvalue Geometry of Semantic Adversarial Attacks
Martin Anthony; Kaveh Salehzadeh Nobari - [67%] MIRAGE: Protecting against Malicious Image Editing via False Moderation
Anshul Nasery; Ramnath Kumar; Cho-Jui Hsieh; Sewoong Oh - [66%] SMSR: Certified Defence Against Runtime Memory Poisoning in Persistent LLM Agent Systems
Tarun Sharma - [66%] PUFFERDOS: Efficient and Effective Attack String Generation for Regular Expression Denial of Service Vulnerabilities
Shangzhi Xu; Ziqi Ding; Xiao Cheng; Yuekang Li; Nan Sun; Benjamin Turnbull; Shuangxiang Kan; Siqi Ma - [65%] AI Model Extraction Attacks: Bypassing Single-Client Assumptions in Defenses
Maxime Schwarzer; Johannes F. Loevenich; Gustavo Sánchez; Laurin Holz; Thies Möhlenhof; Tobias Hürten; Roberto Rigolin F. Lopes; Veit Hagenmeyer - [65%] Exploring Adversarial Robustness and Safety Alignment in Multilingual Multi-Modal Large Language Models
Hashmat Shadab Malik; Muzammal Naseer; Salman Khan - [65%] Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models
Linghan Chen; Kaiyan Ji; Minyu Guo - [64%] RRISE: Robust Radius Inference via a Surrogate Estimator
Jong-Ik Park; Shreyas Chaudhari; Carlee Joe-Wong; José M. F. Moura - [64%] Bypassing Copyright Protection in Diffusion-based Customization via Two-Stage Latent Feature Optimization
Ziang Xu; Wenbo Yu; Hongyao Yu; Hao Fang; Jiawei Kong; Bin Chen; Hao Wu; Shu-Tao Xia; Zhiyong Wu - [64%] JGRA: Jacobian Geometry Robustness Assessment in NISQ Noise-Aware Quantum Neural Networks
Gianluca Scanu; Luca Barletta; Stefano Rini - [64%] Upper Bounds on the Generalization Error of Deep Learning Models via Local Robustness and Stability
Abdul-Rauf Nuhu; Parham M. Kebria; Vahid Hemmati; Mahmoud N. Mahmoud; Edward Tunstel; Abdollah Homaifar - [64%] Adversarial Bandit Optimization with Globally Bounded Perturbations to Convex Losses
Zhuoyu Cheng; Kohei Hatano; Eiji Takimoto - [64%] What Was That Again? Certified Robustness for Automatic Speech Recognition
Andrew C. Cullen; Neil G. Marchant; Jiani Xie; Paul Montague; Benjamin I. P. Rubinstein - [64%] Explaining Machine Learning and Memorization with Statistical Mechanics
Robin Theriault - [63%] Testing Neural Networks via Bayesian-Guided Exploration of Decision Landscapes
Bin Duan; Meiru Che; Guowei Yang - [63%] Giving AI a Headache: Acoustic Adversarial Attacks to Computer Vision Applications
Nicole Villavicencio-Garduño; Maksim Ekin Eren; Milo Prisbrey; Ben Migliori; Michael Teti - [62%] Securing Self-supervised Data Curation for Foundation Models Robustness
Sandeep Gupta; Roberto Passerone - [62%] Learning from almost nothing: How neural networks survive heavy input corruption
Justin Tahmassebpur; Asadullah Bhuiyan; Hyejin Kim; Omri Lesser - [62%] VFACamou: View-Fused Adversarial Camouflage for Environment-Adaptive Physical Evasion
Shihui Yan; Hu Liu; Junyu Shi; Zihui Zhu; Ziqi Zhou; Yufei Song; Youming Geng; Minghui Li; Shengshan Hu - [62%] Detect, Unlearn, Restore: Defending Text Summarization Models Against Data Poisoning
Poojitha Thota; Shirin Nilizadeh - [61%] Leaking Circuit Secrets: Gradient Leakage Attacks on Graph Neural Networks
Rupesh Raj Karn; Johann Knechtel; Ozgur Sinanoglu - [61%] Proteus: Automated Adversarial Robustness Testing for Audio Deepfake Detectors
Nicolas M. Müller; Aditya Tirumala Bukkapatnam; Zohaib Ahmed - [61%] Wireless Backdoor Attack and Defense for Semantic Communications over Multiple Access Channel
Yalin E. Sagduyu; Tugba Erpek; Aylin Yener; Sennur Ulukus - [61%] Security–Fidelity Tradeoffs: The Hidden Cost of Prompt Injection Defense
Mitchell Hermon; Rahul Gupta; Weitong Ruan; Ekraam Sabir; Haohan Wang - [60%] SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models
Sunoh Kim; Daeho Um - [60%] Hidden in Plain Sight: Benchmarking Agent Safety Against Decomposition Attacks with DECOMPBENCH
Vikhyath Kothamasu; Virginia Smith; Chhavi Yadav - [60%] Rethinking Generative Reconstruction Attacks against Graph Neural Network Models
Adebayo Keji; Sayanton Dibbo - [60%] Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations
Halima Bouzidi; Mboutidem Ekemini Mkpong; Haoyu Liu; Mohammad Abdullah Al Faruque - [59%] No Hidden Prompts Needed! You Can Game AI Peer Review with Presentation-Only Revisions
Xu Yang; Zhizhou Sha; Junbo Li; Jian Yu; Yifan Sun; Matthew Zhao; Jinrui Fang; Xinyue Guo; Yining Wu; Xu Hu; Yifu Luo; Qiang Liu; Zhangyang Wang - [59%] SPHINX: First Explain, Then Explore
Nguyen Do; Tue M. Cao; Tien Van Do; András Hajdu; Tamás Bérczes; My T. Thai - [59%] Shoot the Honey, Cloak the Player: Towards Zero-Runtime-Overhead Proactive Defense and Detection for Visual Game Cheating
Jianing Wang; Chuqi Zhang; Yuancheng Jiang; Adil Ahmad; Shanqing Guo - [59%] Rethinking Forgery Attacks on Semantic Watermarks in Black-Box Settings: A Geometric Distortion Perspective
Cheng-Yi Lee; Yichi Zhang; Yuchen Yang; Chun-Shien Lu; Jun-Cheng Chen - [58%] The Invitation Trap: Proactive Availability Backdoor in LLMs via Conversational Induction
He Wang; Jun Feng; Hong Sun; Pengfei Zhang - [58%] Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts
Boxuan Wang; Zhuoyun Li; Xiaowei Huang; Yi Dong - [58%] Confidently Wrong: Severity-Aware Calibration of Prompt-Injection Detectors under Attack Shift
Md Anas Biswas - [57%] Defenses & Enablers For Skill Injection Attacks on Terminal Based Agents
Yoshinari Fujinuma; Varun Gangal; Traian Rebedea; Makesh Narsimhan Sreedhar; Prasoon Varshney; Rebecca Qian; Anand Kannappan - [57%] Beyond Homophily: Towards Generalized Graph Reconstruction Attack and Defense
Zhanke Zhou; Bo Han; Xuan Li; Jiangchao Yao; Sanmi Koyejo; Michael K. Ng - [57%] Exposing the Illusion of Erasure in Knowledge Editing for LLMs
Advik Raj Basani; Anshuman Chhabra - [57%] Phantom: A Unified Face-Swap Deepfake Protection Framework with Latent and Spatial Constraints
Jungkon Kim; Cheolseung Jung; Jong-Min Choi; Juseong Lee - [56%] Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety
Ting Ma; Xiufeng Huang; Benlei Cui; Xiaowen Xu; Shikai Qiu; Ruijie Jian; Hongxing Li; Guanghui Wang; Longtao Huang; Haiwen Hong; Haolei Xu; Wenjing Jiang; Ziwen Xu; Zhaoyu Fan; Shaoxuan He; Chuxi Xiao; Yujian Li; Xinyue Chen; Chunyang Chai; Wenxuan Liu; Ziheng Wang; Dongjie Zhang; Yangfan Zhou; Libin Dong; Yupeng Cao; Xiaoqian Xia; Jing Wang; Zhe Jiang; Zhenan Ye; Guang Yang; Bin Liu; Wei Peng; Ziqiang Zhu; Meihui Lian; Kaiwen Lv Kacuila; Haidong Ding; Bingyu Zhu; Yan Wang; Hai Zhao; Xuan Jin; Wei Zhao; Pengfei Sun; Wei Wang; Huiming Zhang; Bin Li; Hui Xue - [55%] Adaptive Causal Alignment for High-Confidence Adversarial Training
Zhiming Luo; Kejia Zhang; Yingxin Lai; Junwei Wu; Juanjuan Weng; Shaozi Li - [55%] Latent Anchor-Driven Test Generation for Deep Neural Networks
Bin Duan; Matthew B. Dwyer; Guowei Yang - [55%] Discard the Dross and Select the Essential: Pre-query Sample Selection for Black-box Membership Inference Attacks
Dongdong Zhao; Jinrong Hu; Changtian Song; Jian Chen; Hongmin Wang; Baogang Song - [54%] Passive Reconnaissance of Routing-Layer Defenses in OLSR-Based MANETs using ML
Nadav Schweitzer; Kiril Danilchenko; Ariel Stulman - [54%] From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents
Pritam Dash; Tongyu Ge; Aditi Jain; Tanmay Shah; Zhiwei Shang - [54%] T2S: A Rehearsal-Based Approach for Extraction-Resistant Model Watermarking
Jian-Ping Mei; Weibin Zhang; Ao Yao; Tiantian Zhu; Jie Xiao - [54%] Structured Adversarial Camouflage via Voronoi Diagrams
Jens Bayer; Stefan Becker; David Münch; Michael Arens; Jürgen Beyerer - [54%] VPA-Guard: Defending and Benchmarking Image-to-Video Generation Against Visual Prompt Attacks
Yining Sun; Haoyu Kang; Jiajun Wu; Heng Zhang; Danyang Zhang; Zhenjun Zhao; Haochen Han; Fangming Liu; Wai Kin Victor Chan; Alex Jinpeng Wang - [53%] Cross-Generational Transfer of Adversarial Attacks Reveals Non-Monotonic Safety Alignment in LLMs
Subhadip Mitra - [53%] When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations
Mahdi Alkaeed - [53%] POISE: Position-Aware Undetectable Skill Injection on LLM Agents
Haochang Hao; Dehai Min; Zhifang Zhang; Yunbei Zhang; Miao Xu; Yingqiang Ge; Lu Cheng - [53%] Safe-RULE: Safe Reinforcement UnLEarning
Shixiong Jiang; Taozheng Zhu; Fanxin Kong - [53%] Small Data, Big Noise: Adversarial Training for Robust Parameter-Efficient Fine-Tuning
Eitan Cohen; Idan Simai; Uri Shaham - [53%] Trajectory-Level Redirection Attacks on Vision-Language-Action Models
Gokul Puthumanaillam; Vardhan Dongre; Pranay Thangeda; Hooshang Nayyeri; Dilek Hakkani-Tür; Melkior Ornik - [53%] Understanding and Mitigating Prompt Leaking Attacks in Real-World LLM-Based Applications
Yong Yang; Chong Fu; Tong Zhang; Rui Zeng; Qingming Li; Tianyu Du; Zonghui Wang; Shouling Ji; Wenzhi Chen - [53%] The Unseen Hand: Manipulating Model Fairness and SHAP with Targeted Identity Re-Association Attacks
Sannaan Khan; Muhammad U. S. Khan - [52%] Operationalizing Cyber Attack Prediction: A Gap-Prioritized Framework with Dataset and Model Selection Guidelines
Aminu Muhammad Auwal - [52%] Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks
Jiani Xie; Andrew C. Cullen; Paul Montague; Benjamin I. P. Rubinstein - [52%] Let Them Steal: Trapping Large Language Model Extraction Attacks with Knowledge Honeypot
Yuyang Dai; Yushun Dong - [52%] Loss Landscape Poisoning: Targeted Extraction of Unseen Training Data from LLMs
Md Abdullah Al Mamun; Ngoc Phu Doan; Pedram Zaree; Nael Abu-Ghazaleh; Ihsen Alouani - [52%] Conflict-Aware Retriever Editing for Knowledge Injection Attacks on LLM-Based RAG Systems
Xinru Liu; Xianglong Zhang; Di Cai; Zhumin Chen; Pengfei Hu; Xin Xin - [52%] Heterogeneous LLM Debate Under Adversarial Peers: Honest Gains, Replacement Costs, and Resilience
Prashanti Nilayam; Kiran Kumar Ramanna; Prashil Tumbade; Sankalp Nayak - [52%] FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks
Aoying Zheng; Anqi Du; Zizhuang Deng; Yuxuan Chen - [52%] On the Vulnerability of Parameter-Level Defenses to Model Merging
Kuangpu Guo; Qingyan Zheng; Jian Liang; Yongcan Yu; Zilei Wang; Ran He; Tieniu Tan - [51%] SkillHarm: Lifecycle-Aware Skill-Based Attacks via Automated Construction
Yuting Ning; Zhehao Zhang; Yash Kumar Lal; Boyu Gou; Junyi Li; Weitong Ruan; Chentao Ye; Rahul Gupta; Diyi Yang; Yu Su; Huan Sun - [51%] Efficient, Robust, and Anti-Collusion Fingerprinting of Image Diffusion Models
Jianwei Fei; Yunshu Dai; Zhihua Xia; Xiaochun Cao; Jiantao Zhou; Alessandro Piva; Benedetta Tondi - [51%] Dynamic Malicious Skills in Agentic AI
Tianhao Chen; Zhengyuan Jiang; Yuepeng Hu; Yebei Gou; Neil Zhenqiang Gong - [51%] Rethinking Molecular Graph Backdoors under Chemistry-aware Admission
Thinh T. H. Nguyen; Sze Jue Yang; Khoa D. Doan; Chee Seng Chan; Kok-Seng Wong - [51%] Can LLMs Reliably Self-Report Adversarial Prefills, and How?
Quang Minh Nguyen; Uzair Ahmed; Taegyoon Kim - [51%] Automated Background Swapping for Robustness against Spurious Backgrounds
Cesar Roder; Kajetan Schweighofer - [50%] Beyond $\ell_2$-norm and $\ell_\infty$-norm: A Curvature-Inspired $\ell_p$-Norm Scheme for Deep Neural Networks
Jianhao Xu; Zhuang Yang - [50%] Consistency Training Along the Transformer Stack
Sukrati Gautam; Neil Shah; Arav Dhoot; Bryan Maruyama; Caroline Wei; Rohan Kapoor; Robert Sidey; Prakhar Gupta; Zi Cheng Huang; David Demitri Africa - [50%] PI-Hunter: Automated Red-Teaming for Exposing and Localizing Prompt Injections
Pengfei He; Lesly Miculicich; Vishesh Sharma; Ash Fox; George Lee; Jiliang Tang; Tomas Pfister; Long T. Le - [50%] Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents
Zihao Wang; Yiming Li; Yutong Wu; Kangjie Chen; Zheyu Liu; Fok Kar Wai; Pin-Yu Chen; Vrizlynn L. L. Thing; Bo Li; Dacheng Tao; Tianwei Zhang - [50%] Safe to Check, Unsafe to Use: Relinking at the Compression Boundary of LLM Agents
Zesen Liu; Zihan Zhang; Dongdong She - [49%] Inference-Time Vulnerability Beyond Shallow Safety: Alignment Along Generation Trajectories
Kyungmin Park; Taesup Kim - [49%] Non-Parametric Machine Text Detection via Multi-View Gaussian Processes
Aleem Khan; Nicholas Andrews - [49%] Tracing Target Answers in Poisoned Retrieval Corpora via Token Influence Attribution
Yan-Lun Chen; Pin-Yu Chen; Chia-Mu Yu; Ying-Dar Lin; Yu-Sung Wu; Wei-Bin Lee - [49%] When the Aggregator Cheats: Data-Free Backdoors in Federated LLM-based QA Systems
Chenqing Zhu; Yanbo Dai; Yulong Tian; Qingming Li; Songze Li - [49%] Fairness Attacks on Recommender Systems
Yanan Wang; Yong Ge - [48%] PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations
Muberra Ozmen; Subhabrata Majumdar - [48%] Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics
Hangtao Zhang; Yucheng Zhao; Sishun Liu; Ziqi Zhou; Zeyu Ye; Wei Wan; Minghui Li; Shengshan Hu; Yanjun Zhang; Yi Liu; Leo Yu Zhang - [48%] VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models
Chunlin Qiu; Ang Li; Tianxiao Huang; Ruilin Gan; Yunjie Ge; Shenyi Zhang; Huayi Duan; Lingchen Zhao; Chao Shen; Qian Wang - [48%] RIVET: Robust Idempotent Voice Attribute Editing
Dareen Alharthi; Bhuvan Koduru; Rita Singh; Bhiksha Raj - [47%] RogueMerge: Robust and Unified Attacks against LLM Model Merging
Jinghuai Zhang; Yetian He; Kunlin Cai; Han Zhao; Fnu Suya; Yuan Tian - [47%] Representation Matters in Randomized Smoothing for Audio Classification
Jong-Ik Park; Shreyas Chaudhari; José M. F. Moura; Carlee Joe-Wong - [47%] Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
Blake Bullwinkel; Eugenia Kim; Amanda Minnich; Mark Russinovich - [47%] Fed-FBD: Federated Functional Block Diversification for Isolation, Privacy, and Surgical Unlearning
Weijie Chen; Alan B. McMillan - [47%] Contrast-Informed Augmentation and Domain-Adversarial Training for Adult-to-Neonatal MR Reconstruction Generalization
Stephen Moore; Lara Leijser; Richard Frayne; Roberto Souza - [47%] From Shield to Target: Denial-of-Service Attacks on LLM-Based Agent Guardrails
Yuguang Zhou; Xunguang Wang; Pingchuan Ma; Zhantong Xue; Zhaoyu Wang; Shuai Wang - [47%] Evaluating the Robustness of Proof Autoformalization in Lean 4
Zhengtao Gui; Sheng Yang; Zhouxing Shi - [47%] How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation
Yimeng Chen; Zhe Ren; Firas Laakom; Yu Li; Dandan Guo; Jürgen Schmidhuber - [47%] Silent Failures in Physics-Informed Neural Networks: Parameter Poisoning and the Limits of Loss-Based Validation
David McShannon; Nicholas Dietrich - [46%] Detecting Aimbot Cheaters in MOGs
Salman Shaikh; Tao Ni; Marc Dacier - [46%] Domain-Conditioned Safety in Frontier Computer-Using Agents: A 793-Episode Browser Benchmark, a Coding-Domain Cross-Reference, and a Reproducibility Audit of Recent Red-Teaming
Nicholas Saban - [46%] Membrane: A Self-Evolving Contrastive Safety Memory for LLM Agent Defense
Minseok Choi; Seungbin Yang; Dongjin Kim; Subin Kim; Jungmin Son; Yunseung Lee; Jaegul Choo; Youngjun Kwak - [46%] MLingualFC: Evaluating Jailbreak Vulnerabilities in Multilingual Vision-Language Models
Rishabh Makwana; Mamta; Deeksha Varshney; Oana Cocarascu - [46%] Beyond Pass/Fail: Using Process Mining to Understand How LLMs Resist (and Fail) Red Team Attacks
Zvi Topol - [46%] JailbreakOPT: Tool-Assisted Iterative Jailbreak Prompt Optimization
Ge Shi; Jun Yin; Donglin Xie; Fangyi Liu; Yucan Li; Menglin Liu - [46%] Think Twice Before You Act: Protecting LLM Agents Against Tool Description Poisoning via Isolated Planning
Shanghao Shi; Xiao Wang; Chaoyu Zhang; Hao Li; Wenjing Lou; Thomas Hou; Yevgeniy Vorobeychik; Chongjie Zhang; Ning Zhang - [46%] Closing the Activation-Cone Blind Spot: Response-Time Probing and Unified Defense
Subhadip Mitra - [46%] MESA: Prioritizing Vulnerable Communication Channels for Securing Multi-Agent Systems
Kunyang Li; Kyle Domico; Jonathan Gregory; Patrick McDaniel - [45%] Persona Attack: Incremental Memory Injection Jailbreak Attack against Large Language Models
Junyoung Park; Seongyong Ju; Sunghwan Park; Jaewoo Lee - [45%] A Closer Look at In-Distribution vs. Out-of-Distribution Accuracy for Open-Set Test-time Adaptation
Zefeng Li; Evan Shelhamer - [45%] veriFIRE: an Industrial Case Study in Verifying Consistency Properties for a DNN-Based Wildfire Detection System
Idan Refaeli; Maya Swisa; Itay Buchnik; Alon Zada; Guy Amir; Elad Mandelbaum; Ziv Freund; Guy Katz - [45%] Attack Selection in Agentic AI Control Evaluations Meaningfully Decreases Safety
Catherine Ge-Wang; Tyler Crosse; Benjamin Hadad; Joachim Schaeffer; Ram Potham; Tyler Tracy - [45%] FoeGlass: Simple In-Context Learning Is Enough for Red Teaming Audio Deepfake Detectors
Sepehr Dehdashtian; Jacob H Seidman; Vishnu N Boddeti; Gaurav Bharaj - [45%] Robustness Verification of Recurrent Neural Networks with Abstraction Refinement
Li-Jen Lin; Chih-Duo Hong - [45%] Anywhere, Any-Stymie: Remote Activation of Trojan Malware on LiDAR with Modulated Signals
R. Spencer Hallyburton; Miroslav Pajic - [45%] Zero-Shot Test-Time Canonicalization using Out-of-Distribution Scoring
Dominik Lindner; Johann Schmidt; Tom Siegl; Martin Becker; Sebastian Stober - [45%] How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations
Yuxing Cheng; Yuan Wu; Yi Chang - [45%] Full spectrum Unlearnable Examples via Spectral Equalization
Jiale Cai; Gezheng Xu; Zhihao Li; Ruiyi Fang; Ruizhi Pu; Di Wu; Qicheng Lao; Charles Ling; Boyu Wang - [45%] Jailbreaking for the Average Jane: Choosing Optimal Jailbreaks via Bandit Algorithms for Automatically Enhanced Queries
Prarabdh Shukla; Ritik; Suhas Rao; Arpit Agarwal; Arjun Bhagoji - [44%] Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs
Lisa Bouger; Théo Lasnier; Philippe Loubet Moundi; Yannick Teglia; Djamé Seddah - [44%] Hybrid CNN-LSTM Framework for Intelligent Cyber Attack Detection and Prevention in U.S. Critical Digital Infrastructure: A Comparative Machine Learning Evaluation on CSE-CIC-IDS2018
Md. Iqbal Hossan; Md. Serajul Kabir Chowdhury Rubel; Md. Arifur Rahman; B. M. Taslimul Haque - [44%] Steering LLM Viewpoints through Fabricated Evidence Injection
Xi Yang; Chang Liu; Zhenglin Huang; Haoran Li; Weiming Zhang; Jian Weng; Yangqiu Song - [44%] Customization under Fire: Plugin Poisoning in Text-to-Image Ecosystem
Jiahao Chen; Xing He; Yong Yang; Xinfeng Li; Chunyi Zhou; Junhao Li; Zhe Ma; Tianyu Du; Shouling Ji - [44%] Muon Learns More Robust and Transferable Features than Adam
Tianyu Ruan; Fengzhuo Zhang; Shuche Wang; Shihua Zhang - [44%] Some Complexity Results for Robustness Verification for Binarized Neural Networks
Harshit Goyal; Sudakshina Dutta - [44%] Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization
Zhipeng Xu; De Cheng; Xinyang Jiang; Nannan Wang; Dongsheng Li; Xinbo Gao - [43%] Jailbreaking Multimodal Large Language Models using Multi-Clip Video
Choongwon Kang; Seungjong Sun; Hyunmin Jun; Jang Hyun Kim - [43%] RedEdit: Agentic Red-Teaming of Image Safety Classifiers via MCTS-Guided Photo-Editing
Weilin Lin; Ziqi Lin; Zhenxing Zhou; Jianze Li; Tong Zhang; Hui Xiong; Li Liu - [43%] When Behavioral Safety Evaluation Fails: A Representation-Level Perspective
Enyi Jiang; Anders Gjølbye; Yibo Jacky Zhang; Sanmi Koyejo - [43%] Beyond Native Success: Auditing Deployment-Interface Exposure of CLIP Backdoors
Kunlan Xiang; Haomiao Yang; Wenbo Jiang - [43%] OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization
Jerry Wang; Hsin-Ling Hsu; Yi-Cheng Lai; Nai-Chia Chen; Fang Yu - [43%] Breaking the Rounding Trap: Securing LLMs against Quantization-Conditioned Backdoors
Aoying Zheng; Anqi Du; Zizhuang Deng; Yuxuan Chen - [42%] Ghost: Plausible Yet Unlearnable Trajectories via On-Manifold Substitution for Next-POI Privacy
Zhenyu Yu; Jihong Guan; Shuigeng Zhou - [42%] Quantifying the Privacy of Counterfactuals by Leveraging Membership Inference Attacks Against Synthetic Data
Maryam Babaei; Yingke Wang; Hadrien Lautraite; Heber H. Arcolezi; Ulrich Aivodji; Sebastien Gambs - [42%] Unsupervised Style Representation Learning for AI-Text Detection via Paraphrase Inversion
Rafael Rivera Soto; Barry Chen; Nicholas Andrews - [42%] Model Stealing Through the Lens of Model Multiplicity
Eliott Baltz; Satoshi Hara; Ulrich Aïvodji - [41%] Auditing Inference-Time Defense Evaluation for Multimodal Large Language Models
Bulat Nutfullin; Vladimir Evgrafov; Dmitry Namiot - [41%] Grammar-Constrained Decoding Can Jailbreak LLMs into Generating Malicious Code
Yitong Zhang; Shiteng Lu; Jia Li - [41%] MAStrike: Shapley-Guided Collusive Red-Teaming on Multi-Agent Systems
Chejian Xu; Zhaorun Chen; Jingyang Zhang; Freddy Lecue; Avni Kothari; Sarah Tan; Wenbo Guo; Bo Li - [41%] Detecting Hidden ML Training With Zero-Overhead Telemetry
Robi Rahman; Sabiha Tajdari - [41%] Quantization as a Malicious Task: Removing Quantization-Conditioned Backdoors via Task Arithmetic
Kaihsun Yang; Min-Yan Tsai; Chia-Mu Yu - [41%] NRT-Bench: Benchmarking Multi-Turn Red-Teaming of LLM Operator Agents in Safety-Critical Control Rooms
Hanwool Lee; Dasol Choi; Bokyeong Kim; Haon Park; Seung Geun Kim - [41%] Public Diffusion Models, Private Images: Key-Controlled Inversion for Conditional Reconstruction
Lijunxian Zhang; Weihai Li; Bin Liu; Zikai Xu - [41%] Sublinearly Structured Deep Neural Networks Achieve Feature Learning Consistency for Compositional Functions
Sehwan Kim; Yan Sun; Faming Liang - [41%] Securing LLM-Agent Long-Term Memory Against Poisoning: Non-Malleable, Origin-Bound Authority with Machine-Checked Guarantees
Yedidel Louck - [41%] Concept Removal Guidance: Evidence-Calibrated Negative Guidance for Safe Diffusion Sampling
Yoonseok Choi; Chaeyoung Oh; Hyunjun Choi; Seokin Seo; Kee-Eung Kim - [40%] Attack Detection using Time Series Foundation Models
Sribalaji C. Anand; Anh Tung Nguyen; George J. Pappas - [40%] Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?
Jiaqi Tang; Jianmin Chen; Youyang Zhai; Wei Wei; Runtao Liu; Mengjie Zhao; Xiangyu Wu; Qingfa Xiao; Qifeng Chen - [40%] From Parameters to Feature Space: Task Arithmetic for Backdoor Mitigation in Model Merging
Zhenqian Zhu; Yamin Hu; Yiya Diao; Weixiang Li; Haodong Li; Wenjian Luo - [40%] Your "Pro" LLM Subscription May Actually Be "Free": Exposing Fingerprint Spoofing Risks in LLM Inference Services
Jiahao Zhang; Xiuyu Li; Suhang Wang
2026-05 (341 papers)
- [99%] Almost for Free: Crafting Adversarial Examples with Convolutional Image Filters
Alexander Warnecke; Konrad Rieck - [99%] Fight Poison with Poison: Enhancing Robustness in Few-shot Machine-Generated Text Detection with Adversarial Training
Wenjing Duan; Qi Zhou; Yuanfan Li - [99%] Enhancing Adversarial Robustness in Network Intrusion Detection: A Layer-wise Adaptive Regularization Approach
Hira Nasir; Eiman Javed; Balawal Shabir; Zunera Jalil; Ahmad Mohsin - [99%] SoK: A Comprehensive Analysis of the Current Status of Neural Tangent Generalization Attacks with Research Directions
Thushari Hapuarachchi; Kaiqi Xiong - [99%] Taming the Long Tail: Rebalancing Adversarial Training via Adaptive Perturbation
Lilin Zhang; Yimo Guo; Yue Li; Jiancheng Shi; Xianggen Liu - [99%] Threats to Arabic Handwriting Recognition: Investigating Black-Box Adversarial Attacks on embedded ConvNet models
Mohsine EL Khayati; Abdelillah Semma; Abdelaziz Courr; Rachid Elouahbi - [99%] A No-Defense Defense Against Gradient-Based Adversarial Attacks on ML-NIDS: Is Less More?
Mohamed elShehaby; Ashraf Matrawy - [99%] SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack
Han Liu; Zhi Xu; Xiaotong Zhang; Feng Zhang; Xiaoming Xu; Wei Wang; Fenglong Ma; Hong Yu - [99%] Opportunistic Target Selection: Early Directional Commitment for Query-Efficient Black-Box Adversarial Attacks
Florent Tariolle; Florian Yger - [98%] Laundering AI Authority with Adversarial Examples
Jie Zhang; Pura Peetathawatchai; Florian Tramèr; Avital Shafran - [98%] Information Theoretic Adversarial Training of Large Language Models
Yiwei Zhang; Jeremiah Birrell; Reza Ebrahimi; Rouzbeh Behnia; Jason Pacheco; Elisa Bertino - [98%] Adversarial Graph Neural Network Benchmarks: Towards Practical and Fair Evaluation
Tran Gia Bao Ngo; Zulfikar Alom; Federico Errica; Murat Kantarcioglu; Cuneyt Gurcan Akcora - [98%] Band Together: Untargeted Adversarial Training with Multimodal Coordination against Evasion-based Promotion Attacks
Guanmeng Xian; Ning Yang; Philip S. Yu - [98%] A Mimetic Detector for Adversarial Image Perturbations
Johnny Corbino - [98%] Semantic Smoothing via Novel View Synthesis for Robust SAR Image Classification
Daniel Brignac; Fengwei Tian; Banafsheh Latibari; Abhijit Mahalanobis; Ravi Tandon - [98%] Universal Adversarial Triggers
Benedict Florance Arockiaraj; Alexander Feng; Jianxiong Cai; Xiaoyu Cheng - [98%] Sample-wise Targeted Adversarial Attacks on Test-time Adaptation
Phuc Duc Nguyen; Quang Duc Nguyen - [98%] Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization
Xiang Fang; Wanlong Fang; Changshuo Wang - [98%] JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models
Jiachen Qian - [97%] Adversarial Flow Matching for Imperceptible Attacks on End-to-End Autonomous Driving
Xinyu Zeng; Xiangkun He; Lei Tao; Chen Lv; Hong Cheng - [97%] A Robust Out-of-Distribution Detection Framework via Synergistic Smoothing
Maria Stoica; Abdelrahman Hekal; Alessio Lomuscio - [97%] Streaming Adversarial Robustness in Fuzzy ARTMAP: Mechanism-Aligned Evaluation, Progressive Training, and Interpretable Diagnostics
Shane Cairns; Leonardo Enzo Brito da Silva; Sasha Petrenko; Donald C. Wunsch; Jian Liu - [97%] Backbone is All You Need: Assessing Vulnerabilities of Frozen Foundation Models in Synthetic Image Forensics
Chiara Musso; Joy Battocchio; Andrea Montibeller; Giulia Boato - [97%] Fast Adversarial Attacks with Gradient Prediction
Kamil Ciosek; Aleksandr V. Petrov; Nicolò Felicioni; Konstantina Palla - [97%] Attacking the First-Principle: A Black-Box, Query-Free Targeted Mimicry Attack on Binary Function Classifiers
Gabriel Sauger; Jean-Yves Marion; Sazzadur Rahaman; Victor Matrat; Vincent Tourneur; Muaz Ali - [97%] Targeted Downstream-Agnostic Attack
Zhuxin Lei; Ziyuan Yang; Yi Zhang - [97%] Building an Adversarial Malware Dataset by Family and Type: Generation, Evasion, and Poisoning Evaluation
David Košťál; Martin Jureček - [96%] Detecting Adversarial Data via Provable Adversarial Noise Amplification
Furkan Mumcu; Yasin Yilmaz - [96%] Manifold-Constrained Adversarial Training for Long-Tailed Robustness via Geometric Alignment
Guanmeng Xian; Ning Yang; Philip S. Yu - [96%] Backdoor Mitigation in Object Detection via Adversarial Fine-Tuning
Kealan Dunnett; Reza Arablouei; Dimity Miller; Volkan Dedeoglu; Raja Jurdak - [96%] Enabling Adversarial Robustness in AI Models through Kubeflow MLOps
Stavros Bouras; Ioannis Korontanis; Antonios Makris; Konstantinos Tserpes - [96%] Escaping the Linearity Trap: Manifold Detours for Black-Box Adversarial Attacks on Singing Audio Deepfake Detection
Yifan Liao; Yule Liu; Zhen Sun; Zongmin Zhang; Yupeng He; Jiaheng Wei; Xinhu Zheng; Xinlei He - [96%] MoCo-EA: Exploiting Adversarial Mode Connectivity for Efficient Evolutionary Attacks
Hyo Seo Kim; Gang Luo; Can Chen; Binghui Wang; Yue Duan; Ren Wang - [96%] Mind Your Margin and Boundary: Are Your Distilled Datasets Truly Robust?
Muquan Li; Yingyi Ma; Yihong Huang; Hang Gou; Ke Qin; Ming Li; Yuan-Fang Li; Tao He - [96%] Adversarial Vulnerability Under Temporal Concept Drift: A Longitudinal Study of Android Malware Detection
Ahmed Sabbah; Mohammed Kharma; Radi Jarrar; Samer Zein; David Mohaisen - [96%] When Interpretability Becomes a Liability: Adversarial Attacks on CBM Concept Layers
Aditya Sridhar - [95%] Controlled Steering-Based State Preparation for Adversarial-Robust Quantum Machine Learning
Sahan Sanjaya; Hari Krishna Parvatham; Emma Andrews; Prabhat Mishra - [95%] Checkerboard: A Simple, Effective, Efficient and Learning-free Clean Label Backdoor Attack with Low Poisoning Budget
Yi Yang; Jinyang Huang; Binbin Liu; Feng-Qi Cui; Xiaokang Zhou; Zhi Liu; Jie Zhang; Meng Li - [95%] Beyond Defenses: Manifold-Aligned Regularization for Intrinsic 3D Point Cloud Robustness
Pedro Alonso; Chongshou Li; Tianrui Li - [95%] DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models
Ye Sun; Xin Wang; Jiaming Zhang; Yifeng Gao; Yixu Wang; Yifan Ding; Qixian Zhang; Henghui Ding; Xingjun Ma; Yu-Gang Jiang - [95%] Codec-Robust Attacks on Audio LLMs
Jaechul Roh; Jean-Philippe Monteuuis; Jonathan Petit; Amir Houmansadr - [95%] Provable Robustness against Backdoor Attacks via the Primal-Dual Perspective on Differential Privacy
Aman Saxena; Jan Schuchardt; Yan Scholten; Stephan Günnemann - [95%] Self-supervised Adversarial Purification for Graph Neural Networks
Woohyun Lee; Hogun Park - [95%] Localization then Neutralization: Gradient-guided Token Suppression against Visual Prompt Injection Attack
Dongpeng Zhang; Ke Ma; Yangbangyan Jiang; Gaozheng Pei; Longtao Huang; Qianqian Xu; Qingming Huang - [95%] Latent Geometric Chords for Query-Efficient Decision-Based Adversarial Attacks
Ei Hmue Khine; Yao Li; Jiebao Sun; Shengzhu Shi; Zhichang Guo; Boying Wu - [94%] Asymmetric Invertible Threat: Learning Reversible Privacy Defense for Face Recognition
Jiabei Zhang; Ziyuan Yang; Andrew Beng Jin Teoh; Yi Zhang - [94%] LocalAlign: Enabling Generalizable Prompt Injection Defense via Generation of Near-Target Adversarial Examples for Alignment Training
Yuyang Gong; Zihao Wang; Jiawei Liu; XiaoFeng Wang - [94%] SDM: A Powerful Tool for Evaluating Model Robustness
Xinlei Liu; Tao Hu; Jichao Xie; Peng Yi; Hailong Ma; Baolin Li - [93%] Quantum Interval Bound Propagation for Certified Training of Quantum Neural Networks
Emma Andrews; Nahyeon Kim; Prabhat Mishra - [93%] TsallisPGD: Adaptive Gradient Weighting for Adversarial Attacks on Semantic Segmentation
Alexander Matyasko; Xin Lou; Indriyati Atmosukarto; Wei Zhang - [93%] Sparse Autoencoders as Plug-and-Play Firewalls for Adversarial Attack Detection in VLMs
Hao Wang; Yiqun Sun; Pengfei Wei; Lawrence B. Hsieh; Daisuke Kawahara - [93%] Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms
Linh Le; David Williams-King; Mohamed Amine Merzouk; Aton Kamanda; Adam Oberman - [93%] Attention Hijacking: Response Manipulation Across Queries in Vision-Language Models
Zhiqiang Wang; Dongrui Liu; Yan Li; Zonghao Ying; Wei Xue; Wenhan Luo; Yike Guo - [92%] Dissociating spatial frequency reliance from adversarial robustness advantages in neurally guided deep convolutional neural networks
Zhenan Shao; Tianyu Ren; Chengxiao Wang; Leyla Isik; Diane M. Beck - [92%] Memory Efficient Full-gradient Attacks (MEFA) Framework for Adversarial Defense Evaluations
Yuan Du; Mitchel Hill; HanQin Cai - [92%] Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment
Haobo Wang; Xiaorong Ma; Weiqi Luo; Xiaojun Jia; Jiwu Huang - [92%] Finding the Weakest Link: Adversarial Attack against Multi-Agent Communications
Maxwell Standen; Junae Kim; Claudia Szabo - [92%] Dithering Defense: Adversarial Robustness of Vision Foundation Models via Multi-Level Floyd-Steinberg Dithering
Yury Belousov; Brian Pulfer; Vitaliy Kinakh; Slava Voloshynovskiy - [92%] Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models
Arian Komaei Koma; Seyed Amir Kasaei; AmirMahdi Sadeghzadeh; Mohammad Hossein Rohban - [91%] Certified vs. Empirical Adversarial Robust-ness via Hybrid Convolutions with Attention Stochasticity
Joy Dhar; Song Xia; Manish Kumar Pandey; Maryam Haghighat; Azadeh Alavi; Ferdous Sohel; Wenyu Zhang; Nayyar Zaidi - [91%] WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections
Tri Cao; Yulin Chen; Hieu Cao; Yibo Li; Khoi Le; Thong Nguyen; Yuexin Li; Yufei He; Yue Liu; Shuicheng Yan; Bryan Hooi - [91%] Adversarial Trust Poisoning in Vehicular Collaborative Perception
Yutong Liu; Chenyi Wang; Ming F. Li; Qingzhao Zhang - [91%] Backdoor Attacks on Fault Detection and Localization in Cyber-Physical Systems
Abile Jean; Kuniyilh S - [90%] Robust Multi-Agent Path Finding under Observation Attacks: A Principled Adversarial-Plus-Smoothing Training Recipe
Riad Ahmed - [90%] Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations
Narges Babadi; Hadis Karimipour - [90%] Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection
Yixing Yong; Jian Wang; Ming Lei; Lijun He; Fan Li - [90%] "What is the Problem Space?" Defining Host-space Adversarial Perturbations against Network Intrusion Detection Systems
Miel Verkerken; Laurens D'hooge; Bruno Volckaert; Filip De Turck; Giovanni Apruzzese - [90%] Cordyceps: Covert Control Attacks on LLMs via Data Poisoning
Zedian Shao; Charles Fleming; Teodora Baluta - [89%] VisInject: Disruption != Injection — A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models
Pang Liu; Yingjie Lao - [89%] Gray-Box Poisoning of Continuous Malware Ingestion Pipelines
Jan Dolejš; Martin Jureček; Róbert Lórencz - [89%] Still Camouflage, Moving Illusion: View-Induced Trajectory Manipulation in Autonomous Driving
Shuo Ju; Qingzhao Zhang; Huashan Chen; Xuheng Wang; Haotang Li; Wanqian Zhang; Feng Liu; Kebin Peng; Sen He - [89%] LymphNode: A Plug-and-Play Access Control Method for Deep Neural Networks
Hanyu Pei; Shang Liu; Zeyan Liu - [88%] One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries
Itay Zloczower; Eyal Lenga; Gilad Gressel; Yisroel Mirsky - [88%] Towards Universal Physical Adversarial Attacks via a Joint Multi-Objective and Multi-Model Optimization Framework
Ziyang Liu; Hongyuan Wang; Zijian Wang; Yinxi Lu; Yunzhao Zang; Zhiqiang Yan; Qianhao Ning - [88%] Certified Robustness from Approximate Gaussian Mixture Structures in Pretrained Latent Spaces
Konstantinos Emmanouilidis; Tianjiao Ding; Nghia Nguyen; Nicolas Loizou; René Vidal - [87%] Led to Mislead: Adversarial Content Injection for Attacks on Neural Ranking Models
Amin Bigdeli; Amir Khosrojerdi; Radin Hamidi Rad; Morteza Zihayat; Charles L. A. Clarke; Ebrahim Bagheri - [87%] Model-Agnostic Lifelong LLM Safety via Externalized Attack-Defense Co-Evolution
Xiaozhe Zhang; Chaozhuo Li; Hui Liu; Shaocheng Yan; Bingyu Yan; Qiwei Ye; Haoliang Li - [87%] Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks
Kevin Kuo; Chhavi Yadav; Virginia Smith - [87%] EvoDefense: Co-Evolving Black-Box Defense with Large Language Models
Yu Li; Yuenan Hou; Yingmei Wei; Yanming Guo; Chaochao Lu - [86%] Dual-branch Robust Unlearnable Examples
Xianlong Wang; Hangtao Zhang; Wenbo Pan; Ziqi Zhou; Changsong Jiang; Li Zeng; Xiaohua Jia - [86%] Real-Time Evaluation of Autonomous Systems under Adversarial Attacks
Adithya Mohan; Xujun Xie; Venkatesh Thirugnana Sambandham; Torsten Schön - [86%] Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning
Samuel Korn - [86%] Trapping Attacker in Dilemma: Examining Internal Correlations and External Influences of Trigger for Defending GNN Backdoors
Fan Yang; Binyan Xu; Di Tang; Kehuan Zhang - [86%] Control Your View: High-Resolution Global Semantic Manipulation in Learned Image Compression
Jiaming Liang; Chi-Man Pun; Weisi Lin; Greta Seng Peng Mok - [85%] Fortifying Time Series: DTW-Certified Robust Anomaly Detection
Shijie Liu; Tansu Alpcan; Christopher Leckie; Sarah Erfani - [85%] Systematic Discovery of Semantic Attacks in Online Map Construction through Conditional Diffusion
Chenyi Wang; Ruoyu Song; Raymond Muller; Jean-Philippe Monteuuis; Jonathan Petit; Z. Berkay Celik; Ryan Gerdes; Ming F. Li - [85%] Watermarks Attack Watermarks: Re-Watermarking as a Generic Removal Strategy
Maria Bulychev; Neil G. Marchant; Benjamin I. P. Rubinstein - [85%] AdvScene: Rethinking Adversarial Patch Evaluation Through Scene Robustness
Xiaoyong; Yuan; Lan; Zhang - [84%] Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours
Raja Sekhar Rao Dheekonda; Will Pearce; Nick Landers - [84%] SoK: Robustness in Large Language Models against Jailbreak Attacks
Feiyue Xu; Hongsheng Hu; Chaoxiang He; Sheng Hang; Hanqing Hu; Xiuming Liu; Yubo Zhao; Zhengyan Zhou; Bin Benjamin Zhu; Shi-Feng Sun; Dawu Gu; Shuo Wang - [84%] BadSKP: Backdoor Attacks on Knowledge Graph-Enhanced LLMs with Soft Prompts
Xiaoting Lyu; Yufei Han; Hangwei Qian; Haoyuan Yu; Xiang Ao; Bin Wang; Chenxu Wang; Xiaobo Ma; Wei Wang - [84%] Quantum Adversarial Machine Learning: From Classical Adaptations to Quantum-Native Methods
Roozbeh Razavi-Far; Mohammad Meymani; Erfan Mahmoudinia; Dorsa Vazirzade; Peyman Paknezhad; Fateme Ghasemi; Saeed Saravani; Somayeh Nikkhoo; Kimia Haghjooei - [84%] REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations
Buyun Liang; Jinqi Luo; Liangzu Peng; Kwan Ho Ryan Chan; Darshan Thaker; Kaleab A. Kinfu; Fengrui Tian; Hamed Hassani; René Vidal - [84%] Interaction-Breaking Adversarial Learning Framework for Robust Multi-Agent Reinforcement Learning
Sunwoo Lee; Mingu Kang; Yonghyeon Jo; Seungyul Han - [84%] Density-aware Sample-specific Attack
Qiyuan Wang; Yao Li; Raymond K. W. Wong - [83%] The Great Pretender: A Stochasticity Problem in LLM Jailbreak
Jean-Philippe Monteuuis; Cong Chen; Jonathan Petit - [83%] Closed-Loop Bidirectional Prompting for Adversarial Robustness of Vision Language Models
Xiao Liu; Jiaxiang Liu; Boci Peng; Boren Hu; Yusong Wang; Xiwen Chen; Prayag Tiwari; Liming Zhang; Mingkun Xu - [83%] When Muon Optimizer Meets Adversarial Training: A Theoretical and Empirical Study
Jun Yan; Weiquan Huang; Jiankai Zuo; Yujian Mo; Xi Fang; Chengliang Wu; Zeming Wei - [83%] BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning
Ziqing Yang; Rui Wen; Xinlei He; Yun Shen; Michael Backes; Yang Zhang - [82%] STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack
Xutao Mao; Liangjie Zhao; Tao Liu; Xiang Zheng; Hongying Zan; Cong Wang - [82%] "Training robust watermarking model may hurt authentication!'' Exploring and Mitigating the Identity Leakage in Robust Watermarking
Xinyu Zhang; Ziping Dong; Qingyu Liu; Yuan Hong; Zhongjie Ba; Kui Ren - [82%] Disentangling Adversarial Prompts: A Semantic-Graph Defense for Robust LLM Security
Xiang Fang; Wanlong Fang - [81%] AGC: Adaptive Geodesic Correction for Adversarial Robustness on Vision-Language Models
Zhiwei Li; Jiacheng Xue; Weining Wang; Ajian Liu; Xingyu Gao; Zhenan Sun; Qi Li - [81%] Lightweight and Fast Backdoor Model Detection
Yinbo Yu; Jing Fang; Xuewen Zhang; Chunwei Tian; Qi Zhu; Daoqiang Zhang; Jiajia Liu - [81%] BiRD: A Bidirectional Ranking Defense Mechanism for Retrieval Augmented Generation
Chengcai Gao; Zhihong Sun; Xiaochuan Shi; Qiufeng Wang; Chao Liang - [81%] Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation
Luoyu Chen; Weiqi Wang; Zhiyi Tian; Chenhan Zhang; Feng Wu; Jianhuan Huang; Ahmed Asiri; Shui Yu - [80%] From Stealthy Data Fabrication to Unsafe Driving: Realistic Scenario Attacks on Collaborative Perception
Qingzhao Zhang; Runting Zhang; Z. Morley Mao - [80%] Persona-Conditioned Adversarial Prompting (PCAP): Multi-Identity Red-Teaming for Enhanced Adversarial Prompt Discovery
Cristian Morasso; Anisa Halimi; Muhammad Zaid Hameed; Douglas Leith - [80%] Compositional Adversarial Training for Robust Visual Watermarking
Anirudh Satheesh; Michael-Andrei Panaitescu-Liess; Andrew Xu; Georgios Milis; Heng Huang; Zikui Cai; Furong Huang - [80%] Quantum-Enhanced Adversarial Robustness in Artificial Intelligence
Jaydip Sen - [79%] Misrouter: Exploiting Routing Mechanisms for Input-Only Attacks on Mixture-of-Experts LLMs
Zekun Fei; Zihao Wang; Weijie Liu; Ruiqi He; Jianing Geng; Zheli Liu; XiaoFeng Wang - [79%] Physical Adversarial Clothing Evades Visible-Thermal Detectors via Non-Overlapping RGB-T Pattern
Xiaopei Zhu; Guanning Zeng; Zhanhao Hu; Jun Zhu; Xiaolin Hu - [79%] COPYCOP: Ownership Verification for Graph Neural Networks
Rahul Nandakumar; Deepayan Chakrabarti - [79%] Learning to Look Benign: Targeted Evasion of Malware Detectors via API Import Injection
Juozas Dautartas; Olga Kurasova; Juozapas Rokas Čypas; Viktor Medvedev - [79%] TASER: Task-Aware Stein Regularisation for Geometry-Driven Robustness
Michał Kozyra; Gesine Reinert - [78%] A Theoretical Game of Attacks via Compositional Skills
Xinbo Wu; Huan Zhang; Abhishek Umrawal; Lav R. Varshney - [78%] Research on Security Enhancement Methods for Adversarial Robust Large Language Model Intelligent Agents for Medical Decision-Making Tasks
Saisai Hu - [78%] TARO: Temporal Adversarial Rectification Optimization Using Diffusion Models as Purifiers
Daniel Wesego; Pedram Rooshenas - [78%] Re-Triggering Safeguards within LLMs for Jailbreak Detection
Zheng Lin; Zhenxing Niu; Haoxuan Ji; Yuzhe Huang; Haichang Gao - [78%] FedSurrogate: Backdoor Defense in Federated Learning via Layer Criticality and Surrogate Replacement
Fatima Z. Abacha; Sin G. Teo; Yuanxiang Wu; Lucas C. Cordeiro; Mustafa A. Mustafa - [78%] Universal Graph Backdoor Defense: A Feature-based Homophily Perspective
Mengting Pan; Fan Li; Chen Chen; Xiaoyang Wang - [78%] TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models
Xin Wang; Yixu Wang; Jiaming Zhang; Ruofan Wang; Jiaqi Yu; Kai Chen; Jingjing Chen; Xingjun Ma; Yu-Gang Jiang - [78%] RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents
Doguhuan Yeke; Yanming Zhou; Leo Y. Lin; Hongyu Cai; Antonio Bianchi; Z. Berkay Celik - [78%] Learning to Perturb Hidden Representations for Generalizable Deep Learning
Hua Li - [77%] RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs
Zhiyuan Xu; Joseph Gardiner; Sana Belguith; Lichao Wu - [77%] Cross-Modal Backdoors in Multimodal Large Language Models
Runhe Wang; Li Bai; Haibo Hu; Songze Li - [77%] PCDM: A Diffusion-Based Data Poisoning Attack Against Federated Learning Systems
Wei Sun; Yijun Chen; Bo Gao; Ke Xiong; Yuwei Wang; Pingyi Fan; Khaled Ben Letaief - [77%] Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling
Ziwei Wang; Jing Chen; Ruichao Liang; Zhi Wang; Yebo Feng; Ju Jia; Ruiying Du; Cong Wu; Yang Liu - [77%] Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training
Avidan Shah; Jannik Brinkmann; Rico Angell - [77%] GEO-Bench: Benchmarking Ranking Manipulation in Generative Engine Optimization
Ojas Nimase; Zhe Chen; Gengpei Qi; Yue Zhao; Xiyang Hu - [77%] ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving
Mohammadreza Teymoorianfard; Jean-Philippe Monteuuis; Jonathan Petit; Amir Houmansadr - [77%] Audio Jailbreaks in Large Audio-Language Models: Taxonomy, Attack-Defense Analysis, and Cost-Aware Evaluation
Bo-Han Feng; Yu-Hsuan Li Liang; Chien-Feng Liu; You-Hsuan Chang; Yun-Nung Chen - [77%] When AI Meets Wall Street: A Survey on Trustworthy AI in Fintech
Qingwen Zeng; Zhenghao Zhao; Yitian Yang; Yiqi Zhu; Fangchen Liu; Zhaoge Bi; Moe Thandar Kyaw Wynn; Kim-Kwang Raymond Choo; Huaming Chen - [76%] CleanBase: Detecting Malicious Documents in RAG Knowledge Databases
Weifei Jin; Xilong Wang; Wei Zou; Jinyuan Jia; Neil Gong - [76%] Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses
Kemal Derya; Berk Sunar - [76%] GraphIP-Bench: How Hard Is It to Steal a Graph Neural Network, and Can We Stop It?
Kaixiang Zhao; Bolin Shen; Yuyang Dai; Shayok Chakraborty; Yushun Dong - [76%] Trusted Weights, Treacherous Optimizations? Optimization-Triggered Backdoor Attacks on LLMs
Yifei Wang; Tianlin Li; Xiaohan Zhang; Yida Yang; Xiaoyu Zhang; Li Pan - [76%] Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents
Yongxiang Li; Moxin Li; Zhixin Ma; Fengbin Zhu; Dongrui Liu; Wenjie Wang; Fuli Feng - [75%] Adversarial Update-Based Federated Unlearning for Poisoned Model Recovery
Wenwei Zhao; Xiaowen Li; Yao Liu; Zhuo Lu - [75%] CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models
Ji Guo; Xiaolong Qin; Cencen Liu; Jielei Wang; Jierun Chen; Wenbo Jiang - [75%] Adversarial Reframing: A Framework for Targeted Generation in Language Models
Shahnewaz Karim Sakib; Swati Kar; Anindya Bijoy Das - [74%] Disentangling Intent from Role: Adversarial Self-Play for Persona-Invariant Safety Alignment
Jiajia Li; Xiaoyu Wen; Zhongtian Ma; Shuyue Hu; Qiaosheng Zhang; Zhen Wang - [74%] Phantom Force: Injecting Adversarial Tactile Perceptions into Embodied Intelligence via EMI
Zirui Kong; Youqian Zhang; Sze Yiu Chau - [74%] Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks
John T. Halloran; Noopur S. Bhatt - [74%] Poisoning the Watchtower: Prompt Injection Attacks Against LLM-Augmented Security Operations Through Adversarial Log Content
Rohan Pandey; Archit Bhujang - [74%] Ellipsoid Control: A White-list Jailbreak Defense via Benign Latent Modeling
Luoyu Chen; Weiqi Wang; Zhiyi Tian; Feng Wu; Ahmed Asiri; Shui Yu - [73%] A New Framework to Analyse the Distributional Robustness of Deep Neural Networks
Divij Khaitan; Subhashis Banerjee - [73%] Boundary-targeted Membership Inference Attacks on Safety Classifiers
Anthony Hughes; Alexander Goldberg; Prince Jha; Adam Perer; Nikolaos Aletras; Niloofar Mireshghallah - [73%] SPARD: Defending Harmful Fine-Tuning Attack via Safety Projection with Relevance-Diversity Data Selection
Shuhao Chen; Weisen Jiang; Yeqi Gong; Shengda Luo; Chengxiang Zhuo; Zang Li; James T. Kwok; Yu Zhang - [73%] VLA-Hijack: A Transferable Patch Attack against Vision-Language-Action Models via Visual Proprioception Hijacking
Jiyuan Fu; Kaixun Jiang; Jingkai Jia; Zhaoyu Chen; Xueyao Chen; Lingyi Hong; Shuyong Gao; Chenzhi Tan; Dingkang Yang; Wenqiang Zhang - [72%] Membership Inference Attacks for Retrieval Based In-Context Learning for Document Question Answering
Tejas Kulkarni; Antti Koskela; Laith Zumot - [72%] Undetectable Backdoors in Model Parameters: Hiding Sparse Secrets in High Dimensions
Sarthak Choudhary; Atharv Singh Patlan; Nils Palumbo; Ashish Hooda; Kassem Fawaz; Somesh Jha - [72%] Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation
Cristian Morasso; Anisa Halimi; Muhammad Zaid Hameed; Douglas Leith - [72%] Frequency-Domain Regularized Adversarial Alignment for Transferable Attacks against Closed-Source MLLMs
Leitao Yuan; Qinghua Mao; Daizong Liu; Kun Wang; Wenjie Wang; Yan Teng; Jing Shao; Dongrui Liu - [72%] CCLab: Adversarial Testing of Learning- and Non-Learning-Based Congestion Controllers
Zhi Chen; Shehab Sarar Ahmed; Chenkai Wang; Brighten Godfrey; Gang Wang - [71%] MEMSAD: Gradient-Coupled Anomaly Detection for Memory Poisoning in Retrieval-Augmented Agents
Ishrith Gowda - [71%] Can It Reach the Generator? Investigating the Survival of Prompt-Injection Attacks in Realistic RAG Settings
Yu Yin; Shuai Wang; Bevan Koopman; Guido Zuccon - [70%] The Power of Order: Fooling LLMs with Adversarial Table Permutations
Xinshuai Dong; Haifeng Chen; Xuyuan Liu; Shengyu Chen; Haoyu Wang; Shaoan Xie; Kun Zhang; Zhengzhang Chen - [70%] LLM-Agnostic Semantic Representation Attack
Jiawei Lian; Jianhong Pan; Lefan Wang; Yi Wang; Tairan Huang; Shaohui Mei; Lap-Pui Chau - [70%] GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives
Alexandre Le Mercier; Chris Develder; Thomas Demeester - [70%] Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing
Zheng Lin; Zhenxing Niu; Haoxuan Ji; Haichang Gao - [70%] STRIDE-AI: A Threat Modeling Framework for Generative AI Security Assessment
Tsafac Nkombong Regine Cyrille; Franziska Schwarz - [70%] Can Quantum Federated Learning Withstand Circuit-Level Backdoors?
Aakar Mathur; Mohammed Ruknuddin; Ashish Gupta - [70%] Toward Understanding Adversarial Distillation: Why Robust Teachers Fail
Hongsin Lee; Hye Won Chung - [70%] Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection
Lixing Lin; Juli You; Yue Li; Luyun Lin; Yiqing Wang; Zhen Zhang; Moxuan Zheng - [70%] PAST2HARM: A Simple Adaptive Past Tense Attack for Jailbreaking Multimodal AI
Snehasis Mukhopadhyay - [69%] Backdoor Threats in Variational Quantum Circuits: Taxonomy, Attacks, and Defenses
Lei Jiang; Fan Chen - [69%] OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences
Kaixiang Wang; Jiong Lou; Zhaojiacheng Zhou; Jie Li - [69%] LASH: Adaptive Semantic Hybridization for Black-Box Jailbreaking of Large Language Models
Abdullah Al Nomaan Nafi; Fnu Suya; Swarup Bhunia; Prabuddha Chakraborty - [68%] I can't recognize (yet): Delayed Rendering to Defeat Visual Phishing Detectors
Ying Yuan; Cristiano Alex Rado; Giovanni Apruzzese; Mauro Conti; Luigi Vincenzo Mancini - [68%] WMAttack: Automated Attack Search for Adversarial Evaluation of World-Model Agents
Zhixiang Guo; Siyuan Liang; Shi Fu; Cheng Guo; Andras Balogh; Mark Jelasity; Dacheng Tao - [68%] Test-Time Collective Action: Proxy-Based Perturbations for Correcting Algorithmic Harms
Meghana Bhange; Ulrich Aïvodji; Elliot Creager - [67%] Defense against Poisoning Attacks under Shuffle-DP
Siyi Wang; Qiyao Luo; Yihua Hu; Lixu Wang; Quanqing Xu; Chuanhui Yang; Zhan Qin; Kui Ren; Wei Dong - [67%] On the Hardness of Junking LLMs
Marco Rando; Samuel Vaiter - [67%] Hybrid Quantum-Classical GANs for the Generation of Adversarial Network Flows
Prateek Paudel; Nitin Jha; Abhishek Parakh; Mahadevan Subramaniam - [67%] Poison with Style: A Practical Poisoning Attack on Code Large Language Models
Khang Tran; Yazan Boshmaf; Issa Khalil; NhatHai Phan; Ting Yu; Md Rizwan Parvez - [66%] Your Neighbors Know: Leveraging Local Neighborhoods for Backdoor Detection in Decentralized Learning
Sayan Biswas; Antoine Boutet; Davide Frey; Romaric Gaudel; Rachid Guerraoui; Maxime Jacovella; Anne-Marie Kermarrec; Dimitri Lerévérend; François Taïani; Martijn de Vos - [66%] Exposing Vulnerabilities in Visible-Infrared VLMs: A Unified Geometric Adversarial Framework with Cross-Task Transferability
Xiang Chen; Yuxian Dong; Chao Li; Chengyin Hu; Jiaju Han; Fengyu Zhang; Yiwei Wei; Jiahuan Long; Jiujiang Guo - [66%] When Stronger Triggers Backfire: A High-Dimensional Theory of Backdoor Attacks
Donald Flynn; Hadas Yaron Goldhirsh; Jonathan P. Keating; Inbar Seroussi - [66%] Capability and Robustness Cannot Both Be Free: An Information-Theoretic Bound for Vision-Language-Action Models
Jianwei Tai - [66%] Structure-Guided Visual Perturbation Neutralization for LVLMs
Yuanhe Zhang; Xueting Wang; YanBin Ren; Haoran Gao; Xinhan Zheng; Zhenhong Zhou; Fanyu Meng; Li Sun; Sen Su - [66%] Investigating Detection and Obfuscation of Prompt Injection Attacks Against Software Reverse Engineering AI Agents
Brian Crawford; Patrick McClure - [65%] BehaviorGuard: Online Backdoor Defense for Deep Reinforcement Learning
Yinbo Yu; Xueyu Yin; Jiadai Wang; Chunwei Tian; Sai Xu; Qi Zhu; Daoqiang Zhang - [65%] The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring
Ismail Hossain; Tanzim Ahad; Md Jahangir Alam; Sai Puppala; Syed Bahauddin Alam; Sajedul Talukder - [65%] Latent-space Attacks for Refusal Evasion in Language Models
Giorgio Piras; Raffaele Mura; Fabio Brau; Maura Pintor; Luca Oneto; Fabio Roli; Battista Biggio - [65%] PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs
Luze Sun; Anshuman Suri; Harsh Chaudhari; Cristina Nita-Rotaru; Alina Oprea - [65%] Improving Adversarial Robustness of Attribution via Implicit Regularization
Amir Mehrpanah; Matteo Gamba; Hossein Azizpour - [64%] Repurposing and Evaluating the (In)Feasibility of Dataset Poisoning enabled Watermarking for Contrastive Learning
Zhiyang Dai; Yansong Gao; Boyu Kuang; Haodong Li; Qi Chang; Gaurav Varshney; Derek Abbott; Anmin Fu - [64%] When Actions Disappear: Adversarial Action Removal in Self-Play Reinforcement Learning
Arahan Kujur - [64%] ShadowMerge: A Novel Poisoning Attack on Graph-Based Agent Memory via Relation-Channel Conflicts
Yang Luo; Zifeng Kang; Tiantian Ji; Xinran Liu; Yong Liu; Shuyu Li; Lingyun Peng - [64%] PGID: Progressive Guided Inversion and Denoising for Robust Watermark Detection
Minh Quoc Duong; Chun Tong Lei; Chun Pong Lau - [64%] Protecting On-Device AI Inference: A Systematic Review of Attacks and Defence Mechanisms
Zisis Tsiatsikas; Alexandros Fakis; Georgios Karopoulos; Vasileios Kouliaridis; Marios Anagnostopoulos - [64%] Evaluating using Mock Tool Calls to Quarantine Untrusted Prompt Inputs
David Gros; Adam Gleave - [63%] Mitigating Many-shot Jailbreak Attacks with One Single Demonstration
Kejia Chen; Jiawen Zhang; Boheng Li; Pengcheng Li; Jian Lou; Zunlei Feng; Mingli Song; Ruoxi Jia; Tianwei Zhang - [63%] MetaBackdoor: Exploiting Positional Encoding as a Backdoor Attack Surface in LLMs
Rui Wen; Mark Russinovich; Andrew Paverd; Jun Sakuma; Ahmed Salem - [63%] Prompt Overflow: What the Guardrail Inspects Is Not What the Model Infers
Yuanbo Zhou; Changjia Zhu; Junyu Wang; Xu He; Yan Zhai; Kun Sun; Mingkui Wei; Junjie Xiong - [62%] Plan2Cleanse: Test-Time Backdoor Defense via Monte-Carlo Planning in Deep Reinforcement Learning
Sze-Ann Chen; Zhi-Yi Chin; Kui-Yuan Chen; Chi-Yu Li; Ping-Chun Hsieh - [62%] When Emotion Becomes Trigger: Emotion-style dynamic Backdoor Attack Parasitising Large Language Models
Ziyu Liu; Tao Li; Tianjie Ni; Xiaolong Lan; Wengang Ma; Tao Yang; Guohua Wang; Junjiang He - [61%] Disciplined Diffusion: Text-to-Image Diffusion Model against NSFW Generation
Chi Zhang; Changjia Zhu; Xiaowen Li; Yao Liu; Zhuo Lu - [61%] Uncovering Hidden Systematics in Neural Network Models for High Energy Physics
Lucie Flek; Philipp Alexander Jungs; Akbar Karimi; Timo Saala; Alexander Schmid; Matthias Schott; Philipp Soldin; Christopher Wiebusch; Ulrich Willemsen - [61%] AESOP: Adversarial Execution-path Selection to Overload Deep Learning Pipelines
Tingxi Li; Mingfang Ji; Ravishka Shemal Rathnasuriya; Simin Chen; Yitao Hu; Wei Yang - [61%] Quantifying Cyber-Vulnerability in Power Electronics Systems via an Impedance-Based Attack Reachable Domain
Hongwei Zhen; Ze Yu; Xin Xiang; Wuhua Li; Mingyang Sun - [61%] Widening the Gap: Exploiting LLM Quantization via Outlier Injection
Xiaohua Zhan; Kazuki Egashira; Robin Staab; Mark Vero; Martin Vechev - [61%] Fast and Lightweight Backdoor Detection via Head Random Probing
Yinbo Yu; Xueyu Yin; Jing Fang; Chunwei Tian; Qi Zhu; Jiajia Liu; Daoqiang Zhang - [61%] Defending LLM-based Multi-Agent Systems Against Cooperative Attacks with Sentence-Level Rectification
Yaoyang Luo; Zhi Zheng; Ziwei Zhao; Tong Xu; Zhao Jielun; Wenjun Xue; Yong Chen; Enhong Chen - [60%] FLRSP: Privacy-Preserving Federated Learning Using Randomly Selected Model Parameters
Hiroto Sawada; Shoko Imaizumi; Hitoshi Kiya - [60%] Lightweight Stylistic Consistency Profiling: Robust Detection of LLM-Generated Textual Content for Multimedia Moderation
Siyuan Li; Aodu Wulianghai; Xi Lin; Xibin Yuan; Qinghua Mao; Guangyan Li; Xiang Chen; Jun Wu; Jianhua Li - [60%] Disagreement-Regularized Importance Sampling for Adversarial Label Corruption
Csongor Horváth; Ida-Maria Sintorn; Prashant Singh - [60%] Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization
Mengqi He; Xinyu Tian; Xin Shen; Shu Zou; Jinhong Ni; Zhaoyuan Yang; Weikang Li; Xuesong Li; Jing Zhang - [60%] Compositional Jailbreaking: An Empirical Analysis of Mutator Chain Interactions in Aligned LLMs
Reinelle Jan Bugnot; Soohyeon Choi; Hoon Wei Lim; Yue Duan - [60%] When and Why Adversarial Training Improves PINNs: A Neural Tangent Kernel Perspective
Yuan-dong Cao; Chi Chiu SO; Jun-Min Wang; He Wang - [60%] Token by Token, Compromised: Backdoor Vulnerabilities in Unified Autoregressive Models
Tobias Braun; Jonas Henry Grebe; Hossein Shakibania; Anna Rohrbach; Marcus Rohrbach - [60%] TimeGuard: Channel-wise Pool Training for Backdoor Defense in Time Series Forecasting
Quang Duc Nguyen; Siyuan Liang; Yiming Li; Fushuo Huo; Dacheng Tao - [60%] Turning Bias into Bugs: Bandit-Guided Style Manipulation Attacks on LLM Judges
Xianglin Yang; Bryan Hooi; Gelei Deng; Tianwei Zhang; Jin Song Dong - [60%] Probabilistic Smoothing with Ratio-Monotone Transforms for Global Optimization
Kukyoung Jang; Taehyun Cho; Junrui Zhang; Ping Xu; Kyungjae Lee - [59%] Homoglyph-based Adversarial Perturbation of Introductory Computer Science Theory Problems
Aidan Alexander; Chitrangada Juneja; Napaluck Tontrasathien; Miro Vanek; Reyan Ahmed; Saumya Debray; Sazzadur Rahaman - [59%] Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories
Dongcheng Zhang; Yi Zhang; Yuxin Chen; An Zhang; Xiang Wang; Chaochao Lu - [59%] Hierarchical End-to-End Taylor Bounds for Complete Neural Network Verification
Taha Entesari; Mahyar Fazlyab - [59%] AIM: Adversarial Information Masking for Faithfulness Evaluation of Saliency Maps
Chia-Ying Hsieh; Hsin-Yuan Fang; Chun-Shu Wei - [59%] When Efficiency Backfires: Cascading LLMs Trigger Cascade Failure under Adversarial Attack
Zehan Sun; Dingfan Chen; Songze Li - [59%] Test-Time Training Undermines Safety Guardrails
Simone Antonelli; Sadegh Akhondzadeh; Aleksandar Bojchevski - [59%] Lipschitz Optimization for Formal Verification of Homographies
Jean-Guillaume Durand; Panagiotis Kouvaros; Maxime Gariel; Alessio Lomuscio - [59%] SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning
Jiachen Qian - [59%] Evolving Skill-Structured Attack Memory Enhances LLM Jailbreaking
Junke Zhang; Jianwei Wang; Sishuo Chen; Yizhang He; Qingshuai Feng; Zhengyi Yang - [58%] WebTrap: Stealthy Mid-Task Hijacking of Browser Agents During Navigation
Zhichao Liu; Wenbo Pan; Haining Yu; Ge Gao; Tianqing Zhu; Xiaohua Jia - [58%] When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications
Farzad Nourmohammadzadeh Motlagh; Mehrdad Hajizadeh; Mehryar Majd; Pejman Najafi; Feng Cheng; Christoph Meinel - [58%] Robust Biomedical Publication Type and Study Design Classification with Knowledge-Guided Perturbations
Shufan Ming; Joe D. Menke; Neil R. Smalheiser; Halil Kilicoglu - [58%] KG-ASG: Collision-Knowledge-Guided Closed-Loop Adversarial Scenario Generation With Primary-Support Attribution
Cheng Wang; Chen Xiong; Ziwen Wang; Yuchen Zhou; Qiang Liu - [58%] Few-Shot Network Intrusion Detection Using Online Triplet Mining
Jack Wilkie; Hanan Hindy; Christos Tachtatzis; Miroslav Bures; Robert Atkinson - [58%] Harnessing non-adversarial robustness in large language models
Qinghua Zhou; Ellina Aleshina; Andrey Lovyagin; Oleg Somov; Mikhail Seleznyov; Alexander Panchenko; Ivan Oseledets; Elena Tutubalina; Ivan Y. Tyukin - [58%] Hijacking Agent Memory: Stealthy Trojan Attacks Through Conversational Interaction
Hongtao Wang; Se Yang; Yu Chen; Puzhuo Liu - [57%] Stego Battlefield: Evaluating Image Steganography Attacks and Steganalysis Defenses
Zhen Sun; Zongmin Zhang; Leyi Sheng; Yule Liu; Yifan Liao; Ke Li; Xinhu Zheng; Jiaheng Wei; Wenyuan Yang; Xinlei He - [57%] Exposing and Mitigating Temporal Attack in Deepfake Video Detection
Zheyuan Gu; Minghao Shao; Zhen Wang; Yusong Wang; Mingkun Xu; Shijie Zhang; Hao Jiang - [57%] Generate "Normal", Edit Poisoned: Branding Injection via Hint Embedding in Image Editing
Desen Sun; Jason Hon; Howe Wang; Saarth Rajan; Meng Xu; Sihang Liu - [57%] To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model
Chengshuai Zhao; Zhen Tan; Dawei Li; Zhiyuan Yu; Huan Liu - [57%] ASPI: Seeking Ambiguity Clarification Amplifies Prompt Injection Vulnerability in LLM Agents
Udari Madhushani Sehwag; Zhengyang Shan; Heming Liu; Dileepa Lakshan; Joseph Brandifino; Max Fenkell - [57%] Agent Security is a Systems Problem
Mihai Christodorescu; Earlence Fernandes; Ashish Hooda; Somesh Jha; Johann Rehberger; Kamalika Chaudhuri; Xiaohan Fu; Khawaja Shams; Guy Amir; Jihye Choi; Sarthak Choudhary; Nils Palumbo; Andrey Labunets; Nishit V. Pandya - [57%] From Prompt Injection to Persistent Control: Defending Agentic Harness Against Trojan Backdoors
Jiejun Tan; Zhicheng Dou; Xinyu Yang; Yuyang Hu; Yiruo Cheng; Xiaoxi Li; Ji-Rong Wen - [56%] Single-Configuration Attack Success Rate Is Not Enough: Jailbreak Evaluations Should Report Distributional Attack Success
Carsten Maple; Abhishek Kumar; Riya Tapwal - [56%] FAME: Feature Activation Map Explanation on Image Classification and Face Recognition
Xinyi Zhang; Manuel Günther - [56%] EnCAgg: Enhanced Clustering Aggregation for Robust Federated Learning against Dynamic Model Poisoning
Tianyun Zhang; Zhen Yang; Haozhao Wang; Ru Zhang; Yongfeng Huang - [56%] AI Security Research Should Better Incentivize Defense Research
Youqian Zhang - [56%] Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions
Wenjuan Li; Yitao Liu; Runze Chen; Rajkumar Buyya - [55%] Jailbreaking Vision-Language Models Through the Visual Modality
Aharon Azulay; Jan Dubiński; Zhuoyun Li; Atharv Mittal; Yossi Gandelsman - [55%] Narrow Secret Loyalty Dodges Black-Box Audits
Alfie Lamerton; Fabien Roger - [55%] Towards Fine-Grained Robustness: Attention-Guided Test-Time Prompt Tuning for Vision-Language Models
Jia-Wei Hai; Yijun Wang; Xiu-Shen Wei - [55%] Beyond Attack Success Rate: Temporal Logit Observability for LLM Safety Failures
Junyoung Park; Sunghwan Park; Seongyong Ju; Jaewoo Lee - [55%] Can Subgraph Explanations Be Weaponized to Steal Graph Neural Networks?
Ojas Nimase; Jiate Li; Yue Zhao; Yushun Dong - [54%] TrajShield: Trajectory-Level Safety Mediation for Defending Text-to-Video Models Against Jailbreak Attacks
Quanchen Zou; Nizhang Li; Wenxin Zhang; Jiaye Lin; Yangchen Zeng; Xiangzheng Zhang; Zonghao Ying - [54%] A Generalized Singular Value Theory for Neural Networks
Brian Charles Brown; Robert Bridges; David Grimsman; Mauricio Munoz; Sean Warnick - [54%] Backdoor Channels Hidden in Latent Space: Cryptographic Undetectability in Modern Neural Networks
Marte Eggen; Eirik Reiestad; Kristian Gjøsteen; Inga Strümke - [54%] Inducing Overthink: Hierarchical Genetic Algorithm-based DoS Attack on Black-Box Large Language Reasoning Models
Shuqiang Wang; Wei Cao; Jiaqi Weng; Jialing Tao; Licheng Pan; Hui Xue; Zhixuan Chu - [54%] Guided Diffusion Sampling for Precipitation Forecast Interventions
Ayumu Ueyama; Kazuhiko Kawamoto; Hiroshi Kera - [54%] LivePI: More Realistic Benchmarking of Agents Against Indirect Prompt Injection
Lei Zhao; Abhay Bhaskar; Edgar Dobriban - [54%] Not What You Asked For: Typographic Attacks in Household Robot Manipulation
Ali Iranmanesh; Peng Liu - [54%] Automatically Attacking Software Reverse Engineering AI Agents
Brian Crawford; Justin Phillips; Patrick McClure - [53%] Distributed Learning with Adversarial Gradient Perturbations
Nawapon Sangsiri; Yufei Tao - [53%] Certified Robustness under Heterogeneous Perturbations via Hybrid Randomized Smoothing
Blaise Delattre; Hengyu Wu; Paul Caillon; Wei Yang Bryan Lim; Yang Cao - [53%] On the Robustness of Machine Unlearning for Vision-Language Models
Yujie Lin; Kaidi Jia; Jiayao Ma; Chengyi Yang; Jinsong Su - [52%] Zero Day Attacks: Novel Behaviour or Novel Vulnerability?
Nnamdi Jibunoh; Sara Khanchi; Adetokunbo Makanju - [52%] Adversarial SQL Injection Generation with LLM-Based Architectures
Ali Karakoc; H. Birkan Yilmaz - [52%] The Distillation Game: Adaptive Attacks & Efficient Defenses
Youssef Allouah; Mahdi Haghifam; Sanmi Koyejo; Reza Shokri - [52%] Out of Sight, Not Out of Mind: Unveiling Latent Attack in Latent-based Multi-Agent Systems
Chenxi Wang; Ruiyang Huang; Jiayan Sun; Lei Wei; Yifan Wu - [52%] The Surface You Test Is Not the Surface That Breaks
Shifat E Arman; Syed Nazmus Sakib; Nafiul Haque; Shahrear Bin Amin - [51%] The Adversarial Discount — AI, Signal Correlation, and the Cybersecurity Arms Race
James W. Bono - [51%] A Systematic Investigation of RL-Jailbreaking in LLMs
Montaser Mohammedalamen; Kevin Roice; Reginald McLean; Alyssa Lefaivre Škopac - [50%] Trojan Hippo: Weaponizing Agent Memory for Data Exfiltration
Debeshee Das; Julien Piet; Darya Kaviani; Luca Beurer-Kellner; Florian Tramèr; David Wagner - [50%] Self-Mined Hardness for Safety Fine-Tuning
Prakhar Gupta; Garv Shah; Donghua Zhang - [50%] Exposing LLM Safety Gaps Through Mathematical Encoding:New Attacks and Systematic Analysis
Haoyu Zhang; Mohammad Zandsalimy; Shanu Sushmita - [50%] Causal Explanations from the Geometric Properties of ReLU Neural Networks
Hector Woods; Philippa Ryan; Rob Alexander - [50%] PROWL: Prioritized Regret-Driven Optimization for World Model Learning
Ahmet H. Güzel; Jenny Seidenschwarz; Benjamin Graham; Jonathan Sadeghi; Jeffrey Hawke; Ilija Bogunovic - [50%] AI Agents May Always Fall for Prompt Injections
Sahar Abdelnabi; Eugene Bagdasarian - [50%] An Empirical Study of Privacy Leakage Chains via Prompt Injection in Black-Box Chatbot Environments
Hongjang Yang; Hyunsik Na; Daeseon Choi - [50%] MIRAGE: Context-Aware Prompt Injection against Mobile GUI Agents via User-Generated Content
Ruoqi Guo; Yi Liu; Gelei Deng; Yiheng Xiong; Yuekang Li; Ying Zhang; Leo Yu Zhang; Lida Zhao; Ji Jie; Yuxiao Lu - [49%] Attention Is Where You Attack
Aviral Srivastava; Sourav Panda - [49%] When Embedding-Based Defenses Fail: Rethinking Safety in LLM-Based Multi-Agent Systems
Lingxi Zhang; Guangtao Zheng; Hanjie Chen - [49%] Pop Quiz Attack: Black-box Membership Inference Attacks Against Large Language Models
Zeyuan Chen; Yihan Ma; Xinyue Shen; Michael Backes; Yang Zhang - [49%] The Geometric Structure of Models Learning Sparse Data
Thomas Walker; T. Mitchell Roddenberry; Ahmed Imtiaz Humayun; Randall Balestriero; Richard Baraniuk - [49%] Knowledge Poisoning Attacks on Medical Multi-Modal Retrieval-Augmented Generation
Peiru Yang; Haoran Zheng; Tong Ju; Shiting Wang; Wanchun Ni; Jiajun Liu; Shangguang Wang; Yongfeng Huang; Tao Qi - [49%] SoK: Unlearnability and Unlearning for Model Dememorization
Mengying Zhang; Derui Wang; Ruoxi Sun; Xiaoyu Xia; Shuang Hao; Minhui Xue - [49%] Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis
Zvi Topol - [49%] Backdooring Masked Diffusion Language Models
Daniel Yiming Cao; Chengzhong Wang; Sheng-Yen Chou; Chengyu Huang; Pin-Yu Chen; Shengwei An - [49%] HARP: Measuring Harm Amplification in Multi-Agent LLM Systems
Md Hafizur Rahman; Zafaryab Haider; Tanzim Mahfuz; Prabuddha Chakraborty - [49%] Gradient Perturbation: Learning to Perturb Gradients for Adaptive Training
Hua Li - [48%] On the explainability of max-plus neural networks
Ikhlas Enaieh; Olivier Fercoq; García Ángel - [48%] Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning
Hao Zhou; Tiru Wu; Yan Jiang; Wanqi Zhou; Junxing Hu; Ai Han - [48%] Devilray: A Systematic Adversarial Model Revealing Blind Spots in Fake Base Station Detection
Taekkyung Oh; Duckwoo Kim; Hansung Bae; Beomseok Oh; CheolJun Park; Tyler Tucker; Nathaniel Bennett; Sangwook Bae; Byeongdo Hong; Patrick Traynor; Yongdae Kim - [48%] Harder to Defend: Towards Chinese Toxicity Attacks via Implicit Enhancement and Obfuscation Rewriting
Jingyi Kang; Junyu Lu; Bo Xu; Hongbo Wang; Linlin zong; Roy Ka-Wei Lee; Hongfei Lin - [47%] Beyond Semantic Relevance: Counterfactual Risk Minimization for Robust Retrieval-Augmented Generation
Peiyang Liu; Qiang Yan; Ziqiang Cui; Di Liang; Xi Wang; Wei Ye - [47%] MIND: Monge Inception Distance for Generative Models Evaluation
Quentin Berthet; Yu-Han Wu; Clement Crepy; Romuald Elie; Klaus Greff; Michael Eli Sander - [47%] From Clouds to Hallucinations: Atmospheric Retrieval Hijacking in Remote Sensing Vision-Language RAG
Jiaju Han; Chao Li; Chengyin Hu; Qike Zhang; Xuemeng Sun; Xin Wang; Fengyu Zhang; Xiang Chen; Yiwei Wei; Jiahuan Long; Jiujiang Guo - [47%] A Cross-Modal Prompt Injection Attack against Large Vision-Language Models with Image-Only Perturbation
Hao Yang; Zhuo Ma; Yang Liu; Yilong Yang; Guancheng Wang; JianFeng Ma - [47%] Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment
Nguyen Linh Bao Nguyen; Wanlun Ma; Viet Vo; Alsharif Abuadbba; Minghong Fang; Jun Zhang; Yang Xiang - [46%] On the Geometric Limits of Transformer Defenses against Obfuscation Attacks: Latent Embedding Collapse & Performance Robustness Gap
Becky Mashaido; Tapadhir Das - [46%] On the Impact of Class Imbalance on the Learning Dynamics of Deep Neural Networks:An Intuitive Insight
Ismail B. Mustapha; Shafaatunnur Hasan; Sunday O. Olatunji; Hatem S. Y. Nabus - [46%] Bounded Behavioral Indistinguishability for Black-Box LLM Distillation
Munawar Hasan - [45%] PINSIGHT: A Comprehensive Threat Exploration of Domain-Adaptive Wi-Fi based PIN Code Inference
Johannes Kortz; Paul Staat; Christof Paar; Christian Zenger - [45%] TUANDROMD-X: Advanced Entropy and Visual Analytics Dataset for Enhanced Malware Detection and Classification
Parthajit Borah; Upasana Sarmah; D. K. Bhattacharyya; J. K. Kalita - [45%] Single-Sample Black-Box Membership Inference Attack against Vision-Language Models via Cross-modal Semantic Alignment
Jiaqing Li; Yajuan Lu; Xiaochuan Shi; Gang Wu; ZhongYuan Wang; Chao Liang - [45%] The Capability Paradox: How Smarter Auditors Make Multi-Agent Systems Less Secure
Qiqi Liu; Runhan Song; Shilin Ye - [45%] Acoustic Interference: A New Paradigm Weaponizing Acoustic Latent Semantic for Universal Jailbreak against Large Audio Language Models
Yanyun Wang; Yu Huang; Zi Liang; Xixin Wu; Li Liu - [45%] Attention-Guided Reward for Reinforcement Learning-based Jailbreak against Large Reasoning Models
Zheng Lin; Zhenxing Niu; Haoxuan Ji; Yuzhe Huang; Haichang Gao - [45%] Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes
Mohammed Alshaalan; Miguel R. D. Rodrigues - [45%] LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers
Lingyao Li; Junjie Xiong; Changjia Zhu; Runlong Yu; Chen Chen; Junyu Wang; Renkai Ma; Zhicong Lu - [45%] Audio Pirates: Black-box Audio Watermark Removal via Diffusion Priors
Lingfeng Yao; Xincong Zhong; Chenpei Huang; Xuandong Zhao; Hanqing Guo; Aohan Li; Jiang Liu; Tomoaki Ohtsuki; Miao Pan - [44%] Batch Normalization for Neural Networks on Complex Domains
Xuan Son Nguyen; Nistor Grozavu - [44%] Stable Agentic Control: Tool-Mediated LLM Architecture for Autonomous Cyber Defense
Kerri Prinos; Lilianne Brush; Cameron Denton; Zhanqi Wang; Joshua Knox; Snehal Antani; Anton Foltz; Amy Villaseñor - [44%] Empirical Evidence for Simply Connected Decision Regions in Image Classifiers
Arjhun Swaminathan; Mete Akgün - [44%] The Misattribution Gap: When Memory Poisoning Looks Like Model Failure in Agentic AI Systems
Tanzim Ahad; Ismail Hossain; Md Jahangir Alam; Sai Puppala; Syed Bahauddin Alam; Sajedul Talukder - [44%] XAI and Statistical Analysis for Reliable Intrusion Detection in the UAVIDS-2025 Dataset: From Tree to Hybrid and Tabular DNN Ensembles
Iakovos-Christos Zarkadis; Christos Douligeris - [44%] EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy
Xuanyu Ge; Zhongqi Wang; Jie Zhang; Shiguang Shan; Xilin Chen - [44%] Detecting and Mitigating Backdoor Attacks in OTA-FL Systems: A Two-Stage Robust Aggregation Scheme
Xiaoyan Ma; Seohyun Lee; Taejoon Kim; Christopher G. Brinton - [44%] From Automation to Collaboration: Human-in-the-Loop Methods for Safe and Trustworthy NLP
Most. Sharmin Sultana Samu; MD. Tanvir Ahmed Seum; Md. Rakibul Islam - [44%] Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models
Tao Qi; Huili Wang; Yuanhong Huang; Wendan Wang; Lianchao Zhao; Jinrui Wang; Zichen Qin; Shangguang Wang; Yongfeng Huang - [43%] Dimensionality-Aware Anomaly Detection in Learned Representations of Self-Supervised Speech Models
Sandra Arcos-Holzinger; Sarah M. Erfani; James Bailey; Sanjeev Khudanpur - [43%] OrchJail: Jailbreaking Tool-Calling Text-to-Image Agents by Orchestration-Guided Fuzzing
Jianming Chen; Yawen Wang; Junjie Wang; Zhe Liu; Qing Wang; Fanjiang Xu - [43%] FragBench: Cross-Session Attacks Hidden in Benign-Looking Fragments
Astha Mehta; Niruthiha Selvanayagam; Cedric Lam; Hengxu Li; Phuc-Nguyen Nguyen; Raymond Lee; Olivia McGoffin; My; Luong; Arthur Collé; Jamie Johnson; David Williams-King; Linh Le - [43%] SCI-Defense: Defending Manipulation Attacks from Generative Engine Optimization
Xucheng Yu; Haibo Jin; Huimin Zeng; Haohan Wang - [43%] RADAR: Defending RAG Dynamically against Retrieval Corruption
Ziyuan Chen; Yueming Lyu; Yi Liu; Weixiang Han; Jing Dong; Caifeng Shan; Tieniu Tan - [43%] MRMMIA: Membership Inference Attacks on Memory in Chat Agents
Kai Chen; Yan Pang; Tianhao Wang - [43%] Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization
Zhihao Liu; Yifan Wu; Jian Lou; Di Wang; Yuxi Zhou; Yuke Hu - [42%] BadDLM: Backdooring Diffusion Language Models with Diverse Targets
Shengfang Zhai; Xiaoyang Ji; Yuling Shi; Haoran Gao; Fanyu Meng; Yan Zeng; Yuejian Fang; Yinpeng Dong; Jiaheng Zhang - [42%] AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents
Yassin H. Rassul; Tarik A. Rashid - [42%] Safety Context Injection: Inference-Time Safety Alignment via Static Filtering and Agentic Analysis
Zhenhao Xu; Wenhan Chang; Yichuan Chen; Yuxin Fang; Junhao Liu; Tianqing Zhu - [42%] A Transfer Learning Evaluation of Deep Neural Networks for Image Classification
Nermeen Abou Baker; Nico Zengeler; Uwe Handmann - [42%] Hidden in Memory: Sleeper Memory Poisoning in LLM Agents
Sidharth Pulipaka; Stanislau Hlebik; Leonidas Raghav; Sahar Abdelnabi; Vyas Raina; Ivaxi Sheth; Mario Fritz - [42%] Membership Inference Attacks on Discrete Diffusion Language Models
Shailesh Kasivelrajan - [42%] Who Owns This Agent? Tracing AI Agents Back to Their Owners
Ruben Chocron; Doron Jonathan Ben Chayim; Eyal Lenga; Gilad Gressel; Alina Oprea; Yisroel Mirsky - [42%] Cert-LAS: Toward Certified Model Ownership Verification for Text-to-Image Diffusion Models via Layer-Adaptive Smoothing
Leyi Qi; Yiming Li; Siyuan Liang; Zhengzhong Tu; Dacheng Tao - [41%] Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses
Xiao Li; Xiang Zheng; Yifeng Gao; Xinyu Xia; Yixu Wang; Xin Wang; Ye Sun; Yunhan Zhao; Ming Wen; Jiayu Li; Zixing Chen; Xun Gong; Yi Liu; Yige Li; Yutao Wu; Cong Wang; Jun Sun; Yixin Cao; Zhineng Chen; Jingjing Chen; Tao Gui; Qi Zhang; Zuxuan Wu; Xipeng Qiu; Xuanjing Huang; Tiehua Zhang; Zhipeng Wei; Kun Wang; Xinfeng Li; Hanxun Huang; Sarah Erfani; James Bailey; Jianping Wang; Chaowei Xiao; Ran He; Bo Li; Xingjun Ma; Yu-Gang Jiang - [41%] Efficient Preference Poisoning Attack on Offline RLHF
Chenye Yang; Weiyu Xu; Lifeng Lai - [41%] PIIGuard: Mitigating PII Harvesting under Adversarial Sanitization
Mingshuo Liu; Yiwei Zha; Min Chen - [41%] Membership Inference Attacks on Vision-Language-Action Models
Yuefeng Peng; Mingzhe Li; Kejing Xia; Renhao Zhang; Amir Houmansadr - [41%] New Wide-Net-Casting Jailbreak Attacks Risk Large Models
Qiuchi Xiang; Haoxuan Qu; Hossein Rahmani; Jun Liu - [41%] Mental Damage: Caption Poisoning Attacks on Retrieval-Augmented Text-to-Music Generation
Yizhu Wen; Shuhao Zhang; Nan Zhang; Long Cheng; Hanqing Guo - [41%] New Insight of Variance reduce in Zero-Order Hard-Thresholding: Mitigating Gradient Error and Expansivity Contradictions
Xinzhe Yuan; William de Vazelhes; Bin Gu; Huan Xiong - [41%] Landseer: Exploring the Machine Learning Defense Landscape
Ayushi Sharma; Rosemary Agbozo; Santiago Torres-Arias; Zahra Ghodsi - [40%] PAMPOS: Causal Transformer-based Trajectory Prediction for Attack-Agnostic Misbehavior Detection in V2X Networks
Konstantinos Kalogiannis; Ahmed Mohamed Hussain; Panos Papadimitratos - [40%] Benchmarking Sensor-Fault Robustness in Forecasting
Alexander Windmann; Philipp Wittenberg; Gianluca Manca; Marcel Dix; Jens U. Brandt; Oliver Niggemann - [40%] AuraMask: An Extensible Pipeline for Developing Aesthetic Anti-Facial Recognition Image Filters
Jacob Lagogiannis; William Agnew; Rosa I. Arriaga; Sauvik Das - [40%] DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs
Wenzhuo Xu; Zhipeng Wei; Zonghao Ying; Deyue Zhang; Dongdong Yang; Xiangzheng Zhang; Quanchen Zou
2026-04 (241 papers)
- [100%] Can Drift-Adaptive Malware Detectors Be Made Robust? Attacks and Defenses Under White-Box and Black-Box Threats
Adrian Shuai Li; Md Ajwad Akil; Elisa Bertino - [100%] Fragile Reconstruction: Adversarial Vulnerability of Reconstruction-Based Detectors for Diffusion-Generated Images
Haoyang Jiang; Mingyang Yi; Shaolei Zhang; Junxian Cai; Qingbin Liu; Xi Chen; Ju Fan - [100%] Adversarial Robustness of NTK Neural Networks
Yuxuan Hou - [100%] Defending Quantum Classifiers against Adversarial Perturbations through Quantum Autoencoders
Emma Andrews; Sahan Sanjaya; Prabhat Mishra - [99%] PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
Jingning Xu; Haochen Luo; Chen Liu - [99%] Spike-PTSD: A Bio-Plausible Adversarial Example Attack on Spiking Neural Networks via PTSD-Inspired Spike Scaling
Lingxin Jin; Wei Jiang; Maregu Assefa Habtie; Letian Chen; Jinyu Zhan; Xingzhi Zhou; Lin Zuo; Naoufel Werghi - [99%] Defending against Patch-Based and Texture-Based Adversarial Attacks with Spectral Decomposition
Wei Zhang; Xinyu Chang; Xiao Li; Yiming Zhu; Xiaolin Hu - [99%] QShield: Securing Neural Networks Against Adversarial Attacks using Quantum Circuits
Navid Azimi; Aditya Prakash; Yao Wang; Li Xiong - [99%] Transferable Physical-World Adversarial Patches Against Object Detection in Autonomous Driving
Zihui Zhu; Ziqi Zhou; Yichen Wang; Lulu Xue; Minghui Li; Shengshan Hu - [99%] Robust Alignment: Harmonizing Clean Accuracy and Adversarial Robustness in Adversarial Training
Yanyun Wang; Qingqing Ye; Li Liu; Zi Liang; Haibo Hu - [98%] Towards Physically Realizable Adversarial Attenuation Patch against SAR Object Detection
Yiming Zhang; Weibo Qin; Feng Wang - [98%] HQA-VLAttack: Towards High Quality Adversarial Attack on Vision-Language Pre-Trained Models
Han Liu; Jiaqi Li; Zhi Xu; Xiaotong Zhang; Xiaoming Xu; Fenglong Ma; Yuanman Li; Hong Yu - [98%] APC: Transferable and Efficient Adversarial Point Counterattack for Robust 3D Point Cloud Recognition
Geunyoung Jung; Soohong Kim; Inseok Kong; Jiyoung Jung - [98%] Benign Overfitting in Adversarial Training for Vision Transformers
Jiaming Zhang; Meng Ding; Shaopeng Fu; Jingfeng Zhang; Di Wang - [98%] The Unseen Adversaries: Robust and Generalized Defense Against Adversarial Patches
Vishesh Kumar; Akshay Agarwal - [98%] Low Rank Adaptation for Adversarial Perturbation
Han Liu; Shanghao Shi; Yevgeniy Vorobeychik; Chongjie Zhang; Ning Zhang - [97%] Making MLLMs Blind: Adversarial Smuggling Attacks in MLLM Content Moderation
Zhiheng Li; Zongyang Ma; Yuntong Pan; Ziqi Zhang; Xiaolei Lv; Bo Li; Jun Gao; Jianing Zhang; Chunfeng Yuan; Bing Li; Weiming Hu - [97%] CAAP: Capture-Aware Adversarial Patch Attacks on Palmprint Recognition Models
Renyang Liu; Jiale Li; Jie Zhang; Cong Wu; Xiaojun Jia; Shuxin Li; Wei Zhou; Kwok-Yan Lam; See-kiong Ng - [97%] XFED: Non-Collusive Model Poisoning Attack Against Byzantine-Robust Federated Classifiers
Israt Jahan Mouri; Muhammad Ridowan; Muhammad Abdullah Adnan - [97%] Topo-ADV: Generating Topology-Driven Imperceptible Adversarial Point Clouds
Gayathry Chandramana Krishnan Nampoothiry; Raghuram Venkatapuram; Anirban Ghosh; Ayan Dutta - [97%] GF-Score: Certified Class-Conditional Robustness Evaluation with Fairness Guarantees
Arya Shah; Kaveri Visavadiya; Manisha Padala - [97%] Physically-Induced Atmospheric Adversarial Perturbations: Enhancing Transferability and Robustness in Remote Sensing Image Classification
Weiwei Zhuang; Wangze Xie; Qi Zhang; Xia Du; Zihan Lin; Zheng Lin; Hanlin Cai; Jizhe Zhou; Zihan Fang; Chi-man Pun; Wei Ni; Jun Luo - [97%] Towards Certified Malware Detection: Provable Guarantees Against Evasion Attacks
Nandakrishna Giri; Asmitha K. A.; Serena Nicolazzo; Antonino Nocera; Vinod P - [97%] Adversarial Evasion in Non-Stationary Malware Detection: Minimizing Drift Signals through Similarity-Constrained Perturbations
Pawan Acharya; Lan Zhang - [97%] Adversarial Co-Evolution of Malware and Detection Models: A Bilevel Optimization Perspective
Olha Jurečková; Martin Jureček; Matouš Kozák; Róbert Lórencz - [96%] Diffusion-Guided Adversarial Perturbation Injection for Generalizable Defense Against Facial Manipulations
Yue Li; Linying Xue; Kaiqing Lin; Hanyu Quan; Dongdong Lin; Hui Tian; Hongxia Wang; Bin Wang - [96%] Adversarial Robustness of Near-Field Millimeter-Wave Imaging under Waveform-Domain Attacks
Lhamo Dorje; Jordan Madden; Soamar Homsi; Xiaohua Li - [96%] UniAda: Universal Adaptive Multi-objective Adversarial Attack for End-to-End Autonomous Driving Systems
Jingyu Zhang; Jacky Wai Keung; Yan Xiao; Yihan Liao; Yishu Li; Xiaoxue Ma - [95%] Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models
Songlong Xing; Weijie Wang; Zhengyu Zhao; Jindong Gu; Philip Torr; Nicu Sebe - [95%] TopFeaRe: Locating Critical State of Adversarial Resilience for Graphs Regarding Topology-Feature Entanglement
Xinxin Fan; Wenxiong Chen; Quanliang Jing; Chi Lin; Shaoye Luo; Wenbo Song; Yunfeng Lu - [95%] Hierarchically Robust Zero-shot Vision-language Models
Junhao Dong; Yifei Zhang; Hao Zhu; Yew-Soon Ong; Piotr Koniusz - [95%] Transferable Physical-World Adversarial Patches Against Pedestrian Detection Models
Shihui Yan; Ziqi Zhou; Yufei Song; Yifan Hu; Minghui Li; Shengshan Hu - [94%] Backdoor Attacks on Decentralised Post-Training
Oğuzhan Ersoy; Nikolay Blagoev; Jona te Lintelo; Stefanos Koffas; Marina Krček; Stjepan Picek - [94%] Adversarial Robustness of Deep State Space Models for Forecasting
Sribalaji C. Anand; George J. Pappas - [94%] Understanding and Improving Continuous Adversarial Training for LLMs via In-context Learning Theory
Shaopeng Fu; Di Wang - [94%] Stochasticity in Tokenisation Improves Robustness
Sophie Steger; Rui Li; Sofiane Ennadir; Anya Sims; Arno Solin; Franz Pernkopf; Martin Trapp - [93%] CoopGuard: Stateful Cooperative Agents Safeguarding LLMs Against Evolving Multi-Round Attacks
Siyuan Li; Zehao Liu; Xi Lin; Qinghua Mao; Yuliang Chen; Haoyu Li; Jun Wu; Jianhua Li; Xiu Su - [93%] Adversarial Robustness of Time-Series Classification for Crystal Collimator Alignment
Xaver Fink; Borja Fernandez Adiego; Daniele Mirarchi; Eloise Matheson; Alvaro Garcia Gonzales; Gianmarco Ricci; Joost-Pieter Katoen - [93%] Route to Rome Attack: Directing LLM Routers to Expensive Models via Adversarial Suffix Optimization
Haochun Tang; Yuliang Yan; Jiahua Lu; Huaxiao Liu; Enyan Dai - [93%] When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
Akash Ghosh; Subhadip Baidya; Sriparna Saha; Xiuying Chen - [93%] CSC: Turning the Adversary's Poison against Itself
Yuchen Shi; Xin Guo; Huajie Chen; Tianqing Zhu; Bo Liu; Wanlei Zhou - [93%] Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training
Mengnan Zhao; Lihe Zhang; Tianhang Zheng; Bo Wang; Baocai Yin - [92%] Exact Certification of Neural Networks and Partition Aggregation Ensembles against Label Poisoning
Ajinkya Mohgaonkar; Lukas Gosch; Mahalakshmi Sabanayagam; Debarghya Ghoshdastidar; Stephan Günnemann - [92%] Learning Robustness at Test-Time from a Non-Robust Teacher
Stefano Bianchettin; Giulio Rossolini; Giorgio Buttazzo - [92%] Beyond Attack Success Rate: A Multi-Metric Evaluation of Adversarial Transferability in Medical Imaging Models
Emily Curl; Kofi Ampomah; Md Erfan; Sayanton Dibbo - [92%] SafeReview: Defending LLM-based Review Systems Against Adversarial Hidden Prompts
Yuan Xin; Yixuan Weng; Minjun Zhu; Ying Ling; Chengwei Qin; Michael Backes; Yue Zhang; Linyi Yang - [91%] Low-Effort Jailbreak Attacks Against Text-to-Image Safety Filters
Ahmed B Mustafa; Zihan Ye; Yang Lu; Michael P Pound; Shreyank N Gowda - [91%] Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks
Yingying Zhao; Chengyin Hu; Qike Zhang; Xin Li; Xin Wang; Yiwei Wei; Jiujiang Guo; Jiahuan Long; Tingsong Jiang; Wen Yao - [91%] ArmSSL: Adversarial Robust Black-Box Watermarking for Self-Supervised Learning Pre-trained Encoders
Yongqi Jiang; Yansong Gao; Boyu Kuang; Chunyi Zhou; Anmin Fu; Liquan Chen - [90%] Stealthy and Adjustable Text-Guided Backdoor Attacks on Multimodal Pretrained Models
Yiyang Zhang; Chaojian Yu; Ziming Hong; Yuanjie Shao; Qinmu Peng; Tongliang Liu; Xinge You - [90%] INTARG: Informed Real-Time Adversarial Attack Generation for Time-Series Regression
Gamze Kirman Tokgoz; Onat Gungor; Tajana Rosing; Baris Aksanli - [89%] Street-Legal Physical-World Adversarial Rim for License Plates
Nikhil Kalidasu; Sahana Ganapathy - [89%] Retina gap junctions support the robust perception by warping neural representational geometries along the visual hierarchy
Yang Yue; Shenjian Zhang; Yonghong Tian; Kai Du; Tiejun Huang - [89%] ProtoGuard-SL: Prototype Consistency Based Backdoor Defense for Vertical Split Learning
Yuhan Shui; Ruobin Jin; Zhihao Dou; Zhiqiang Gao - [89%] Explainability-Guided Adversarial Attacks on Transformer-Based Malware Detectors Using Control Flow Graphs
Andrew Wheeler; Kshitiz Aryal; Maanak Gupta - [89%] Beyond Standard Benchmarks: A Systematic Audit of Vision-Language Model's Robustness to Natural Semantic Variation Across Diverse Tasks
Jia Chengyu; AprilPyone MaungMaung; Huy H. Nguyen; Jinyin Chen; Isao Echizen - [89%] Compression as an Adversarial Amplifier Through Decision Space Reduction
Lewis Evans; Harkrishan Jandu; Zihan Ye; Yang Lu; Shreyank N Gowda - [89%] Follow My Eyes: Backdoor Attacks on Goal-Directed Scanpath Prediction
Diana Romero; Mutahar Ali; Momin Ahmad Khan; Habiba Farrukh; Fatima Anwar; Salma Elmalaki - [89%] Penny Wise, Pixel Foolish: Bypassing Price Constraints in Multimodal Agents via Visual Adversarial Perturbations
Jiachen Qian; Zhaolu Kang - [89%] NeuroTrace: Inference Provenance-Based Detection of Adversarial Examples
Firas Ben Hmida; Philemon Hailemariam; Kashif Ali Khan; Birhanu Eshete - [88%] Fluently Lying: Adversarial Robustness Can Be Substrate-Dependent
Daye Kang; Hyeongboo Baek - [88%] A Unified Perspective on Adversarial Membership Manipulation in Vision Models
Ruize Gao; Kaiwen Zhou; Yongqiang Chen; Feng Liu - [88%] Physical Adversarial Attacks on AI Surveillance Systems:Detection, Tracking, and Visible–Infrared Evasion
Miguel A. DelaCruz; Patricia Mae Santos; Rafael T. Navarro - [88%] Robustness Analysis of Machine Learning Models for IoT Intrusion Detection Under Data Poisoning Attacks
Fortunatus Aabangbio Wulnye; Justice Owusu Agyemang; Kwame Opuni-Boachie Obour Agyekum; Kwame Agyeman-Prempeh Agyekum; Kingsford Sarkodie Obeng Kwakye; Francisca Adomaa Acheampong - [88%] Mitigating Error Amplification in Fast Adversarial Training
Mengnan Zhao; Lihe Zhang; Bo Wang; Tianhang Zheng; Hong Zhong; Geyong Min - [87%] Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models
Jiawei Chen; Simin Huang; Jiawei Du; Shuaihang Chen; Yu Tian; Mingjie Wei; Chao Yu; Zhaoxia Yin - [87%] Towards Understanding the Robustness of Sparse Autoencoders
Ahson Saiyed; Sabrina Sadiekh; Chirag Agarwal - [87%] Toward Polymorphic Backdoor against Semantic Communication via Intensity-Based Poisoning
Xiao Yang; Yuni Lai; Gaolei Li; Jun Wu; Kai Zhou; Jianhua Li; Mingzhe Chen - [86%] Adversarial Robustness Analysis of Cloud-Assisted Autonomous Driving Systems
Maher Al Islam; Amr S. El-Wakeel - [86%] Stealthy Backdoor Attacks against LLMs Based on Natural Style Triggers
Jiali Wei; Ming Fan; Guoheng Sun; Xicheng Zhang; Haijun Wang; Ting Liu - [86%] Sharpness-Aware Poisoning: Enhancing Transferability of Injective Attacks on Recommender Systems
Junsong Xie; Yonghui Yang; Pengyang Shao; Le Wu - [86%] Adversarial Malware Generation in Linux ELF Binaries via Semantic-Preserving Transformations
Lukáš Hrdonka; Martin Jureček - [85%] The Deployment Gap in AI Media Detection: Platform-Aware and Visually Constrained Adversarial Evaluation
Aishwarya Budhkar; Trishita Dhara; Siddhesh Sheth - [85%] Adversarial Humanities Benchmark: Results on Stylistic Robustness in Frontier Model Safety
Marcello Galisai; Susanna Cifani; Francesco Giarrusso; Piercosma Bisconti; Matteo Prandi; Federico Pierucci; Federico Sartore; Daniele Nardi - [85%] How Adversarial Environments Mislead Agentic AI?
Zhonghao Zhan; Huichi Zhou; Zhenhao Li; Peiyuan Jing; Krinos Li; Hamed Haddadi - [84%] SECURE: Stable Early Collision Understanding via Robust Embeddings in Autonomous Driving
Wenjing Wang; Wenxuan Wang; Songning Lai - [84%] Efficient Adversarial Training via Criticality-Aware Fine-Tuning
Wenyun Li; Zheng Zhang; Dongmei Jiang; Yaowei Wang; Xiangyuan Lan - [84%] Temporary Power Adjusting Withholding Attack
Mustafa Doger; Sennur Ulukus - [83%] Multimodal Backdoor Attack on VLMs for Autonomous Driving via Graffiti and Cross-Lingual Triggers
Jiancheng Wang; Lidan Liang; Yong Wang; Zengzhen Su; Haifeng Xia; Yuanting Yan; Wei Wang - [83%] PIArena: A Platform for Prompt Injection Evaluation
Runpeng Geng; Chenlong Yin; Yanting Wang; Ying Chen; Jinyuan Jia - [83%] PASTA: A Patch-Agnostic Twofold-Stealthy Backdoor Attack on Vision Transformers
Dazhuang Liu; Yanqi Qiao; Rui Wang; Kaitai Liang; Georgios Smaragdakis - [83%] Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines
Mazal Bethany; Kim-Kwang Raymond Choo; Nishant Vishwamitra; Peyman Najafirad - [82%] Towards Robust Content Watermarking Against Removal and Forgery Attacks
Yifan Zhu; Yihan Wang; Xiao-Shan Gao - [82%] Phantasia: Context-Adaptive Backdoors in Vision Language Models
Nam Duong Tran; Phi Le Nguyen - [82%] Understanding Adversarial Transferability in Vision-Language Models for Autonomous Driving: A Cross-Architecture Analysis
David Fernandez; Pedram MohajerAnsari; Amir Salarpour; Mert D. Pese - [81%] Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks
Jin Zhao; Marta Knežević; Tanja Käser - [80%] Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models
Zonghao Ying; Haowen Dai; Lianyu Hu; Zonglei Jing; Quanchen Zou; Yaodong Yang; Aishan Liu; Xianglong Liu - [79%] Seeing No Evil: Blinding Large Vision-Language Models to Safety Instructions via Adversarial Attention Hijacking
Jingru Li; Wei Ren; Tianqing Zhu - [78%] The Persistent Vulnerability of Aligned AI Systems
Aengus Lynch - [78%] MirageBackdoor: A Stealthy Attack that Induces Think-Well-Answer-Wrong Reasoning
Yizhe Zeng; Wei Zhang; Yunpeng Li; Juxin Xiao; Xiao Wang; Yuling Liu - [78%] Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models
Ravikumar Balakrishnan; Sanket Mendapara; Ankit Garg - [78%] Useful nonrobust features are ubiquitous in biomedical images
Coenraad Mouton; Randle Rabe; Niklas C. Koser; Nicolai Krekiehn; Christopher Hansen; Jan-Bernd Hövener; Claus-C. Glüer - [77%] Out of Sight, Out of Track: Adversarial Attacks on Propagation-based Multi-Object Trackers via Query State Manipulation
Halima Bouzidi; Haoyu Liu; Yonatan Gizachew Achamyeleh; Praneetsai Vasu Iddamsetty; Mohammad Abdullah Al Faruque - [77%] Towards Verified and Targeted Explanations through Formal Methods
Hanchen David Wang; Diego Manzanas Lopez; Preston K. Robinette; Ipek Oguz; Taylor T. Johnson; Meiyi Ma - [77%] RefineRAG: Word-Level Poisoning Attacks via Retriever-Guided Text Refinement
Ziye Wang; Guanyu Wang; Kailong Wang - [77%] DETOUR: A Practical Backdoor Attack against Object Detection
Dazhuang Liu; Yanqi Qiao; Rui Wang; Kaitai Liang; Georgios Smaragdakis - [76%] SkillAttack: Automated Red Teaming of Agent Skills through Attack Path Refinement
Zenghao Duan; Yuxin Tian; Zhiyi Yin; Liang Pang; Jingcheng Deng; Zihao Wei; Shicheng Xu; Yuyao Ge; Xueqi Cheng - [76%] Conjunctive Prompt Attacks in Multi-Agent LLM Systems
Nokimul Hasan Arif; Qian Lou; Mengxin Zheng - [75%] Beyond Uniform Sampling: Synergistic Active Learning and Input Denoising for Robust Neural Operators
Samrendra Roy; Souvik Chakraborty; Syed Bahauddin Alam - [75%] Poisoning Learned Index Structures: Static and Dynamic Adversarial Attacks on ALEX
Allen Jue - [74%] Are GUI Agents Focused Enough? Automated Distraction via Semantic-level UI Element Injection
Wenkui Yang; Chao Jin; Haisu Zhu; Weilin Luo; Derek Yuen; Kun Shao; Junxian Duan; Huaibo Huang; Jie Cao; Ran He - [73%] Beyond Semantic Manipulation: Token-Space Attacks on Reward Models
Yuheng Zhang; Mingyue Huo; Minghao Zhu; Mengxue Zhang; Nan Jiang - [73%] Scaling Exposes the Trigger: Input-Level Backdoor Detection in Text-to-Image Diffusion Models via Cross-Attention Scaling
Zida Li; Jun Li; Yuzhe Sha; Ziqiang Li; Lizhi Xiong; Zhangjie Fu - [73%] Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs
Jianhao Chen; Haoyang Chen; Hanjie Zhao; Haozhe Liang; Tieyun Qian - [73%] Adaptive Prompt Embedding Optimization for LLM Jailbreaking
Miles Q. Li; Benjamin C. M. Fung; Boyang Li; Radin Hamidi Rad; Ebrahim Bagheri - [72%] Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation
Wentao Zhang; Yan Zhuang; ZhuHang Zheng; Mingfei Zhang; Jiawen Deng; Fuji Ren - [72%] Detection of T-shirt Presentation Attacks in Face Recognition Systems
Mathias Ibsen; Loris Tim Ide; Christian Rathgeb; Christoph Busch - [72%] ID-Eraser: Proactive Defense Against Face Swapping via Identity Perturbation
Junyan Luo; Peipeng Yu; Jianwei Fei; Shiya Zeng; Xiaoyu Zhou; Zhihua Xia; Xiang Liu - [71%] Thinking Wrong in Silence: Backdoor Attacks on Continuous Latent Reasoning
Swapnil Parekh - [71%] Find the Differences: Differential Morphing Attack Detection vs Face Recognition
Una M. Kelly; Luuk J. Spreeuwers; Raymond N. J. Veldhuis - [70%] On the Robustness of Watermarking for Autoregressive Image Generation
Andreas Müller; Denis Lukovnikov; Shingo Kodama; Minh Pham; Anubhav Jain; Jonathan Petit; Niv Cohen; Asja Fischer - [70%] Transient Turn Injection: Exposing Stateless Multi-Turn Vulnerabilities in Large Language Models
Naheed Rayhan; Sohely Jahan - [69%] A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models
Tianmeng Fang; Yong Wang; Zetai Kong; Zengzhen Su; Jun Wang; Chengjin Yu; Wei Wang - [69%] FastAT Benchmark: A Comprehensive Framework for Fair Evaluation of Fast Adversarial Training Methods
Chao Pan; Xin Yao - [68%] AtomEval: Validity-Aware Atomic Evaluation of Adversarial Claim Rewriting in Fact Verification
Hongyi Cen; Mingxin Wang; Yule Liu; Jingyi Zheng; Hanze Jia; Tan Tang - [68%] When Can You Poison Rewards? A Tight Characterization of Reward Poisoning in Linear MDPs
Jose Efraim Aguilar Escamilla; Haoyang Hong; Jiawei Li; Haoyu Zhao; Xuezhou Zhang; Sanghyun Hong; Huazheng Wang - [67%] Mosaic: Multimodal Jailbreak against Closed-Source VLMs via Multi-View Ensemble Optimization
Yuqin Lan; Gen Li; Yuanze Hu; Weihao Shen; Zhaoxin Fan; Faguo Wu; Xiao Zhang; Laurence T. Yang; Zhiming Zheng - [67%] Short Message Service (SMS) Phishing Attacks and Defenses: A Systematic Review
Mir Mehedi A. Pritom; Seyed Mohammad Sanjari; Maraz Mia; Ashfak Md Shibli; S M Mostaq Hossain; Muhammad Ismail; Shouhuai Xu - [67%] Evaluating Jailbreaking Vulnerabilities in LLMs Deployed as Assistants for Smart Grid Operations: A Benchmark Against NERC Standards
Taha Hammadia; Lucas Rea; Ahmad Mohammad Saber; Amr Youssef; Deepa Kundur - [65%] Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion
Vishal Pramanik; Maisha Maliha; Susmit Jha; Sumit Kumar Jha - [65%] The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems
Yihao Zhang; Kai Wang; Jiangrong Wu; Haolin Wu; Yuxuan Zhou; Zeming Wei; Dongxian Wu; Xun Chen; Jun Sun; Meng Sun - [65%] RACF: A Resilient Autonomous Car Framework with Object Distance Correction
Chieh Tsai; Hossein Rastgoftar; Salim Hariri - [64%] ResGuard: Enhancing Robustness Against Known Original Attacks in Deep Watermarking
Hanyi Wang; Han Fang; Yupeng Qiu; Shilin Wang; Ee-Chien Chang - [64%] Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection
Meng Chen; Kun Wang; Li Lu; Jiaheng Zhang; Tianwei Zhang - [64%] Improving Diversity in Black-box Few-shot Knowledge Distillation
Tri-Nhan Vo; Dang Nguyen; Kien Do; Sunil Gupta - [63%] WARP: Guaranteed Inner-Layer Repair of NLP Transformers
Hsin-Ling Hsu; Min-Yu Chen; Nai-Chia Chen; Yan-Ru Chen; Yi-Ling Chang; Fang Yu - [63%] Understanding the Effects of Safety Unalignment on Large Language Models
John T. Halloran - [63%] AttackEval: A Systematic Empirical Study of Prompt Injection Attack Effectiveness Against Large Language Models
Jackson Wang - [63%] Harnessing Hyperbolic Geometry for Harmful Prompt Detection and Sanitization
Igor Maljkovic; Maria Rosaria Briglia; Iacopo Masi; Antonio Emanuele Cinà; Fabio Roli - [63%] ACIArena: Toward Unified Evaluation for Agent Cascading Injection
Hengyu An; Minxi Li; Jinghuai Zhang; Naen Xu; Chunyi Zhou; Changjiang Li; Xiaogang Xu; Tianyu Du; Shouling Ji - [63%] Critical-CoT: A Robust Defense Framework against Reasoning-Level Backdoor Attacks in Large Language Models
Vu Tuan Truong; Long Bao Le - [63%] One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations
Ravikumar Balakrishnan; Sanket Mendapara - [62%] BadSkill: Backdoor Attacks on Agent Skills via Model-in-Skill Poisoning
Guiyao Tie; Jiawen Shi; Pan Zhou; Lichao Sun - [62%] Ranking Abuse via Strategic Pairwise Data Perturbations
Junyi Yao; Zihao Zheng; Jiayu Long - [62%] Towards a Systematic Risk Assessment of Deep Neural Network Limitations in Autonomous Driving Perception
Svetlana Pavlitska; Christopher Gerking; J. Marius Zöllner - [62%] Auto-ART: Structured Literature Synthesis and Automated Adversarial Robustness Testing
Abhijit Talluri - [61%] Your Agent, Their Asset: A Real-World Safety Analysis of OpenClaw
Zijun Wang; Haoqin Tu; Letian Zhang; Hardy Chen; Juncheng Wu; Xiangyan Liu; Zhenlong Yuan; Tianyu Pang; Michael Qizhe Shieh; Fengze Liu; Zeyu Zheng; Huaxiu Yao; Yuyin Zhou; Cihang Xie - [61%] Extending ZACH-ViT to Robust Medical Imaging: Corruption and Adversarial Stress Testing in Low-Data Regimes
Athanasios Angelakis; Marta Gomez-Barrero - [60%] Adversarial Label Invariant Graph Data Augmentations for Out-of-Distribution Generalization
Simon Zhang; Ryan P. DeMilt; Kun Jin; Cathy H. Xia - [60%] DeepSeek Robustness Against Semantic-Character Dual-Space Mutated Prompt Injection
Junyu Ren; Xingjian Pan; Wensheng Gan; Philip S. Yu - [60%] Robustness of Vision Foundation Models to Common Perturbations
Hongbin Liu; Zhengyuan Jiang; Cheng Hong; Neil Zhenqiang Gong - [60%] When Safe Concepts Become Unsafe: Multi-Concept Compositional Vulnerabilities in Text-to-Image Models
Chaoshuo Zhang; Yibo Liang; Mengke Tian; Chenhao Lin; Zhengyu Zhao; Le Yang; Chong Zhang; Yang Zhang; Qian Wang; Chao Shen - [60%] Spore: Efficient and Training-Free Privacy Extraction Attack on LLMs via Inference-Time Hybrid Probing
Yu Cui; Ruiqing Yue; Hang Fu; Sicheng Pan; Zhuoyu Sun; Baohan Huang; Haibin Zhang; Cong Zuo; Licheng Wang - [60%] The Forensic Cost of Watermark Removal: From Dedicated Attacks to Image Editing
Gautier Evennou; Ewa Kijak - [60%] Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection
Prashant Kulkarni - [59%] Can You Trust the Vectors in Your Vector Database? Black-Hole Attack from Embedding Space Defects
Hanxi Li; Jianan Zhou; Jiale Lao; Yibo Wang; Zhengmao Ye; Yang Cao; Junfen Wang; Mingjie Tang - [59%] SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems
Yunhao Feng; Yifan Ding; Yingshui Tan; Boren Zheng; Yanming Guo; Xiaolong Li; Kun Zhai; Yishan Li; Wenke Huang - [59%] TEMPLATEFUZZ: Fine-Grained Chat Template Fuzzing for Jailbreaking and Red Teaming LLMs
Qingchao Shen; Zibo Xiao; Lili Huang; Enwei Hu; Yongqiang Tian; Junjie Chen - [59%] AdaBFL: Multi-Layer Defensive Adaptive Aggregation for Bzantine-Robust Federated Learning
Zehui Tang; Yuchen Liu; Feihu Huang - [58%] Preference Redirection via Attention Concentration: An Attack on Computer Use Agents
Dominik Seip; Matthias Hein - [58%] Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game
Yuanbo Xie; Yingjie Zhang; Yulin Li; Shouyou Song; Xiaokun Chen; Zhihan Liu; Liya Su; Tingwen Liu - [57%] Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models
Chengyin Hu; Yuxian Dong; Yikun Guo; Xiang Chen; Qike Zhang; Junqi Wu; Jiahuan Long; Jiujiang Guo; Yiwei Wei; Tingsong Jiang; Wen Yao - [57%] Label Leakage Attacks in Machine Unlearning: A Parameter and Inversion-Based Approach
Weidong Zheng; Kongyang Chen; Yao Huang; Yuanwei Guo; Yatie Xiao - [57%] Into the Gray Zone: Domain Contexts Can Blur LLM Safety Boundaries
Ki Sen Hung; Xi Yang; Chang Liu; Haoran Li; Kejiang Chen; Changxuan Fan; Tsun On Kwok; Weiming Zhang; Xiaomeng Li; Yangqiu Song - [56%] Adversarial Attacks in AI-Driven RAN Slicing: SLA Violations and Recovery
Deemah H. Tashman; Soumaya Cherkaoui - [56%] Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems
Yubin Qu; Yi Liu; Tongcheng Geng; Gelei Deng; Yuekang Li; Leo Yu Zhang; Ying Zhang; Lei Ma - [56%] GRM: Utility-Aware Jailbreak Attacks on Audio LLMs via Gradient-Ratio Masking
Yunqiang Wang; Hengyuan Na; Di Wu; Miao Hu; Guocong Quan - [56%] No More Guessing: a Verifiable Gradient Inversion Attack in Federated Learning
Francesco Diana; Chuan Xu; André Nusser; Giovanni Neglia - [56%] SIF: Semantically In-Distribution Fingerprints for Large Vision-Language Models
Yifei Zhao; Qian Lou; Mengxin Zheng - [56%] Do Protective Perturbations Really Protect Portrait Privacy under Real-world Image Transformations?
Ruiqing Sun; Xingshan Yao; Zhijing Wu; Tian Lan; Chenhao Cui; Huiyang Zhao; Jialing Shi; Chen Yang; Xianling Mao - [55%] AutoEG: Exploiting Known Third-Party Vulnerabilities in Black-Box Web Applications
Ruozhao Yang; Mingfei Cheng; Gelei Deng; Junjie Wang; Tianwei Zhang; Xiaofei Xie - [55%] SafeCtrl: Region-Aware Safety Control for Text-to-Image Diffusion via Detect-Then-Suppress
Lingyun Zhang; Yu Xie; Zhongli Fang; Yu Liu; Ping Chen - [55%] Immune2V: Image Immunization Against Dual-Stream Image-to-Video Generation
Zeqian Long; Ozgur Kara; Haotian Xue; Yongxin Chen; James M. Rehg - [54%] Variational Feature Compression for Model-Specific Representations
Zinan Guo; Zihan Wang; Chuan Yan; Liuhuo Wan; Ethan Ma; Guangdong Bai - [54%] Mechanistic Anomaly Detection via Functional Attribution
Hugo Lyons Keenan; Christopher Leckie; Sarah Erfani - [54%] Laplace-Bridged Randomized Smoothing for Fast Certified Robustness
Miao Lin; MD Saifur Rahman Mazumder; Feng Yu; Daniel Takabi; Rui Ning - [53%] Best of both worlds: Stochastic & adversarial best-arm identification
Yasin Abbasi-Yadkori; Peter L. Bartlett; Victor Gabillon; Alan Malek; Michal Valko - [53%] When Can We Trust Deep Neural Networks? Towards Reliable Industrial Deployment with an Interpretability Guide
Hang-Cheng Dong; Yuhao Jiang; Yibo Jiao; Lu Zou; Kai Zheng; Bingguo Liu; Dong Ye; Guodong Liu - [53%] Certified geometric robustness — Super-DeepG
Noémie Cohen; Mélanie Ducoffe; Christophe Gabreau; Claire Pagetti; Xavier Pucel - [52%] Backdoors in RLVR: Jailbreak Backdoors in LLMs From Verifiable Reward
Weiyang Guo; Zesheng Shi; Zeen Zhu; Yuan Zhou; Min Zhang; Jing Li - [52%] CCAR: Intrinsic Robustness as an Emergent Geometric Property
Akash Samanta; Manish Pratap Singh; Debasis Chaudhuri - [52%] On the Properties of Feature Attribution for Supervised Contrastive Learning
Leonardo Arrighi; Julia Eva Belloni; Aurélie Gallet; Ivan Gentile; Matteo Lippi; Marco Zullich - [51%] Robust Multimodal Safety via Conditional Decoding
Anurag Kumar; Raghuveer Peri; Jon Burnsky; Alexandru Nelus; Rohit Paturi; Srikanth Vishnubhotla; Yanjun Qi - [51%] Enhancing REST API Fuzzing with Access Policy Violation Checks and Injection Attacks
Omur Sahin; Man Zhang; Andrea Arcuri - [51%] Enhancing Gradient Inversion Attacks in Federated Learning via Hierarchical Feature Optimization
Hao Fang; Wenbo Yu; Bin Chen; Xuan Wang; Shu-Tao Xia; Qing Liao; Ke Xu - [51%] PoInit-of-View: Poisoning Initialization of Views Transfers Across Multiple 3D Reconstruction Systems
Weijie Wang; Songlong Xing; Zhengyu Zhao; Nicu Sebe; Bruno Lepri - [51%] Generating Synthetic Malware Samples Using Generative AI
Tiffany Bao; Kylie Trousil; Quang Duy Tran; Fabio Di Troia; Younghee Park - [51%] Detecting Avalanche Effect in Adversarial Settings: Spotting the Encryption Loops in Ransomware
Nanqing Luo; Xusheng Li; Haizhou Wang; Shuangyi Zhu; Yuan Ma; Peng Liu - [50%] Jailbreaking Large Language Models with Morality Attacks
Ying Su; Mingen Zheng; Weili Diao; Haoran Li - [50%] TrEEStealer: Stealing Decision Trees via Enclave Side Channels
Jonas Sander; Anja Rabich; Nick Mahling; Felix Maurer; Jonah Heller; Qifan Wang; Thomas Eisenbarth; David Oswald - [50%] Membership Inference Attacks Against Video Large Language Models
Wei Song; Yuxin Cao; Ziqi Ding; Yi Liu; Gelei Deng; Yuekang Li - [50%] Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry
Wenhao Lan; Shan Li; Xinhua Lai; Meiqi Wu; Junbin Yang; Haihua Shen; Yijun Yang - [49%] Learning Without Adversarial Training: A Physics-Informed Neural Network for Secure Power System State Estimation under False Data Injection Attacks
Solon Falas; Markos Asprou; Charalambos Konstantinou; Maria K. Michael - [49%] SecureAFL: Secure Asynchronous Federated Learning
Anjun Gao; Feng Wang; Zhenglin Wan; Yueyang Quan; Zhuqing Liu; Minghong Fang - [49%] VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts
Peigui Qi; Kunsheng Tang; Yanpu Yu; Jialin Wu; Yide Song; Wenbo Zhou; Zhicong Huang; Cheng Hong; Weiming Zhang; Nenghai Yu - [49%] Steered LLM Activations are Non-Surjective
Aayush Mishra; Daniel Khashabi; Anqi Liu - [49%] Supervised Learning Has a Necessary Geometric Blind Spot: Theory, Consequences, and Minimal Repair
Vishal Rajput - [48%] Convergence of Byzantine-Resilient Gradient Tracking via Probabilistic Edge Dropout
Amirhossein Dezhboro; Fateme Maleki; Arman Adibi; Erfan Amini; Jose E. Ramirez-Marquez - [48%] Robust Semi-Supervised Temporal Intrusion Detection for Adversarial Cloud Networks
Anasuya Chattopadhyay; Daniel Reti; Hans D. Schotten - [48%] MetaCloak-JPEG: JPEG-Robust Adversarial Perturbation for Preventing Unauthorized DreamBooth-Based Deepfake Generation
Tanjim Rahaman Fardin; S M Zunaid Alam; Mahadi Hasan Fahim; Md Faysal Mahfuz - [48%] Semantic Denial of Service in LLM-controlled robots
Jonathan Steinberg; Oren Gal - [47%] CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion
Akshit Jindal; Saket Anand; Chetan Arora; Vikram Goyal - [47%] PlanGuard: Defending Agents against Indirect Prompt Injection via Planning-based Consistency Verification
Guangyu Gong; Zizhuang Deng - [47%] Robust Adversarial Policy Optimization Under Dynamics Uncertainty
Mintae Kim; Koushil Sreenath - [47%] RLSpoofer: A Lightweight Evaluator for LLM Watermark Spoofing Resilience
Hanbo Huang; Xuan Gong; Yiran Zhang; Hao Zheng; Shiyu Liang - [47%] Temporal UI State Inconsistency in Desktop GUI Agents: Formalizing and Defending Against TOCTOU Attacks on Computer-Use Agents
Wenpeng Xu - [47%] Adaptive Defense Orchestration for RAG: A Sentinel-Strategist Architecture against Multi-Vector Attacks
Pranav Pallerla; Wilson Naik Bhukya; Bharath Vemula; Charan Ramtej Kodi - [47%] Training a General Purpose Automated Red Teaming Model
Aishwarya Padmakumar; Leon Derczynski; Traian Rebedea; Christopher Parisien - [46%] QUEST: A robust attention formulation using query-modulated spherical attention
Hariprasath Govindarajan; Per Sidén; Jacob Roll; Fredrik Lindsten - [46%] Poison Once, Exploit Forever: Environment-Injected Memory Poisoning Attacks on Web Agents
Wei Zou; Mingwen Dong; Miguel Romero Calvo; Shuaichen Chang; Jiang Guo; Dongkyu Lee; Xing Niu; Xiaofei Ma; Yanjun Qi; Jiarong Jiang - [46%] DuCodeMark: Dual-Purpose Code Dataset Watermarking via Style-Aware Watermark-Poison Design
Yuchen Chen; Yuan Xiao; Chunrong Fang; Zhenyu Chen; Baowen Xu - [46%] QUACK! Making the (Rubber) Ducky Talk: A Systematic Study of Keystroke Dynamics for HID Injection Detection
Alessandro Lotto; Francesco Marchiori; Mauro Conti - [45%] Synthetic Trust Attacks: Modeling How Generative AI Manipulates Human Decisions in Social Engineering Fraud
Muhammad Tahir Ashraf - [45%] SentinelAgent: Intent-Verified Delegation Chains for Securing Federal Multi-Agent AI Systems
KrishnaSaiReddy Patil - [45%] On the Robustness of LLM-Based Dense Retrievers: A Systematic Analysis of Generalizability and Stability
Yongkang Li; Panagiotis Eustratiadis; Yixing Fan; Evangelos Kanoulas - [45%] The Cost of Relaxation: Evaluating the Error in Convex Neural Network Verification
Merkouris Papamichail; Konstantinos Varsos; Giorgos Flouris; João Marques-Silva - [45%] If you're waiting for a sign… that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems
Jiamin Chang; Minhui Xue; Ruoxi Sun; Shuchao Pang; Salil S. Kanhere; Hammond Pearce - [45%] Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models
Yannis Belkhiter; Giulio Zizzo; Sergio Maffeis; Seshu Tirupathi; John D. Kelleher - [45%] PermaFrost-Attack: Stealth Pretraining Seeding(SPS) for planting Logic Landmines During LLM Training
Harsh Kumar; Rahul Maity; Tanmay Joshi; Aman Chadha; Vinija Jain; Suranjana Trivedy; Amitava Das - [45%] CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning
Shuxu Chen; Yitian Zhou; Jiaquan Zhang; Haoyu Bian; Wenrui Hu; Aming Wu; Sungyoung Lee; Chaoning Zhang; Hyundong Shin - [44%] AgentGuard: A Multi-Agent Framework for Robust Package Confusion Detection via Hybrid Search and Metadata-Content Fusion
Yu Li; Wei Ma; Zhi Chen; Ye Liu; Lingxiao Jiang; Junyi Tao; Hao Liu; Yongqiang Lyu; Qiang Hu - [44%] Preventing overfitting in deep learning using differential privacy
Alizishaan Anwar Hussein Khatri - [44%] Mitigating Reward Hacking in RLHF via Advantage Sign Robustness
Shinnosuke Ono; Johannes Ackermann; Soichiro Nishimori; Takashi Ishida; Masashi Sugiyama - [44%] Invisible Adversaries: A Systematic Study of Session Manipulation Attacks on VPNs
Yuxiang Yang; Ao Wang; Xuewei Feng; Qi Li; Ke Xu - [44%] Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection
Zedian Shao; Hongbin Liu; Yuepeng Hu; Neil Zhenqiang Gong - [44%] Compiling Activation Steering into Weights via Null-Space Constraints for Stealthy Backdoors
Rui Yin; Tianxu Han; Naen Xu; Changjiang Li; Ping He; Chunyi Zhou; Jun Wang; Zhihui Fu; Tianyu Du; Jinbao Li; Shouling Ji - [44%] Security and Resilience in Autonomous Vehicles: A Proactive Design Approach
Chieh Tsai; Murad Mehrab Abrar; Salim Hariri - [44%] Black-Box Skill Stealing Attack from Proprietary LLM Agents: An Empirical Study
Zihan Wang; Rui Zhang; Yu Liu; Chi Liu; Qingchuan Zhao; Hongwei Li; Guowen Xu - [43%] A Systematic Study of Cross-Modal Typographic Attacks on Audio-Visual Reasoning
Tianle Chen; Deepti Ghadiyaram - [43%] Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition
Abu Noman Md Sakib; Zhensen Wang; Merjulah Roby; Zijie Zhang - [43%] Latent Instruction Representation Alignment: defending against jailbreaks, backdoors and undesired knowledge in LLMs
Eric Easley; Sebastian Farquhar - [43%] CoLA: A Choice Leakage Attack Framework to Expose Privacy Risks in Subset Training
Qi Li; Cheng-Long Wang; Yinzhi Cao; Di Wang - [43%] Data-driven Reachable Set Estimation with Tunable Adversarial and Wasserstein Distributional Guarantees
Georgios Pantazis; Michelle S. Chong - [43%] Evaluation of Prompt Injection Defenses in Large Language Models
Priyal Deep; Shane Emmons; Amy Fox; Kyle Bacon; Kelley McAllister; Peter Ortiz; Krisztian Flautner - [42%] One Word at a Time: Incremental Completion Decomposition Breaks LLM Safety
Samee Arif; Naihao Deng; Zhijing Jin; Rada Mihalcea - [42%] Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming
Baoshun Tong; Haoran He; Ling Pan; Yang Liu; Liang Lin - [42%] MetaErr: Towards Predicting Error Patterns in Deep Neural Networks
Varun Totakura; Shayok Chakraborty - [42%] Quantum-Inspired Robust and Scalable SAR Object Classification
Maximilian Scharf; Marco Trenti; Felix Bock; Padraig Davidson; Tobias Brosch; Benjamin Rodrigues de Miranda; Sigurd Huber; Timo Felser - [41%] Hijacking online reviews: sparse manipulation and behavioral buffering in popularity-biased rating systems
Itsuki Fujisaki; Kunhao Yang - [41%] Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models
Arth Singh - [41%] FlowHijack: A Dynamics-Aware Backdoor Attack on Flow-Matching Vision-Language-Action Models
Xinyuan An; Tao Luo; Gengyun Peng; Yaobing Wang; Kui Ren; Dongxia Wang - [41%] AEGIS: Adversarial Entropy-Guided Immune System — Thermodynamic State Space Models for Zero-Day Network Evasion Detection
Vickson Ferrel - [41%] Safety, Security, and Cognitive Risks in State-Space Models: A Systematic Threat Analysis with Spectral, Stateful, and Capacity Attacks
Manoj Parmar - [41%] Conflicts Make Large Reasoning Models Vulnerable to Attacks
Honghao Liu; Chengjin Xu; Xuhui Jiang; Cehao Yang; Shengming Yin; Zhengwu Ma; Lionel Ni; Jian Guo - [41%] AgentVisor: Defending LLM Agents Against Prompt Injection via Semantic Virtualization
Zonghao Ying; Haozheng Wang; Jiangfan Liu; Quanchen Zou; Aishan Liu; Jian Yang; Yaodong Yang; Xianglong Liu - [40%] Convolutional Neural Network and Adversarial Autoencoder in EEG images classification
Albert Nasybullin; Semen Kurkin - [40%] Dynamic Free-Rider Detection in Federated Learning via Simulated Attack Patterns
Motoki Nakamura - [40%] Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions
Yuming Xu; Mingtao Zhang; Zhuohan Ge; Haoyang Li; Nicole Hu; Yongqi Zhang; Zhiyuan Wen; Jason Chen Zhang; Qing Li; Lei Chen - [40%] Robust Explanations for User Trust in Enterprise NLP Systems
Guilin Zhang; Kai Zhao; Jeffrey Friedman; Xu Chu; Amine Anoun; Jerry Ting - [40%] Optimistic Policy Learning under Pessimistic Adversaries with Regret and Violation Guarantees
Sourav Ganguly; Kartik Pandit; Arnob Ghosh - [40%] Visual Inception: Compromising Long-term Planning in Agentic Recommenders via Multimodal Memory Poisoning
Jiachen Qian
2026-03 (248 papers)
- [100%] Enhancing Network Intrusion Detection Systems: A Multi-Layer Ensemble Approach to Mitigate Adversarial Attacks
Nasim Soltani; Shayan Nejadshamsi; Zakaria Abou El Houda; Raphael Khoury; Kelton A. P. Costa; Tiago H. Falk; Anderson R. Avila - [100%] Contract And Conquer: How to Provably Compute Adversarial Examples for a Black-Box Model?
Anna Chistyakova; Mikhail Pautov - [99%] Explanation-Guided Adversarial Training for Robust and Interpretable Models
Chao Chen; Yanhui Chen; Shanshan Lin; Dongsheng Hong; Shu Wu; Xiangwen Liao; Chuanyi Liu - [99%] Solving adversarial examples requires solving exponential misalignment
Alessandro Salvatore; Stanislav Fort; Surya Ganguli - [99%] Hide and Find: A Distributed Adversarial Attack on Federated Graph Learning
Jinshan Liu; Ken Li; Jiazhe Wei; Bin Shi; Bo Dong - [99%] Evaluating randomized smoothing as a defense against adversarial attacks in trajectory prediction
Julian F. Schumann; Eduardo Figueiredo; Frederik Baymler Mathiesen; Luca Laurenti; Jens Kober; Arkady Zgonnikov - [99%] RTD-Guard: A Black-Box Textual Adversarial Detection Framework via Replacement Token Detection
He Zhu; Yanshu Li; Wen Liu; Haitian Yang - [99%] Over-the-air White-box Attack on the Wav2Vec Speech Recognition Neural Network
Protopopov Alexey - [99%] Adversarial Attacks on Locally Private Graph Neural Networks
Matta Varun; Ajay Kumar Dhakar; Yuan Hong; Shamik Sural - [99%] OmniPatch: A Universal Adversarial Patch for ViT-CNN Cross-Architecture Transfer in Semantic Segmentation
Aarush Aggarwal; Akshat Tomar; Amritanshu Tiwari; Sargam Goyal - [99%] Attack Assessment and Augmented Identity Recognition for Human Skeleton Data
Joseph G. Zalameda; Megan A. Witherow; Alexander M. Glandon; Jose Aguilera; Khan M. Iftekharuddin - [99%] Efficient Preemptive Robustification with Image Sharpening
Jiaming Liang; Chi-Man Pun - [99%] NERO-Net: A Neuroevolutionary Approach for the Design of Adversarially Robust CNNs
Inês Valentim; Nuno Antunes; Nuno Lourenço - [99%] Detection of Adversarial Attacks in Robotic Perception
Ziad Sharawy; Mohammad Nakshbandi; Sorin Mihai Grigorescu - [98%] Towards Highly Transferable Vision-Language Attack via Semantic-Augmented Dynamic Contrastive Interaction
Yuanbo Li; Tianyang Xu; Cong Hu; Tao Zhou; Xiao-Jun Wu; Josef Kittler - [98%] NetDiffuser: Deceiving DNN-Based Network Attack Detection Systems with Diffusion-Generated Adversarial Traffic
Pratyay Kumar; Abu Saleh Md Tayeen; Satyajayant Misra; Huiping Cao; Jiefei Liu; Qixu Gong; Jayashree Harikumar - [98%] CAMA: Exploring Collusive Adversarial Attacks in c-MARL
Men Niu; Xinxin Fan; Quanliang Jing; Shaoye Luo; Yunfeng Lu - [98%] Precision-Varying Prediction (PVP): Robustifying ASR systems against adversarial attacks
Matías Pizarro; Raghavan Narasimhan; Jonas Killian; Asja Fischer - [98%] Claudini: Autoresearch Discovers State-of-the-Art Adversarial Attack Algorithms for LLMs
Alexander Panfilov; Peter Romov; Igor Shilov; Yves-Alexandre de Montjoye; Jonas Geiping; Maksym Andriushchenko - [98%] ROAST: Risk-aware Outlier-exposure for Adversarial Selective Training of Anomaly Detectors Against Evasion Attacks
Mohammed Elnawawy; Gargi Mitra; Shahrear Iqbal; Karthik Pattabiraman - [98%] A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models
Mujtaba Hussain Mirza; Antonio D'Orazio; Odelia Melamed; Iacopo Masi - [98%] Dummy-Aware Weighted Attack (DAWA): Breaking the Safe Sink in Dummy Class Defenses
Yunrui Yu; Xuxiang Feng; Pengda Qin; Pengyang Wang; Kafeng Wang; Cheng-zhong Xu; Hang Su; Jun Zhu - [97%] Analyzing Physical Adversarial Example Threats to Machine Learning in Election Systems
Khaleque Md Aashiq Kamal; Surya Eada; Aayushi Verma; Subek Acharya; Adrian Yemin; Benjamin Fuller; Kaleel Mahmood - [97%] CaptionFool: Universal Image Captioning Model Attacks
Swapnil Parekh - [97%] AMDS: Attack-Aware Multi-Stage Defense System for Network Intrusion Detection with Two-Stage Adaptive Weight Learning
Oluseyi Olukola; Nick Rahimi - [97%] S2O: Enhancing Adversarial Training with Second-Order Statistics of Weights
Gaojie Jin; Xinping Yi; Wei Huang; Sven Schewe; Xiaowei Huang - [97%] In-the-Wild Camouflage Attack on Vehicle Detectors through Controllable Image Editing
Xiao Fang; Yiming Gong; Stanislav Panev; Celso de Melo; Shuowen Hu; Shayok Chakraborty; Fernando De la Torre - [97%] Targeted Adversarial Traffic Generation : Black-box Approach to Evade Intrusion Detection Systems in IoT Networks
Islam Debicha; Tayeb Kenaza; Ishak Charfi; Salah Mosbah; Mehdi Sehaki; Jean-Michel Dricot - [97%] Physical Backdoor Attack Against Deep Learning-Based Modulation Classification
Younes Salmi; Hanna Bogucka - [96%] Lyapunov Stable Graph Neural Flow
Haoyu Chu; Xiaotong Chen; Wei Zhou; Wenjun Cui; Kai Zhao; Shikui Wei; Qiyu Kang - [96%] AI Evasion and Impersonation Attacks on Facial Re-Identification with Activation Map Explanations
Noe Claudel; Weisi Guo; Yang Xing - [96%] REFORGE: Multi-modal Attacks Reveal Vulnerable Concept Unlearning in Image Generation Models
Yong Zou; Haoran Li; Fanxiao Li; Shenyang Wei; Yunyun Dong; Li Tang; Wei Zhou; Renyang Liu - [96%] rSDNet: Unified Robust Neural Learning against Label Noise and Adversarial Attacks
Suryasis Jana; Abhik Ghosh - [96%] From Pixels to Reality: Physical-Digital Patch Attacks on Real-World Camera
Victoria Leonenkova; Ekaterina Shumitskaya; Dmitriy Vatolin; Anastasia Antsiferova - [95%] IU: Imperceptible Universal Backdoor Attack
Hsin Lin; Yan-Lun Chen; Ren-Hung Hwang; Chia-Mu Yu - [95%] Latent Transfer Attack: Adversarial Examples via Generative Latent Spaces
Eitan Shaar; Ariel Shaulov; Yalcin Tur; Gal Chechik; Ravid Shwartz-Ziv - [95%] Comparative Analysis of Patch Attack on VLM-Based Autonomous Driving Architectures
David Fernandez; Pedram MohajerAnsari; Amir Salarpour; Long Cheng; Abolfazl Razi; Mert D. Pesé - [95%] Generative Adversarial Perturbations with Cross-paradigm Transferability on Localized Crowd Counting
Alabi Mehzabin Anisha; Guangjing Wang; Sriram Chellappan - [94%] Identifying Adversary Characteristics from an Observed Attack
Soyon Choi; Scott Alfeld; Meiyi Ma - [94%] RESQ: A Unified Framework for REliability- and Security Enhancement of Quantized Deep Neural Networks
Ali Soltan Mohammadi; Samira Nazari; Ali Azarpeyvand; Mahdi Taheri; Milos Krstic; Michael Huebner; Christian Herglotz; Tara Ghasempouri - [94%] Adversarial attacks against Modern Vision-Language Models
Alejandro Paredes La Torre - [94%] STEP: Detecting Audio Backdoor Attacks via Stability-based Trigger Exposure Profiling
Kun Wang; Meng Chen; Junhao Wang; Yuli Wu; Li Lu; Chong Zhang; Peng Cheng; Jiaheng Zhang; Kui Ren - [94%] PoiCGAN: A Targeted Poisoning Based on Feature-Label Joint Perturbation in Federated Learning
Tao Liu; Jiguang Lv; Dapeng Man; Weiye Xi; Yaole Li; Feiyu Zhao; Kuiming Wang; Yingchao Bian; Chen Xu; Wu Yang - [94%] Knowledge-Guided Adversarial Training for Infrared Object Detection via Thermal Radiation Modeling
Shiji Zhao; Shukun Xiong; Maoxun Yuan; Yao Huang; Ranjie Duan; Qing Guo; Jiansheng Chen; Haibin Duan; Xingxing Wei - [94%] On the Vulnerability of Deep Automatic Modulation Classifiers to Explainable Backdoor Threats
Younes Salmi; Hanna Bogucka - [93%] Learning to Attack: A Bandit Approach to Adversarial Context Poisoning
Ray Telikani; Amir H. Gandomi - [93%] Multi-Paradigm Collaborative Adversarial Attack Against Multi-Modal Large Language Models
Yuanbo Li; Tianyang Xu; Cong Hu; Tao Zhou; Xiao-Jun Wu; Josef Kittler - [93%] STRAP-ViT: Segregated Tokens with Randomized — Transformations for Defense against Adversarial Patches in ViTs
Nandish Chattopadhyay; Anadi Goyal; Chandan Karfa; Anupam Chattopadhyay - [93%] Thermal Topology Collapse: Universal Physical Patch Attacks on Infrared Vision Systems
Chengyin Hu; Yikun Guo; Yuxian Dong; Qike Zhang; Kalibinuer Tiliwalidi; Yiwei Wei; Haitao Shi; Jiujiang Guo; Jiahuan Long; Xiang Chen - [92%] Attack by Unlearning: Unlearning-Induced Adversarial Attacks on Graph Neural Networks
Jiahao Zhang; Yilong Wang; Suhang Wang - [92%] Adversarial Vulnerabilities in Neural Operator Digital Twins: Gradient-Free Attacks on Nuclear Thermal-Hydraulic Surrogates
Samrendra Roy; Kazuma Kobayashi; Souvik Chakraborty; Rizwan-uddin; Syed Bahauddin Alam - [92%] The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models
Shivang Chopra; Shaunak Halbe; Chengyue Huang; Brisa Maneechotesuwan; Zsolt Kira - [92%] InkDrop: Invisible Backdoor Attacks Against Dataset Condensation
He Yang; Dongyi Lv; Song Ma; Wei Xi; Zhi Wang; Hanlin Gu; Yajie Wang - [91%] Poisoning the Inner Prediction Logic of Graph Neural Networks for Clean-Label Backdoor Attacks
Yuxiang Zhang; Bin Ma; Enyan Dai - [91%] Experimental Evaluation of Security Attacks on Self-Driving Car Platforms
Viet K. Nguyen; Nathan Lee; Mohammad Husain - [90%] Diffusion-Based Feature Denoising and Using NNMF for Robust Brain Tumor Classification
Hiba Adil Al-kharsan; Róbert Rajkó - [89%] AdvSplat: Adversarial Attacks on Feed-Forward Gaussian Splatting Models
Yiran Qiao; Yiren Lu; Yunlai Zhou; Rui Yang; Linlin Hou; Yu Yin; Jing Ma - [88%] Mitigating Evasion Attacks in Fog Computing Resource Provisioning Through Proactive Hardening
Younes Salmi; Hanna Bogucka - [88%] EnsembleSHAP: Faithful and Certifiably Robust Attribution for Random Subspace Method
Yanting Wang; Jinyuan Jia - [87%] AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models
Yubo Cui; Xianchao Guan; Zijun Xiong; Zheng Zhang - [86%] Adversarial Patch Generation for Visual-Infrared Dense Prediction Tasks via Joint Position-Color Optimization
He Li; Wenyue He; Weihang Kong; Xingchen Zhang - [86%] What Makes VLMs Robust? Towards Reconciling Robustness and Accuracy in Vision-Language Models
Sen Nie; Jie Zhang; Zhongqi Wang; Zhaoyang Wei; Shiguang Shan; Xilin Chen - [86%] Poisoning the Pixels: Revisiting Backdoor Attacks on Semantic Segmentation
Guangsheng Zhang; Huan Tian; Leo Zhang; Tianqing Zhu; Ming Ding; Wanlei Zhou; Bo Liu - [86%] Adversarial Attacks on Multimodal Large Language Models: A Comprehensive Survey
Bhavuk Jain; Sercan Ö. Arık; Hardeo K. Thakur - [85%] Training for Trustworthy Saliency Maps: Adversarial Training Meets Feature-Map Smoothing
Dipkamal Bhusal; Md Tanvirul Alam; Nidhi Rastogi - [85%] Complementary Text-Guided Attention for Zero-Shot Adversarial Robustness
Lu Yu; Haiyang Zhang; Changsheng Xu - [85%] Adversarial Camouflage
Paweł Borsukiewicz; Daniele Lunghi; Melissa Tessa; Jacques Klein; Tegawendé F. Bissyandé - [84%] Co-Evolutionary Multi-Modal Alignment via Structured Adversarial Evolution
Guoxin Shi; Haoyu Wang; Zaihui Yang; Yuxing Wang; Yongzhe Chang - [84%] Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions
Neha Nagaraja; Lan Zhang; Zhilong Wang; Bo Zhang; Pawan Patil - [84%] RESBev: Making BEV Perception More Robust
Lifeng Zhuo; Kefan Jin; Zhe Liu; Hesheng Wang - [84%] PEANUT: Perturbations by Eigenvector Alignment for Attacking Graph Neural Networks Under Topology-Driven Message Passing
Bhavya Kohli; Biplab Sikdar - [83%] Backdoor Directions in Vision Transformers
Sengim Karayalcin; Marina Krcek; Pin-Yu Chen; Stjepan Picek - [83%] PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses
Chenlong Yin; Runpeng Geng; Yanting Wang; Jinyuan Jia - [83%] Is Monitoring Enough? Strategic Agent Selection For Stealthy Attack in Multi-Agent Discussions
Qiuchi Xiang; Haoxuan Qu; Hossein Rahmani; Jun Liu - [83%] PIDP-Attack: Combining Prompt Injection with Database Poisoning Attacks on Retrieval-Augmented Generation Systems
Haozhen Wang; Haoyue Liu; Jionghao Zhu; Zhichao Wang; Yongxin Guo; Xiaoying Tang - [83%] Robust Multi-Agent Reinforcement Learning for Small UAS Separation Assurance under GPS Degradation and Spoofing
Alex Zongo; Filippos Fotiadis; Ufuk Topcu; Peng Wei - [82%] SNEAKDOOR: Stealthy Backdoor Attacks against Distribution Matching-based Dataset Condensation
He Yang; Dongyi Lv; Song Ma; Wei Xi; Jizhong Zhao - [81%] Beyond the Patch: Exploring Vulnerabilities of Visuomotor Policies via Viewpoint-Consistent 3D Adversarial Object
Chanmi Lee; Minsung Yoon; Woojae Kim; Sebin Lee; Sung-eui Yoon - [81%] Why the Maximum Second Derivative of Activations Matters for Adversarial Robustness
Yunrui Yu; Hang Su; Jun Zhu - [81%] ARTA: Adversarial-Robust Multivariate Time–Series Anomaly Detection via Sparsity-Constrained Perturbations
Hadi Hojjati; Narges Armanfard - [80%] Shapes are not enough: CONSERVAttack and its use for finding vulnerabilities and uncertainties in machine learning applications
Philip Bechtle; Lucie Flek; Philipp Alexander Jung; Akbar Karimi; Timo Saala; Alexander Schmidt; Matthias Schott; Philipp Soldin; Christopher Wiebusch; Ulrich Willemsen - [80%] Can LLMs Fool Graph Learning? Exploring Universal Adversarial Attacks on Text-Attributed Graphs
Zihui Chen; Yuling Wang; Pengfei Jiao; Kai Wu; Xiao Wang; Xiang Ao; Dalin Zhang - [80%] Statistical Guarantees for Distributionally Robust Optimization with Optimal Transport and OT-Regularized Divergences
Jeremiah Birrell; Xiaoxi Shen - [80%] Beyond Corner Patches: Semantics-Aware Backdoor Attack in Federated Learning
Kavindu Herath; Joshua Zhao; Saurabh Bagchi - [79%] XSPA: Crafting Imperceptible X-Shaped Sparse Adversarial Perturbations for Transferable Attacks on VLMs
Chengyin Hu; Jiaju Han; Xuemeng Sun; Qike Zhang; Yiwei Wei; Ang Li; Chunlei Meng; Xiang Chen; Jiahuan Long - [78%] A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness
Leo Schwinn; Moritz Ladenburger; Tim Beyer; Mehrnaz Mofakhami; Gauthier Gidel; Stephan Günnemann - [78%] BadLLM-TG: A Backdoor Defender powered by LLM Trigger Generator
Ruyi Zhang; Heng Gao; Songlei Jian; Yusong Tan; Haifang Zhou - [78%] ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving
Tong Nie; Yihong Tang; Junlin He; Yuewen Mei; Jie Sun; Lijun Sun; Wei Ma; Jian Sun - [77%] Reward Under Attack: Analyzing the Robustness and Hackability of Process Reward Models
Rishabh Tiwari; Aditya Tomar; Udbhav Bamba; Monishwaran Maheswaran; Heng Yang; Michael W. Mahoney; Kurt Keutzer; Amir Gholami - [77%] FL-PBM: Pre-Training Backdoor Mitigation for Federated Learning
Osama Wehbi; Sarhad Arisdakessian; Omar Abdel Wahab; Azzam Mourad; Hadi Otrok; Jamal Bentahar - [76%] ROKA: Robust Knowledge Unlearning against Adversaries
Jinmyeong Shin; Joshua Tapia; Nicholas Ferreira; Gabriel Diaz; Moayed Daneshyari; Hyeran Jeon - [75%] Benchmarking the Energy Cost of Assurance in Neuromorphic Edge Robotics
Sylvester Kaczmarek - [75%] Directional Embedding Smoothing for Robust Vision Language Models
Ye Wang; Jing Liu; Toshiaki Koike-Akino - [75%] Fingerprinting Deep Neural Networks for Ownership Protection: An Analytical Approach
Guang Yang; Ziye Geng; Yihang Chen; Changqing Luo - [74%] RAIN: Secure and Robust Aggregation under Shuffle Model of Differential Privacy
Yuhang Li; Yajie Wang; Xiangyun Tang; Peng Jiang; Yu-an Tan; Liehuang Zhu - [74%] Invisible Threats from Model Context Protocol: Generating Stealthy Injection Payload via Tree-based Adaptive Search
Yulin Shen; Xudong Pan; Geng Hong; Min Yang - [74%] Uncovering Memorization in Timeseries Imputation models: LBRM Membership Inference and its link to attribute Leakage
Faiz Taleb; Ivan Gazeau; Maryline Laurent - [73%] When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG
Junchen Li; Chao Qi; Rongzheng Wang; Qizhi Chen; Liang Xu; Di Liang; Bob Simons; Shuang Liang - [73%] Dynamic Meta-Layer Aggregation for Byzantine-Robust Federated Learning
Reek Das; Biplab Kanti Sen - [73%] SLAM Adversarial Lab: An Extensible Framework for Visual SLAM Robustness Evaluation under Adverse Conditions
Mohamed Hefny; Karthik Dantu; Steven Y. Ko - [73%] Adversarial Prompt Injection Attack on Multimodal Large Language Models
Meiwen Ding; Song Xia; Chenqi Kong; Xudong Jiang - [72%] Mathematical Foundations of Poisoning Attacks on Linear Regression over Cumulative Distribution Functions
Atsuki Sato; Martin Aumüller; Yusuke Matsui - [72%] How Vulnerable Are AI Agents to Indirect Prompt Injections? Insights from a Large-Scale Public Competition
Mateusz Dziemian; Maxwell Lin; Xiaohan Fu; Micha Nowak; Nick Winter; Eliot Jones; Andy Zou; Lama Ahmad; Kamalika Chaudhuri; Sahana Chennabasappa; Xander Davies; Lauren Deason; Benjamin L. Edelman; Tanner Emek; Ivan Evtimov; Jim Gust; Maia Hamin; Kat He; Klaudia Krawiecka; Riccardo Patana; Neil Perry; Troy Peterson; Xiangyu Qi; Javier Rando; Zifan Wang; Zihan Wang; Spencer Whitman; Eric Winsor; Arman Zharmagambetov; Matt Fredrikson; Zico Kolter - [71%] DSBA: Dynamic Stealthy Backdoor Attack with Collaborative Optimization in Self-Supervised Learning
Jiayao Wang; Mohammad Maruf Hasan; Yiping Zhang; Xiaoying Lei; Jiale Zhang; Qilin Wu; Junwu Zhu; Dongfang Zhao - [71%] Structure-Aware Distributed Backdoor Attacks in Federated Learning
Wang Jian; Shen Hong; Ke Wei; Liu Xue Hua - [71%] FedTrident: Resilient Road Condition Classification Against Poisoning Attacks in Federated Learning
Sheng Liu; Panos Papadimitratos - [71%] Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning
Bilgehan Sel; Xuanli He; Alwin Peng; Ming Jin; Jerry Wei - [70%] Adversarial Reinforcement Learning for Detecting False Data Injection Attacks in Vehicular Routing
Taha Eghtesad; Yevgeniy Vorobeychik; Aron Laszka - [70%] Noise-Aware Misclassification Attack Detection in Collaborative DNN Inference
Shima Yousefi; Saptarshi Debroy - [70%] Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination
Dong-Xiao Zhang; Hu Lou; Jun-Jie Zhang; Jun Zhu; Deyu Meng - [70%] Are LLM-Enhanced Graph Neural Networks Robust against Poisoning Attacks?
Yuhang Ma; Jie Wang; Zheng Yan - [69%] Analyzing the Impact of Adversarial Attacks on C-V2X-Enabled Road Safety: An Age of Information Perspective
Mahmudul Hassan Ashik; Moinul Hossain - [69%] Delayed Backdoor Attacks: Exploring the Temporal Dimension as a New Attack Surface in Pre-Trained Models
Zikang Ding; Haomiao Yang; Meng Hao; Wenbo Jiang; Kunlan Xiang; Runmeng Du; Yijing Liu; Ruichen Zhang; Dusit Niyato - [69%] CtrlAttack: A Unified Attack on World-Model Control in Diffusion Models
Shuhan Xu; Siyuan Liang; Hongling Zheng; Yong Luo; Han Hu; Lefei Zhang; Dacheng Tao - [69%] The Autonomy Tax: Defense Training Breaks LLM Agents
Shawn Li; Yue Zhao - [69%] Graph-Aware Stealthy Poison-Text Backdoors for Text-Attributed Graphs
Qi Luo; Minghui Xu; Dongxiao Yu; Xiuzhen Cheng - [69%] Diffusion-Based Feature Denoising with NNMF for Robust handwritten digit multi-class classification
Hiba Adil Al-kharsan; Róbert Rajkó - [68%] Inevitable Encounters: Backdoor Attacks Involving Lossy Compression
Qian Li; Yunuo Chen; Yuntian Chen - [68%] When Minor Edits Matter: LLM-Driven Prompt Attack for Medical VLM Robustness in Ultrasound
Yasamin Medghalchi; Milad Yazdani; Amirhossein Dabiriaghdam; Moein Heidari; Mojan Izadkhah; Zahra Kavian; Giuseppe Carenini; Lele Wang; Dena Shahriari; Ilker Hacihaliloglu - [66%] Test-Time Attention Purification for Backdoored Large Vision Language Models
Zhifang Zhang; Bojun Yang; Shuo He; Weitong Chen; Wei Emma Zhang; Olaf Maennel; Lei Feng; Miao Xu - [66%] CivicShield: A Cross-Domain Defense-in-Depth Framework for Securing Government-Facing AI Chatbots Against Multi-Turn Adversarial Attacks
KrishnaSaiReddy Patil - [65%] Hidden in the Metadata: Stealth Poisoning Attacks on Multimodal Retrieval-Augmented Generation
Kennedy Edemacu; Mohammad Mahdi Shokri - [65%] Scores Know Bobs Voice: Speaker Impersonation Attack
Chanwoo Hwang; Sunpill Kim; Yong Kiam Tan; Tianchi Liu; Seunghun Paik; Dongsoo Kim; Mondal Soumik; Khin Mi Mi Aung; Jae Hong Seo - [65%] TRAP: Hijacking VLA CoT-Reasoning via Adversarial Patches
Zhengxian Huang; Wenjun Zhu; Haoxuan Qiu; Xiaoyu Ji; Wenyuan Xu - [65%] IrisFP: Adversarial-Example-based Model Fingerprinting with Enhanced Uniqueness and Robustness
Ziye Geng; Guang Yang; Yihang Chen; Changqing Luo - [64%] Physical Evaluation of Naturalistic Adversarial Patches for Camera-Based Traffic-Sign Detection
Brianna D'Urso; Tahmid Hasan Sakib; Syed Rafay Hasan; Terry N. Guo - [64%] TAO-Attack: Toward Advanced Optimization-Based Jailbreak Attacks for Large Language Models
Zhi Xu; Jiaqi Li; Xiaotong Zhang; Hong Yu; Han Liu - [64%] Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems
Scott Thornton - [64%] Perturbation: A simple and efficient adversarial tracer for representation learning in language models
Joshua Rozner; Cory Shain - [63%] Dual-Modality Multi-Stage Adversarial Safety Training: Robustifying Multimodal Web Agents Against Cross-Modal Attacks
Haoyu Liu; Dingcheng Li; Lukas Rutishauser; Zeyu Zheng - [63%] TASER: Task-Aware Spectral Energy Refine for Backdoor Suppression in UAV Swarms Decentralized Federated Learning
Sizhe Huang; Shujie Yang - [63%] Removing the Trigger, Not the Backdoor: Alternative Triggers and Latent Backdoors
Gorka Abad; Ermes Franch; Stefanos Koffas; Stjepan Picek - [63%] Principled Steering via Null-space Projection for Jailbreak Defense in Vision-Language Models
Xingyu Zhu; Beier Zhu; Shuo Wang; Junfeng Fang; Kesen Zhao; Hanwang Zhang; Xiangnan He - [62%] On Optimizing Multimodal Jailbreaks for Spoken Language Models
Aravind Krishnan; Karolina Stańczak; Dietrich Klakow - [62%] Cyber Deception for Mission Surveillance via Hypergame-Theoretic Deep Reinforcement Learning
Zelin Wan; Jin-Hee Cho; Mu Zhu; Ahmed H. Anwar; Charles Kamhoua; Munindar P. Singh - [62%] DTVI: Dual-Stage Textual and Visual Intervention for Safe Text-to-Image Generation
Binhong Tan; Zhaoxin Wang; Handing Wang - [62%] ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning
Xiangyu Yin; Yi Qi; Chih-Hong Cheng - [61%] Detecting Data Poisoning in Code Generation LLMs via Black-Box, Vulnerability-Oriented Scanning
Shenao Yan; Shimaa Ahmed; Shan Jin; Sunpreet S. Arora; Yiwei Cai; Yizhen Wang; Yuan Hong - [60%] ThreatFormer-IDS: Robust Transformer Intrusion Detection with Zero-Day Generalization and Explainable Attribution
Srikumar Nayak - [60%] Blockchain Communication Vulnerabilities
Andrei Lebedev; Vincent Gramoli - [60%] Detection of adversarial intent in Human-AI teams using LLMs
Abed K. Musaffar; Ambuj Singh; Francesco Bullo - [59%] Exact and Asymptotically Complete Robust Verifications of Neural Networks via Ising Solvers
Wenxin Li; Wenchao Liu; Weihao Li; Chuan Wang; Qi Gao; Yin Ma; Hai Wei; Kai Wen - [59%] Understanding and Mitigating Dataset Corruption in LLM Steering
Cullen Anderson; Narmeen Oozeer; Foad Namjoo; Remy Ogasawara; Amirali Abdullah; Jeff M. Phillips - [59%] Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover
Indranil Halder; Annesya Banerjee; Cengiz Pehlevan - [58%] FAME: Formal Abstract Minimal Explanation for Neural Networks
Ryma Boumazouza; Raya Elsaleh; Melanie Ducoffe; Shahaf Bassan; Guy Katz - [58%] Colluding LoRA: A Compositional Vulnerability in LLM Safety Alignment
Sihao Ding - [58%] Towards Unsupervised Adversarial Document Detection in Retrieval Augmented Generation Systems
Patrick Levi - [58%] Cyber-Resilient Digital Twins: Discriminating Attacks for Safe Critical Infrastructure Control
Mohammadhossein Homaei; Iman Khazrak; Rubén Molano; Andrés Caro; Mar Ávila - [57%] From Shallow to Deep: Pinning Semantic Intent via Causal GRPO
Shuyi Zhou; Zeen Song; Wenwen Qiang; Jiyan Sun; Yao Zhou; Yinlong Liu; Wei Ma - [57%] Guiding Sparse Neural Networks with Neurobiological Principles to Elicit Biologically Plausible Representations
Patrick Inoue; Florian Röhrbein; Andreas Knoblauch - [57%] KEPo: Knowledge Evolution Poison on Graph-based Retrieval-Augmented Generation
Qizhi Chen; Chao Qi; Yihong Huang; Muquan Li; Rongzheng Wang; Dongyang Zhang; Ke Qin; Shuang Liang - [57%] Towards Secure Retrieval-Augmented Generation: A Comprehensive Review of Threats, Defenses and Benchmarks
Yanming Mu; Hao Hu; Feiyang Li; Qiao Yuan; Jiang Wu; Zichuan Liu; Pengcheng Liu; Mei Wang; Hongwei Zhou; Yuling Liu - [57%] A Unified Spatial Alignment Framework for Highly Transferable Transformation-Based Attacks on Spatially Structured Tasks
Jiaming Liang; Chi-Man Pun - [56%] BadRSSD: Backdoor Attacks on Regularized Self-Supervised Diffusion Models
Jiayao Wang; Yiping Zhang; Mohammad Maruf Hasan; Xiaoying Lei; Jiale Zhang; Junwu Zhu; Qilin Wu; Dongfang Zhao - [56%] Margin and Consistency Supervision for Calibrated and Robust Vision Models
Salim Khazem - [56%] Mitigating Backdoor Attacks in Federated Learning Using PPA and MiniMax Game Theory
Osama Wehbi; Sarhad Arisdakessian; Omar Abdel Wahab; Anderson Avila; Azzam Mourad; Hadi Otrok - [56%] Emotion Diffusion Classifier with Adaptive Margin Discrepancy Training for Facial Expression Recognition
Rongkang Dong; Cuixin Yang; Cong Zhang; Yushen Zuo; Kin-Man Lam - [55%] Silent Sabotage During Fine-Tuning: Few-Shot Rationale Poisoning of Compact Medical LLMs
Jingyuan Xie; Wenjie Wang; Ji Wu; Jiandong Gao - [55%] SRasP: Self-Reorientation Adversarial Style Perturbation for Cross-Domain Few-Shot Learning
Wenqian Li; Pengfei Fang; Hui Xue - [55%] BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation
Feiran Li; Qianqian Xu; Shilong Bao; Zhiyong Yang; Xilin Zhao; Xiaochun Cao; Qingming Huang - [55%] Unveiling the Security Risks of Federated Learning in the Wild: From Research to Practice
Jiahao Chen; Zhiming Zhao; Yuwen Pu; Chunyi Zhou; Zhou Feng; Songze Li; Shouling Ji - [54%] Differential Privacy in Two-Layer Networks: How DP-SGD Harms Fairness and Robustness
Ruichen Xu; Kexin Chen - [54%] Lipschitz-Based Robustness Certification Under Floating-Point Execution
Toby Murray - [54%] All Vehicles Can Lie: Efficient Adversarial Defense in Fully Untrusted-Vehicle Collaborative Perception via Pseudo-Random Bayesian Inference
Yi Yu; Libing Wu; Zhuangzhuang Zhang; Jing Qiu; Lijuan Huo; Jiaqi Feng - [54%] Rotated Robustness: A Training-Free Defense against Bit-Flip Attacks on Large Language Models
Deng Liu; Song Chen - [54%] R-PGA: Robust Physical Adversarial Camouflage Generation via Relightable 3D Gaussian Splatting
Tianrui Lou; Siyuan Liang; Jiawei Liang; Yuze Gao; Xiaochun Cao - [53%] Detecting and Eliminating Neural Network Backdoors Through Active Paths with Application to Intrusion Detection
Eirik Høyheim; Magnus Wiik Eckhoff; Gudmund Grov; Robert Flood; David Aspinall - [53%] Do Not Leave a Gap: Hallucination-Free Object Concealment in Vision-Language Models
Amira Guesmi; Muhammad Shafique - [52%] Protection against Source Inference Attacks in Federated Learning
Andreas Athanasiou; Kangsoo Jung; Catuscia Palamidessi - [52%] From Decoupled to Coupled: Robustness Verification for Learning-based Keypoint Detection with Joint Specifications
Xusheng Luo; Changliu Liu - [52%] Beyond Passive Aggregation: Active Auditing and Topology-Aware Defense in Decentralized Federated Learning
Sheng Pan; Niansheng Tang - [52%] LipsAM: Lipschitz-Continuous Amplitude Modifier for Audio Signal Processing and its Application to Plug-and-Play Dereverberation
Kazuki Matsumoto; Ren Uchida; Kohei Yatabe - [52%] Anti-I2V: Safeguarding your photos from malicious image-to-video generation
Duc Vu; Anh Nguyen; Chi Tran; Anh Tran - [51%] Sim2Act: Robust Simulation-to-Decision Learning via Adversarial Calibration and Group-Relative Perturbation
Hongyu Cao; Jinghan Zhang; Kunpeng Liu; Dongjie Wang; Feng Xia; Haifeng Chen; Xiaohua Hu; Yanjie Fu - [51%] The System Prompt Is the Attack Surface: How LLM Agent Configuration Shapes Security and Creates Exploitable Vulnerabilities
Ron Litvak - [50%] Visual Exclusivity Attacks: Automatic Multimodal Red Teaming via Agentic Planning
Yunbei Zhang; Yingqiang Ge; Weijie Xu; Yuhui Xu; Jihun Hamm; Chandan K. Reddy - [50%] Why Does It Look There? Structured Explanations for Image Classification
Jiarui Li; Zixiang Yin; Samuel J Landry; Zhengming Ding; Ramgopal R. Mettu - [50%] Probabilistic Verification of Voice Anti-Spoofing Models
Evgeny Kushnir; Alexandr Kozodaev; Dmitrii Korzh; Mikhail Pautov; Oleg Kiriukhin; Oleg Y. Rogov - [50%] Robustness, Cost, and Attack-Surface Concentration in Phishing Detection
Julian Allagan; Mohamed Elbakary; Zohreh Safari; Weizheng Gao; Gabrielle Morgan; Essence Morgan; Vladimir Deriglazov - [50%] Design and Development of an ML/DL Attack Resistance of RC-Based PUF for IoT Security
Joy Acharya; Smit Patel; Paawan Sharma; Mohendra Roy - [49%] Amnesia: Adversarial Semantic Layer Specific Activation Steering in Large Language Models
Ali Raza; Gurang Gupta; Nikolay Matyunin; Jibesh Patra - [49%] GroupGuard: A Framework for Modeling and Defending Collusive Attacks in Multi-Agent Systems
Yiling Tao; Xinran Zheng; Shuo Yang; Meiling Tao; Xingjun Wang - [49%] H-Node Attack and Defense in Large Language Models
Eric Yocam; Varghese Vaidyan; Yong Wang - [49%] HSFM: Hard-Set-Guided Feature-Space Meta-Learning for Robust Classification under Spurious Correlations
Aryan Yazdan Parast; Khawar Islam; Soyoun Won; Basim Azam; Naveed Akhtar - [48%] On the Rate of Convergence of GD in Non-linear Neural Networks: An Adversarial Robustness Perspective
Guy Smorodinsky; Sveta Gimpleson; Itay Safran - [48%] TraceGuard: Process-Guided Firewall against Reasoning Backdoors in Large Language Models
Zhen Guo; Shanghao Shi; Hao Li; Shamim Yazdani; Ning Zhang; Reza Tourani - [48%] Adversarial Batch Representation Augmentation for Batch Correction in High-Content Cellular Screening
Lei Tong; Xujing Yao; Adam Corrigan; Long Chen; Navin Rathna Kumar; Kerry Hallbrook; Jonathan Orme; Yinhai Wang; Huiyu Zhou - [48%] Taming the Adversary: Stable Minimax Deep Deterministic Policy Gradient via Fractional Objectives
Taeho Lee; Donghwan Lee - [48%] The Cognitive Firewall:Securing Browser Based AI Agents Against Indirect Prompt Injection Via Hybrid Edge Cloud Defense
Qianlong Lan; Anuj Kaul - [48%] Adversarial Bandit Optimization with Globally Bounded Perturbations to Linear Losses
Zhuoyu Cheng; Kohei Hatano; Eiji Takimoto - [47%] DualSentinel: A Lightweight Framework for Detecting Targeted Attacks in Black-box LLM via Dual Entropy Lull Pattern
Xiaoyi Pang; Xuanyi Hao; Pengyu Liu; Qi Luo; Song Guo; Zhibo Wang - [47%] Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads
Jinman Wu; Yi Xie; Shiqian Zhao; Xiaofeng Chen - [47%] Don't Let the Claw Grip Your Hand: A Security Analysis and Defense Framework for OpenClaw
Zhengyang Shan; Jiayun Xin; Yue Zhang; Minghui Xu - [47%] BackdoorIDS: Zero-shot Backdoor Detection for Pretrained Vision Encoder
Siquan Huang; Yijiang Li; Ningzhi Gao; Xingfu Yan; Leyu Shi; Ying Gao - [47%] AgentRAE: Remote Action Execution through Notification-based Visual Backdoors against Screenshots-based Mobile GUI Agents
Yutao Luo; Haotian Zhu; Shuchao Pang; Zhigang Lu; Tian Dong; Yongbin Zhou; Minhui Xue - [47%] Probabilistic Abstract Interpretation on Neural Networks via Grids Approximation
Zhuofan Zhang; Herbert Wiklicky - [47%] With a Little Help From My Friends: Collective Manipulation in Risk-Controlling Recommender Systems
Giovanni De Toni; Cristian Consonni; Erasmo Purificato; Emilia Gomez; Bruno Lepri - [46%] ACES: Accent Subspaces for Coupling, Explanations, and Stress-Testing in Automatic Speech Recognition
Swapnil Parekh - [46%] Why Do Unlearnable Examples Work: A Novel Perspective of Mutual Information
Yifan Zhu; Yibo Miao; Yinpeng Dong; Xiao-Shan Gao - [46%] When Priors Backfire: On the Vulnerability of Unlearnable Examples to Pretraining
Zhihao Li; Gezheng Xu; Jiale Cai; Ruiyi Fang; Di Wu; Qicheng Lao; Charles Ling; Boyu Wang - [46%] UNBOX: Unveiling Black-box visual models with Natural-language
Simone Carnemolla; Chiara Russo; Simone Palazzo; Quentin Bouniot; Daniela Giordano; Zeynep Akata; Matteo Pennisi; Concetto Spampinato - [46%] SpectralGuard: Detecting Memory Collapse Attacks in State Space Models
Davi Bonetto - [45%] Antibody: Strengthening Defense Against Harmful Fine-Tuning for Large Language Models via Attenuating Harmful Gradient Influence
Quoc Minh Nguyen; Trung Le; Jing Wu; Anh Tuan Bui; Mehrtash Harandi - [45%] IoUCert: Robustness Verification for Anchor-based Object Detectors
Benedikt Brückner; Alejandro J. Mercado; Yanghao Zhang; Panagiotis Kouvaros; Alessio Lomuscio - [45%] Adversarial Latent-State Training for Robust Policies in Partially Observable Domains
Angad Singh Ahuja - [45%] ToolFlood: Beyond Selection — Hiding Valid Tools from LLM Agents via Semantic Covering
Hussein Jawad; Nicolas J-B Brunel - [45%] Don't Trust Stubborn Neighbors: A Security Framework for Agentic Networks
Samira Abedini; Sina Mavali; Lea Schönherr; Martin Pawelczyk; Rebekka Burkholz - [45%] ORACAL: A Robust and Explainable Multimodal Framework for Smart Contract Vulnerability Detection with Causal Graph Enrichment
Tran Duong Minh Dai; Triet Huynh Minh Le; M. Ali Babar; Van-Hau Pham; Phan The Duy - [44%] When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models
Zafir Shamsi; Nikhil Chekuru; Zachary Guzman; Shivank Garg - [44%] Osmosis Distillation: Model Hijacking with the Fewest Samples
Yuchen Shi; Huajie Chen; Heng Xu; Zhiquan Liu; Jialiang Shen; Chi Liu; Shuai Zhou; Tianqing Zhu; Wanlei Zhou - [44%] Robust Single-message Shuffle Differential Privacy Protocol for Accurate Distribution Estimation
Xiaoguang Li; Hanyi Wang; Yaowei Huang; Jungang Yang; Qingqing Ye; Haonan Yan; Ke Pan; Zhe Sun; Hui Li - [44%] Where Do LLM-based Systems Break? A System-Level Security Framework for Risk Assessment and Treatment
Neha Nagaraja; Hayretdin Bahsi - [44%] Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints
Chenxi Li; Xianggan Liu; Dake Shen; Yaosong Du; Zhibo Yao; Hao Jiang; Linyi Jiang; Chengwei Cao; Jingzhe Zhang; RanYi Peng; Peiling Bai; Xiande Huang - [43%] FERRET: Framework for Expansion Reliant Red Teaming
Ninareh Mehrabi; Vitor Albiero; Maya Pavlova; Joanna Bitton - [43%] MIDAS: Multi-Image Dispersion and Semantic Reconstruction for Jailbreaking MLLMs
Yilian Liu; Xiaojun Jia; Guoshun Nan; Jiuyang Lyu; Zhican Chen; Tao Guan; Shuyuan Luo; Zhongyi Zhai; Yang Liu - [43%] Tuning Just Enough: Lightweight Backdoor Attacks on Multi-Encoder Diffusion Models
Ziyuan Chen; Yujin Jeong; Tobias Braun; Anna Rohrbach - [43%] EmbTracker: Traceable Black-box Watermarking for Federated Language Models
Haodong Zhao; Jinming Hu; Yijie Bai; Tian Dong; Wei Du; Zhuosheng Zhang; Yanjiao Chen; Haojin Zhu; Gongshen Liu - [43%] Robustness Quantification for Discriminative Models: a New Robustness Metric and its Application to Dynamic Classifier Selection
Rodrigo F. L. Lassance; Jasper De Bock - [43%] Prototype Fusion: A Training-Free Multi-Layer Approach to OOD Detection
Shreen Gul; Mohamed Elmahallawy; Ardhendu Tripathy; Sanjay Madria - [43%] Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models
Duanyi Yao; Changyue Li; Zhicong Huang; Cheng Hong; Songze Li - [43%] Robust Smart Contract Vulnerability Detection via Contrastive Learning-Enhanced Granular-ball Training
Zeli Wang; Qingxuan Yang; Shuyin Xia; Yueming Wu; Bo Liu; Longlong Lin - [43%] FedFG: Privacy-Preserving and Robust Federated Learning via Flow-Matching Generation
Ruiyang Wang; Rong Pan; Zhengan Yao - [42%] AutoFFS: Adversarial Deformations for Facial Feminization Surgery Planning
Paul Friedrich; Florentin Bieder; Florian M. Thieringer; Philippe C. Cattin - [42%] FedCova: Robust Federated Covariance Learning Against Noisy Labels
Xiangyu Zhong; Xiaojun Yuan; Ying-Jun Angela Zhang - [42%] Targeted Bit-Flip Attacks on LLM-Based Agents
Jialai Wang; Ya Wen; Zhongmou Liu; Yuxiao Wu; Bingyi He; Zongpeng Li; Ee-Chien Chang - [42%] Systematic Scaling Analysis of Jailbreak Attacks in Large Language Models
Xiangwen Wang; Ananth Balashankar; Varun Chandrasekaran - [42%] Spectral Defense Against Resource-Targeting Attack in 3D Gaussian Splatting
Yang Chen; Yi Yu; Jiaming He; Yueqi Duan; Zheng Zhu; Yap-Peng Tan - [42%] Purify Once, Edit Freely: Breaking Image Protections under Model Mismatch
Qichen Zhao; Shengfang Zhai; Xinjian Bai; Qingni Shen; Qiqi Lin; Yansong Gao; Zhonghai Wu - [42%] Safety-Potential Pruning for Enhancing Safety Prompts Against VLM Jailbreaking Without Retraining
Chongxin Li; Hanzhang Wang; Lian Duan - [42%] Code-A1: Adversarial Evolving of Code LLM and Test LLM via Reinforcement Learning
Aozhe Wang; Yuchen Yan; Nan Zhou; Zhengxi Lu; Weiming Lu; Jun Xiao; Yueting Zhuang; Yongliang Shen - [42%] ALIGN: Adversarial Learning for Generalizable Speech Neuroprosthesis
Zhanqi Zhang; Shun Li; Bernardo L. Sabatini; Mikio Aoi; Gal Mishne - [42%] JANUS: A Lightweight Framework for Jailbreaking Text-to-Image Models via Distribution Optimization
Haolun Zheng; Yu He; Tailun Chen; Shuo Shao; Zhixuan Chu; Hongbin Zhou; Lan Tao; Zhan Qin; Kui Ren - [42%] IP-Bench: Benchmark for Image Protection Methods in Image-to-Video Generation Scenarios
Xiaofeng Li; Leyi Sheng; Zhen Sun; Zongmin Zhang; Jiaheng Wei; Xinlei He - [41%] High-order Knowledge Based Network Controllability Robustness Prediction: A Hypergraph Neural Network Approach
Shibing Mo; Jiarui Zhang; Jiayu Xie; Xiangyi Teng; Jing Liu - [41%] Hide&Seek: Remove Image Watermarks with Negligible Cost via Pixel-wise Reconstruction
Huajie Chen; Tianqing Zhu; Hailin Yang; Yuchen Zhong; Yang Zhang; Hui Sun; Heng Xu; Zuobin Ying; Lihua Yin; Wanlei Zhou - [41%] Statistical Effort Modelling of Game Resource Localisation Attacks
Alessandro Sanna; Waldo Verstraete; Leonardo Regano; Davide Maiorca; Bjorn De Sutter - [41%] Revisiting the LiRA Membership Inference Attack Under Realistic Assumptions
Najeeb Jebreel; Mona Khalil; David Sánchez; Josep Domingo-Ferrer - [41%] SimCert: Probabilistic Certification for Behavioral Similarity in Deep Neural Network Compression
Jingyang Li; Fu Song; Guoqiang Li - [41%] MAED: Mathematical Activation Error Detection for Mitigating Physical Fault Attacks in DNN Inference
Kasra Ahmadi; Saeed Aghapour; Mehran Mozaffari Kermani; Reza Azarderakhsh - [41%] Beyond Weighted Summation: Learnable Nonlinear Aggregation Functions for Robust Artificial Neurons
Berke Deniz Bozyigit - [41%] SAiW: Source-Attributable Invisible Watermarking for Proactive Deepfake Defense
Bibek Das; Chandranath Adak; Soumi Chattopadhyay; Zahid Akhtar; Soumya Dutta - [41%] Exons-Detect: Identifying and Amplifying Exonic Tokens via Hidden-State Discrepancy for Robust AI-Generated Text Detection
Xiaowei Zhu; Yubing Ren; Fang Fang; Shi Wang; Yanan Cao; Li Guo - [41%] GUARD-SLM: Token Activation-Based Defense Against Jailbreak Attacks for Small Language Models
Md Jueal Mia; Joaquin Molto; Yanzhao Wu; M. Hadi Amini - [41%] Disentangled Graph Prompting for Out-Of-Distribution Detection
Cheng Yang; Yu Hao; Qi Zhang; Chuan Shi - [40%] Cascade: Composing Software-Hardware Attack Gadgets for Adversarial Threat Amplification in Compound AI Systems
Sarbartha Banerjee; Prateek Sahu; Anjo Vahldiek-Oberwagner; Jose Sanchez Vicarte; Mohit Tiwari - [40%] Byzantine-Robust Optimization under $(L_0, L_1)$-Smoothness
Arman Bolatov; Samuel Horváth; Martin Takáč; Eduard Gorbunov - [40%] SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration
Yu Pan; Wenlong Yu; Tiejun Wu; Xiaohu Ye; Qiannan Si; Guangquan Xu; Bin Wu - [40%] Byzantine-Robust and Differentially Private Federated Optimization under Weaker Assumptions
Rustem Islamov; Grigory Malinovsky; Alexander Gaponov; Aurelien Lucchi; Peter Richtárik; Eduard Gorbunov
2026-02 (231 papers)
- [99%] Learning Better Certified Models from Empirically-Robust Teachers
Alessandro De Palma - [99%] A Comparative Study of Adversarial Robustness in CNN and CNN-ANFIS Architectures
Kaaustaaub Shankar; Bharadwaj Dogga; Kelly Cohen - [99%] Evaluating False Alarm and Missing Attacks in CAN IDS
Nirab Hossain; Pablo Moriano - [99%] Most Convolutional Networks Suffer from Small Adversarial Perturbations
Amit Daniely; Idan Mehalel - [99%] Perturbing the Phase: Analyzing Adversarial Robustness of Complex-Valued Neural Networks
Florian Eilers; Christof Duhme; Xiaoyi Jiang - [99%] Transferable Backdoor Attacks for Code Models via Sharpness-Aware Adversarial Perturbation
Shuyu Chang; Haiping Huang; Yanjun Zhang; Yujin Huang; Fu Xiao; Leo Yu Zhang - [99%] Brain Tumor Classifiers Under Attack: Robustness of ResNet Variants Against Transferable FGSM and PGD Attacks
Ryan Deem; Garrett Goodman; Waqas Majeed; Md Abdullah Al Hafiz Khan; Michail S. Alexiou - [99%] Temporally Unified Adversarial Perturbations for Time Series Forecasting
Ruixian Su; Yukun Bao; Xinze Zhang - [99%] Benchmarking Adversarial Robustness and Adversarial Training Strategies for Object Detection
Alexis Winter; Jean-Vincent Martini; Romaric Audigier; Angelique Loesch; Bertrand Luvison - [98%] Empirical Analysis of Adversarial Robustness and Explainability Drift in Cybersecurity Classifiers
Mona Rajhans; Vishal Khawarey - [98%] Generating Adversarial Events: A Motion-Aware Point Cloud Framework
Hongwei Ren; Youxin Jiang; Qifei Gu; Xiangqian Wu - [97%] "Someone Hid It": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval
Jiate Li; Defu Cao; Li Li; Wei Yang; Yuehan Qin; Chenxiao Yu; Tiannuo Yang; Ryan A. Rossi; Yan Liu; Xiyang Hu; Yue Zhao - [97%] BadSNN: Backdoor Attacks on Spiking Neural Networks via Adversarial Spiking Neuron
Abdullah Arafat Miah; Kevin Vu; Yu Bi - [97%] Dashed Line Defense: Plug-And-Play Defense Against Adaptive Score-Based Query Attacks
Yanzhang Fu; Zizheng Guo; Jizhou Luo - [97%] Advantage-based Temporal Attack in Reinforcement Learning
Shenghong He - [97%] Learning Mutual View Information Graph for Adaptive Adversarial Collaborative Perception
Yihang Tao; Senkang Hu; Haonan An; Zhengru Fang; Hangcheng Cao; Yuguang Fang - [97%] Decoupling Defense Strategies for Robust Image Watermarking
Jiahui Chen; Zehang Deng; Zeyu Zhang; Chaoyang Li; Lianchen Jia; Lifeng Sun - [96%] Beyond Suffixes: Token Position in GCG Adversarial Attacks on Large Language Models
Hicham Eddoubi; Umar Faruk Abdullahi; Fadi Hassan - [96%] Robustness of Vision Language Models Against Split-Image Harmful Input Attacks
Md Rafi Ur Rashid; MD Sadik Hossain Shanto; Vishnu Asutosh Dasu; Shagufta Mehnaz - [96%] Adversarial Robustness of Deep Learning-Based Thyroid Nodule Segmentation in Ultrasound
Nicholas Dietrich; David McShannon - [96%] Devling into Adversarial Transferability on Image Classification: Review, Benchmark, and Evaluation
Xiaosen Wang; Zhijin Ge; Bohan Liu; Zheng Fang; Fengfan Zhou; Ruixuan Zhang; Shaokang Wang; Yuyang Luo - [95%] DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems
Haoran Ou; Kangjie Chen; Gelei Deng; Hangcheng Liu; Jie Zhang; Tianwei Zhang; Kwok-Yan Lam - [95%] Unifying Adversarial Robustness and Training Across Text Scoring Models
Manveer Singh Tamber; Hosna Oyarhoseini; Jimmy Lin - [95%] Efficient Adversarial Attacks on High-dimensional Offline Bandits
Seyed Mohammad Hadi Hosseini; Amir Najafi; Mahdieh Soleymani Baghshah - [95%] AD$^2$: Analysis and Detection of Adversarial Threats in Visual Perception for End-to-End Autonomous Driving Systems
Ishan Sahu; Somnath Hazra; Somak Aditya; Soumyajit Dey - [95%] Zero-Sacrifice Persistent-Robustness Adversarial Defense for Pre-Trained Encoders
Zhuxin Lei; Ziyuan Yang; Yi Zhang - [95%] A Low-Rank Defense Method for Adversarial Attack on Diffusion Models
Jiaxuan Zhu; Siyu Huang - [95%] TCRL: Temporal-Coupled Adversarial Training for Robust Constrained Reinforcement Learning in Worst-Case Scenarios
Wentao Xu; Zhongming Yao; Weihao Li; Zhenghang Song; Yumeng Song; Tianyi Li; Yushuai Li - [95%] Vulnerability Analysis of Safe Reinforcement Learning via Inverse Constrained Reinforcement Learning
Jialiang Fan; Shixiong Jiang; Mengyu Liu; Fanxin Kong - [94%] Optimal Transport-Guided Adversarial Attacks on Graph Neural Network-Based Bot Detection
Kunal Mukherjee; Zulfikar Alom; Tran Gia Bao Ngo; Cuneyt Gurcan Akcora; Murat Kantarcioglu - [94%] Bypassing Prompt Injection Detectors through Evasive Injections
Md Jahedur Rahman; Ihsen Alouani - [94%] Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models
Xinwei Zhang; Li Bai; Tianwei Zhang; Youqian Zhang; Qingqing Ye; Yingnan Zhao; Ruochen Du; Haibo Hu - [93%] RPP: A Certified Poisoned-Sample Detection Framework for Backdoor Attacks under Dataset Imbalance
Miao Lin; Feng Yu; Rui Ning; Lusi Li; Jiawei Chen; Qian Lou; Mengxin Zheng; Chunsheng Xin; Hongyi Wu - [93%] Invisible Clean-Label Backdoor Attacks for Generative Data Augmentation
Ting Xiang; Jinhui Zhao; Changjian Chen; Zhuo Tang - [93%] Universal Image Immunization against Diffusion-based Image Editing via Semantic Injection
Chanhui Lee; Donggyu Choi; Seunghyun Shin; Hae-Gon Jeon; Jeany Son - [93%] Boundary Point Jailbreaking of Black-Box LLMs
Xander Davies; Giorgi Giglemiani; Edmund Lau; Eric Winsor; Geoffrey Irving; Yarin Gal - [93%] Intent Laundering: AI Safety Datasets Are Not What They Seem
Shahriar Golchin; Marc Wetter - [93%] On the Adversarial Robustness of Discrete Image Tokenizers
Rishika Bhagwatkar; Irina Rish; Nicolas Flammarion; Francesco Croce - [92%] Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models
Jaehyun Kwak; Nam Cao; Boryeong Cho; Segyu Lee; Sumyeong Ahn; Se-Young Yun - [92%] Cross-Modal Robustness Transfer (CMRT): Training Robust Speech Translation Models Using Adversarial Text
Abderrahmane Issam; Yusuf Can Semerci; Jan Scholtes; Gerasimos Spanakis - [92%] Dynamic Deception: When Pedestrians Team Up to Fool Autonomous Cars
Masoud Jamshidiyan Tehrani; Marco Gabriel; Jinhan Kim; Paolo Tonella - [91%] Time Is All It Takes: Spike-Retiming Attacks on Event-Driven Spiking Neural Networks
Yi Yu; Qixin Zhang; Shuhan Ye; Xun Lin; Qianshan Wei; Kun Wang; Wenhan Yang; Dacheng Tao; Xudong Jiang - [91%] Lite-BD: A Lightweight Black-box Backdoor Defense via Reviving Multi-Stage Image Transformations
Abdullah Arafat Miah; Yu Bi - [91%] Closing the Distribution Gap in Adversarial Training for LLMs
Chengzhi Hu; Jonas Dornbusch; David Lüdke; Stephan Günnemann; Leo Schwinn - [90%] Enhancing Adversarial Robustness with Signed Distance Fields for Harmonizing Geometric Invariance and Texture
Zhe Li; Bernhard Kainz - [89%] PurSAMERE: Reliable Adversarial Purification via Sharpness-Aware Minimization of Expected Reconstruction Error
Vinh Hoang; Sebastian Krumscheid; Holger Rauhut; Raúl Tempone - [89%] Exploring Sparsity and Smoothness of Arbitrary $\ell_p$ Norms in Adversarial Attacks
Christof Duhme; Florian Eilers; Xiaoyi Jiang - [89%] Robustness in sparse artificial neural networks trained with adaptive topology
Bendegúz Sulyok; Gergely Palla; Filippo Radicchi; Santo Fortunato - [88%] Key Principles of Graph Machine Learning: Representation, Robustness, and Generalization
Yassine Abbahaddou - [88%] Provable Defense Framework for LLM Jailbreaks via Noise-Augumented Alignment
Zehua Cheng; Jianwei Yang; Wei Dai; Jiahao Sun - [88%] Formal Synthesis of Certifiably Robust Neural Lyapunov-Barrier Certificates
Chengxiao Wang; Haoze Wu; Gagandeep Singh - [88%] NutVLM: A Self-Adaptive Defense Framework against Full-Dimension Attacks for Vision Language Models in Autonomous Driving
Xiaoxu Peng; Dong Zhou; Jianwen Zhang; Guanghui Sun; Anh Tu Ngo; Anupam Chattopadhyay - [88%] MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs
Chun Yan Ryan Kan; Tommy Tran; Vedant Yadav; Ava Cai; Kevin Zhu; Ruizhe Li; Maheep Chaudhary - [88%] Is the Trigger Essential? A Feature-Based Triggerless Backdoor Attack in Vertical Federated Learning
Yige Liu; Yiwei Lou; Che Wang; Yongzhi Cao; Hanpin Wang - [88%] Poisoned Acoustics
Harrison Dahme - [87%] Safety-Efficacy Trade Off: Robustness against Data-Poisoning
Diego Granziol - [87%] On the Fragility of AI-Based Channel Decoders under Small Channel Perturbations
Haoyu Lei; Mohammad Jalali; Chin Wa Lau; Farzan Farnia - [87%] Exact Certification of Data-Poisoning Attacks Using Mixed-Integer Programming
Philip Sosnin; Jodie Knapp; Fraser Kennedy; Josh Collyer; Calvin Tsay - [87%] VALD: Multi-Stage Vision Attack Detection for Efficient LVLM Defense
Nadav Kadvil; Malak Fares; Ayellet Tal - [87%] Robust Spiking Neural Networks Against Adversarial Attacks
Shuai Wang; Malu Zhang; Yulin Jiang; Dehao Zhang; Ammar Belatreche; Yu Liang; Yimeng Shan; Zijian Zhou; Yang Yang; Haizhou Li - [86%] SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models
Haobo Wang; Weiqi Luo; Xiaojun Jia; Xiaochun Cao - [86%] The Role of Learning in Attacking ML-based Network Intrusion Detection
Kyle Domico; Jean-Charles Noirot Ferrand; Patrick McDaniel - [86%] Kill it with FIRE: On Leveraging Latent Space Directions for Runtime Backdoor Mitigation in Deep Neural Networks
Enrico Ahlers; Daniel Passon; Yannic Noller; Lars Grunske - [86%] Semantic-aware Adversarial Fine-tuning for CLIP
Jiacheng Zhang; Jinhao Li; Hanxun Huang; Sarah M. Erfani; Benjamin I. P. Rubinstein; Feng Liu - [86%] ER-MIA: Black-Box Adversarial Memory Injection Attacks on Long-Term Memory-Augmented Large Language Models
Mitchell Piehl; Zhaohan Xi; Zuobin Xiong; Pan He; Muchao Ye - [86%] PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention
Hefei Mei; Zirui Wang; Chang Xu; Jianyuan Guo; Minjing Dong - [85%] Syntax- and Compilation-Preserving Evasion of LLM Vulnerability Detectors
Luze Sun; Alina Oprea; Eric Wong - [85%] GradingAttack: Exposing Security Vulnerabilities in LLM Based Educational Grading Agents
Xueyi Li; Zhuoneng Zhou; Zitao Liu; Yongdong Wu - [85%] Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models
Kaiyuan Cui; Yige Li; Yutao Wu; Xingjun Ma; Sarah Erfani; Christopher Leckie; Hanxun Huang - [85%] SEW: Strengthening Robustness of Black-box DNN Watermarking via Specificity Enhancement
Huming Qiu; Mi Zhang; Junjie Sun; Peiyi Chen; Xiaohan Zhang; Min Yang - [85%] Laws of Learning Dynamics and the Core of Learners
Inkee Jung; Siu Cheong Lau - [85%] ATEX-CF: Attack-Informed Counterfactual Explanations for Graph Neural Networks
Yu Zhang; Sean Bin Yang; Arijit Khan; Cuneyt Gurcan Akcora - [85%] Backdooring Bias in Large Language Models
Anudeep Das; Prach Chantasantitam; Gurjot Singh; Lipeng He; Mariia Ponomarenko; Florian Kerschbaum - [85%] Pushing the Frontier of Black-Box LVLM Attacks via Fine-Grained Detail Targeting
Xiaohan Zhao; Zhaoyi Li; Yaxin Luo; Jiacheng Cui; Zhiqiang Shen - [85%] A Geometric Probe of the Accuracy-Robustness Trade-off: Sharp Boundaries in Symmetry-Breaking Dimensional Expansion
Yu Bai; Zhe Wang; Jiarui Zhang; Dong-Xiao Zhang; Yinjun Gao; Jun-Jie Zhang - [83%] LoMime: Query-Efficient Membership Inference using Model Extraction in Label-Only Settings
Abdullah Caglar Oksuz; Anisa Halimi; Erman Ayday - [83%] CREDIT: Certified Ownership Verification of Deep Neural Networks Against Model Extraction Attacks
Bolin Shen; Zhan Cheng; Neil Zhenqiang Gong; Fan Yao; Yushun Dong - [82%] PWAVEP: Purifying Imperceptible Adversarial Perturbations in 3D Point Clouds via Spectral Graph Wavelets
Haoran Li; Renyang Liu; Hongjia Liu; Chen Wang; Long Yin; Jian Xu - [82%] Cascading Robustness Verification: Toward Efficient Model-Agnostic Certification
Mohammadreza Maleki; Rushendra Sidibomma; Arman Adibi; Reza Samavi - [82%] TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking
Mengyao Du; Han Fang; Haokai Ma; Gang Yang; Quanjun Yin; Shouling Ji; Ee-Chien Chang - [82%] DefenseSplat: Enhancing the Robustness of 3D Gaussian Splatting via Frequency-Aware Filtering
Yiran Qiao; Yiren Lu; Yunlai Zhou; Rui Yang; Linlin Hou; Yu Yin; Jing Ma - [82%] BiRQA: Bidirectional Robust Quality Assessment for Images
Aleksandr Gushchin; Dmitriy S. Vatolin; Anastasia Antsiferova - [81%] SAGE-5GC: Security-Aware Guidelines for Evaluating Anomaly Detection in the 5G Core Network
Cristian Manca; Christian Scano; Giorgio Piras; Fabio Brau; Maura Pintor; Battista Biggio - [81%] Beyond Crash: Hijacking Your Autonomous Vehicle for Fun and Profit
Qi Sun; Ahmed Abdo; Luis Burbano; Ziyang Li; Yaxing Yao; Alvaro Cardenas; Yinzhi Cao - [81%] Robustness of Deep ReLU Networks to Misclassification of High-Dimensional Data
Věra Kůrková - [80%] Exposing Vulnerabilities in Explanation for Time Series Classifiers via Dual-Target Attacks
Bohan Wang; Zewen Liu; Lu Lin; Hui Liu; Li Xiong; Ming Jin; Wei Jin - [80%] Phantom Transfer: Data Poisoning can Survive Data-Level Defences
Andrew Draganov; Tolga H. Dur; Anandmayi Bhongade; Mary Phuong - [80%] Stop Testing Attacks, Start Diagnosing Defenses: The Four-Checkpoint Framework Reveals Where LLM Safety Breaks
Hayfa Dhahbi; Kashyap Thimmaraju - [80%] Consistency of Large Reasoning Models Under Multi-Turn Attacks
Yubo Li; Ramayya Krishnan; Rema Padman - [80%] Is Mamba Reliable for Medical Imaging?
Banafsheh Saber Latibari; Najmeh Nazari; Daniel Brignac; Hossein Sayadi; Houman Homayoun; Abhijit Mahalanobis - [79%] Exposing and Defending the Achilles' Heel of Video Mixture-of-Experts
Songping Wang; Qinglong Liu; Yueming Lyu; Ning Li; Ziwen He; Caifeng Shan - [79%] HPE: Hallucinated Positive Entanglement for Backdoor Attacks in Federated Self-Supervised Learning
Jiayao Wang; Yang Song; Zhendong Zhao; Jiale Zhang; Qilin Wu; Wenliang Yuan; Junwu Zhu; Dongfang Zhao - [79%] StealthRL: Reinforcement Learning Paraphrase Attacks for Multi-Detector Evasion of AI-Text Detectors
Suraj Ranganath; Atharv Ramesh - [78%] Monotonicity as an Architectural Bias for Robust Language Models
Patrick Cooper; Alireza Nadali; Ashutosh Trivedi; Alvaro Velasquez - [78%] Confundo: Learning to Generate Robust Poison for Practical RAG Systems
Haoyang Hu; Zhejun Jiang; Yueming Lyu; Junyuan Zhang; Yi Liu; Ka-Ho Chow - [78%] DCInject: Persistent Backdoor Attacks via Frequency Manipulation in Personal Federated Learning
Nahom Birhan; Daniel Wesego; Dereje Shenkut; Frank Liu; Daniel Takabi - [78%] RobPI: Robust Private Inference against Malicious Client
Jiaqi Xue; Mengxin Zheng; Qian Lou - [77%] Not-in-Perspective: Towards Shielding Google's Perspective API Against Adversarial Negation Attacks
Michail S. Alexiou; J. Sukarno Mertoguno - [76%] MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety
Xiaoyu Wen; Zhida He; Han Qi; Ziyu Wan; Zhongtian Ma; Ying Wen; Tianhang Zheng; Xingcheng Xu; Chaochao Lu; Qiaosheng Zhang - [76%] Semantic-level Backdoor Attack against Text-to-Image Diffusion Models
Tianxin Chen; Wenbo Jiang; Hongqiao Chen; Zhirun Zheng; Cheng Huang - [76%] Visual Memory Injection Attacks for Multi-Turn Conversations
Christian Schlarmann; Matthias Hein - [76%] When World Models Dream Wrong: Physical-Conditioned Adversarial Attacks against World Models
Zhixiang Guo; Siyuan Liang; Andras Balogh; Noah Lunberry; Rong-Cheng Tu; Mark Jelasity; Dacheng Tao - [75%] Incorruptible Neural Networks: Training Models that can Generalize to Large Internal Perturbations
Philip Jacobson; Ben Feinberg; Suhas Kumar; Sapan Agarwal; T. Patrick Xiao; Christopher Bennett - [75%] Resilient Federated Chain: Transforming Blockchain Consensus into an Active Defense Layer for Federated Learning
Mario García-Márquez; Nuria Rodríguez-Barroso; M. Victoria Luzón; Francisco Herrera - [74%] Beware Untrusted Simulators — Reward-Free Backdoor Attacks in Reinforcement Learning
Ethan Rathbun; Wo Wei Lin; Alina Oprea; Christopher Amato - [74%] TamperBench: Systematically Stress-Testing LLM Safety Under Fine-Tuning and Tampering
Saad Hossain; Tom Tseng; Punya Syon Pandey; Samanvay Vajpayee; Matthew Kowal; Nayeema Nonta; Samuel Simko; Stephen Casper; Zhijing Jin; Kellin Pelrine; Sirisha Rambhatla - [74%] BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning
Siyuan Liang; Yongcheng Jing; Yingjie Wang; Jiaxing Huang; Ee-chien Chang; Dacheng Tao - [73%] Learning to Inject: Automated Prompt Injection via Reinforcement Learning
Xin Chen; Jie Zhang; Florian Tramèr - [73%] The Double-Edged Sword of Data-Driven Super-Resolution: Adversarial Super-Resolution Models
Haley Duba-Sullivan; Steven R. Young; Emma J. Reid - [73%] Can a Teenager Fool an AI? Evaluating Low-Cost Cosmetic Attacks on Age Estimation Systems
Xingyu Shen; Tommy Duong; Xiaodong An; Zengqi Zhao; Zebang Hu; Haoyu Hu; Ziyou Wang; Finn Guo; Simiao Ren - [72%] Revisiting Backdoor Threat in Federated Instruction Tuning from a Signal Aggregation Perspective
Haodong Zhao; Jinming Hu; Gongshen Liu - [71%] TFL: Targeted Bit-Flip Attack on Large Language Model
Jingkai Guo; Chaitali Chakrabarti; Deliang Fan - [71%] Triggering hallucinations in model-based MRI reconstruction via adversarial perturbations
Suna Buğday; Yvan Saeys; Jonathan Peck - [70%] MaMa: A Game-Theoretic Approach for Designing Safe Agentic Systems
Jonathan Nöther; Adish Singla; Goran Radanovic - [70%] When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models
Jiacheng Hou; Yining Sun; Ruochong Jin; Haochen Han; Fangming Liu; Wai Kin Victor Chan; Alex Jinpeng Wang - [70%] Generating adversarial inputs for a graph neural network model of AC power flow
Robert Parker - [69%] Tracking Finite-Time Lyapunov Exponents to Robustify Neural ODEs
Tobias Wöhrer; Christian Kuehn - [69%] Exploiting Layer-Specific Vulnerabilities to Backdoor Attack in Federated Learning
Mohammad Hadi Foroughi; Seyed Hamed Rastegar; Mohammad Sabokrou; Ahmad Khonsari - [69%] RecoverMark: Robust Watermarking for Localization and Recovery of Manipulated Faces
Haonan An; Xiaohui Ye; Guang Hua; Yihang Tao; Hangcheng Cao; Xiangyu Yu; Yuguang Fang - [69%] Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models
Guangnian Wan; Qi Li; Gongfan Fang; Xinyin Ma; Xinchao Wang - [69%] Off-The-Shelf Image-to-Image Models Are All You Need To Defeat Image Protection Schemes
Xavier Pleimling; Sifat Muhammad Abdullah; Gunjan Balde; Peng Gao; Mainack Mondal; Murtuza Jadliwala; Bimal Viswanath - [68%] BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models
Zihan Wang; Hongwei Li; Rui Zhang; Wenbo Jiang; Guowen Xu - [68%] The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers
Wei Tao; Yang Dai; Jincai Huang; Qing Tao - [68%] Dirichlet Scale Mixture Priors for Bayesian Neural Networks
August Arnstad; Leiv Rønneberg; Geir Storvik - [66%] Text is All You Need for Vision-Language Model Jailbreaking
Yihang Chen; Zhao Xu; Youyuan Jiang; Tianle Zheng; Cho-Jui Hsieh - [66%] Inference-Time Backdoors via Chat Templates: From LLM Supply Chains to Agentic System Compromise
Ariel Fogel; Omer Hofman; Eilon Cohen; Roman Vainshtein - [66%] SIDeR: Semantic Identity Decoupling for Unrestricted Face Privacy
Zhuosen Bao; Xia Du; Zheng Lin; Jizhe Zhou; Zihan Fang; Jiening Wu; Yuxin Zhang; Zhe Chen; Chi-man Pun; Wei Ni; Jun Luo - [66%] Fool Me If You Can: On the Robustness of Binary Code Similarity Detection Models against Semantics-preserving Transformations
Jiyong Uhm; Minseok Kim; Michalis Polychronakis; Hyungjoon Koo - [65%] Principles of Lipschitz continuity in neural networks
Róisín Luo - [65%] Reliable Abstention under Adversarial Injections: Tight Lower Bounds and New Upper Bounds
Ezra Edelman; Surbhi Goel - [65%] AdapTools: Adaptive Tool-based Indirect Prompt Injection Attacks on Agentic LLMs
Che Wang; Jiaming Zhang; Ziqi Zhang; Zijie Wang; Yinghui Wang; Jianbo Gao; Tao Wei; Zhong Chen; Wei Yang Bryan Lim - [65%] Secure Semantic Communications via AI Defenses: Fundamentals, Solutions, and Future Directions
Lan Zhang; Chengsi Liang; Zeming Zhuang; Yao Sun; Fang Fang; Xiaoyong Yuan; Dusit Niyato - [64%] DF-LoGiT: Data-Free Logic-Gated Backdoor Attacks in Vision Transformers
Xiaozuo Shen; Yifei Cai; Rui Ning; Chunsheng Xin; Hongyi Wu - [64%] When AI Persuades: Adversarial Explanation Attacks on Human Trust in AI-Assisted Decision Making
Shutong Fan; Lan Zhang; Xiaoyong Yuan - [64%] Plato's Form: Toward Backdoor Defense-as-a-Service for LLMs with Prototype Representations
Chen Chen; Yuchen Sun; Jiaxin Gao; Yanwen Jia; Xueluan Gong; Qian Wang; Kwok-Yan Lam - [64%] Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models
In Chong Choi; Jiacheng Zhang; Feng Liu; Yiliao Song - [63%] Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models
Yicheng Bao; Xuhong Wang; Qiaosheng Zhang; Chaochao Lu; Xia Hu; Xin Tan - [63%] ShallowJail: Steering Jailbreaks against Large Language Models
Shang Liu; Hanyu Pei; Zeyan Liu - [63%] Towards Poisoning Robustness Certification for Natural Language Generation
Mihnea Ghitu; Matthew Wicker - [62%] Backdoor Sentinel: Detecting and Detoxifying Backdoors in Diffusion Models via Temporal Noise Consistency
Bingzheng Wang; Xiaoyan Gu; Hongbo Xu; Hongcheng Li; Zimo Yu; Jiang Zhou; Weiping Wang - [62%] David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning
Samuel Nellessen; Tal Kachman - [62%] Analyzing Fairness of Neural Network Prediction via Counterfactual Dataset Generation
Brian Hyeongseok Kim; Jacqueline L. Mitchell; Chao Wang - [62%] Automating Agent Hijacking via Structural Template Injection
Xinhao Deng; Jiaqing Wu; Miao Chen; Yue Xiao; Ke Xu; Qi Li - [62%] Obscure but Effective: Classical Chinese Jailbreak Prompt Optimization via Bio-Inspired Search
Xun Huang; Simeng Qin; Xiaoshuang Jia; Ranjie Duan; Huanqian Yan; Zhitao Zeng; Fei Yang; Yang Liu; Xiaojun Jia - [61%] ADCA: Attention-Driven Multi-Party Collusion Attack in Federated Self-Supervised Learning
Jiayao Wang; Yiping Zhang; Jiale Zhang; Wenliang Yuan; Qilin Wu; Junwu Zhu; Dongfang Zhao - [61%] AEGIS: Adversarial Target-Guided Retention-Data-Free Robust Concept Erasure from Diffusion Models
Fengpeng Li; Kemou Li; Qizhou Wang; Bo Han; Jiantao Zhou - [61%] Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks
Yu Yan; Sheng Sun; Shengjia Cheng; Teli Liu; Mingfeng Li; Min Liu - [61%] CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming Solutions
Jingwei Shi; Xinxiang Yin; Jing Huang; Jinman Zhao; Shengyu Tao - [60%] The Alignment Curse: Modality Alignment Supercharges Audio Attacks via Text Transfer
Yupeng Chen; Junchi Yu; Aoxi Liu; Baoyuan Wu; Philip Torr; Adel Bibi - [60%] GNSS SpAmming: a spoofing-based GNSS denial-of-service attack
Sergio Angulo Cosín; Javier Junquera-Sánchez; Carlos Hernando-Ramiro; José-Antonio Gómez-Sánchez - [59%] Semantic Consensus Decoding: Backdoor Defense for Verilog Code Generation
Guang Yang; Xing Hu; Xiang Chen; Xin Xia - [59%] Evasion of IoT Malware Detection via Dummy Code Injection
Sahar Zargarzadeh; Mohammad Islam - [57%] Learning Robust Reasoning through Guided Adversarial Self-Play
Shuozhe Li; Vaishnav Tadiparthi; Kwonjoon Lee; Nakul Agarwal; Hossein Nourkhiz Mahjoub; Ehsan Moradi Pari; Lizhang Chen; Amy Zhang; Liu Leqi - [57%] CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution
Minbeom Kim; Mihir Parmar; Phillip Wallis; Lesly Miculicich; Kyomin Jung; Krishnamurthy Dj Dvijotham; Long T. Le; Tomas Pfister - [57%] Can Adversarial Code Comments Fool AI Security Reviewers — Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis
Scott Thornton - [57%] Arc2Morph: Identity-Preserving Facial Morphing with Arc2Face
Nicolò Di Domenico; Annalisa Franco; Matteo Ferrara; Davide Maltoni - [57%] Bigger Is Safer: Provable Robustness in In-Context Learning Scales with Capacity
Di Zhang; Ningxu Zhang; Zimeng Liu - [57%] Distribution-Free Sequential Prediction with Abstentions
Jialin Yu; Moïse Blanchard - [56%] EVE: Efficient Verification of Data Erasure through Customized Perturbation in Approximate Unlearning
Weiqi Wang; Zhiyi Tian; Chenhan Zhang; Luoyu Chen; Shui Yu - [56%] Private and interpretable clinical prediction with quantum-inspired tensor train models
José Ramón Pareja Monturiol; Juliette Sinnott; Roger G. Melko; Mohammad Kohandel - [56%] Temperature Scaling Attack Disrupting Model Confidence in Federated Learning
Kichang Lee; Jaeho Jin; JaeYeon Park; Songkuk Kim; JeongGil Ko - [56%] Robust Online Learning
Sajad Ashkezari - [56%] Neighborhood Blending: A Lightweight Inference-Time Defense Against Membership Inference Attacks
Osama Zafar; Shaojie Zhan; Tianxi Ji; Erman Ayday - [56%] When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift
Max Fomin - [55%] Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents
Mingyang Liao; Yichen Wan; shuchen wu; Chenxi Miao; Xin Shen; Weikang Li; Yang Li; Deguo Xia; Jizhou Huang - [55%] How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks
Yanshu Wang; Shuaishuai Yang; Jingjing He; Tong Yang - [55%] Expanding the Role of Diffusion Models for Robust Classifier Training
Pin-Han Huang; Shang-Tse Chen; Hsuan-Tien Lin - [54%] Attack Selection Reduces Safety in Concentrated AI Control Settings against Trusted Monitoring
Joachim Schaeffer; Arjun Khandelwal; Tyler Tracy - [54%] Addressing Corpus Knowledge Poisoning Attacks on RAG Using Sparse Attention
Sagie Dekel; Moshe Tennenholtz; Oren Kurland - [54%] Reliable Explanations or Random Noise? A Reliability Metric for XAI
Poushali Sengupta; Sabita Maharjan; Frank Eliassen; Shashi Raj Pandey; Yan Zhang - [54%] AlignSentinel: Alignment-Aware Detection of Prompt Injection Attacks
Yuqi Jia; Ruiqi Wang; Xilong Wang; Chong Xiang; Neil Gong - [54%] The Vulnerability of LLM Rankers to Prompt Injection Attacks
Yu Yin; Shuai Wang; Bevan Koopman; Guido Zuccon - [53%] Detoxifying LLMs via Representation Erasure-Based Preference Optimization
Nazanin Mohammadi Sepahvand; Eleni Triantafillou; Hugo Larochelle; Doina Precup; Daniel M. Roy; Gintare Karolina Dziugaite - [52%] On the Assessment of Sensitivity of Autonomous Vehicle Perception
Apostol Vassilev; Munawar Hasan; Edward Griffor; Honglan Jin; Pavel Piliptchak; Mahima Arora; Thoshitha Gamage - [52%] E-Globe: Scalable $ε$-Global Verification of Neural Networks via Tight Upper Bounds and Pattern-Aware Branching
Wenting Li; Saif R. Kazi; Russell Bent; Duo Zhou; Huan Zhang - [52%] Robustness Verification of Polynomial Neural Networks
Yulia Alexandr; Hao Duan; Guido Montúfar - [52%] Universal Anti-forensics Attack against Image Forgery Detection via Multi-modal Guidance
Haipeng Li; Rongxuan Peng; Anwei Luo; Shunquan Tan; Changsheng Chen; Anastasia Antsiferova - [52%] Linear Model Extraction via Factual and Counterfactual Queries
Daan Otto; Jannis Kurtz; Dick den Hertog; Ilker Birbil - [52%] Robust Processing and Learning: Principles, Methods, and Wireless Applications
Shixiong Wang; Wei Dai; Li-Chun Wang; Geoffrey Ye Li - [52%] BarrierSteer: LLM Safety via Learning Barrier Steering
Thanh Q. Tran; Arun Verma; Kiwan Wong; Bryan Kian Hsiang Low; Daniela Rus; Wei Xiao - [52%] CITED: A Decision Boundary-Aware Signature for GNNs Towards Model Extraction Defense
Bolin Shen; Md Shamim Seraj; Zhan Cheng; Shayok Chakraborty; Yushun Dong - [51%] Clouding the Mirror: Stealthy Prompt Injection Attacks Targeting LLM-based Phishing Detection
Takashi Koide; Hiroki Nakano; Daiki Chiba - [51%] Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks
Lukas Struppek; Adam Gleave; Kellin Pelrine - [51%] ExLipBaB: Exact Lipschitz Constant Computation for Piecewise Linear Neural Networks
Tom A. Splittgerber - [51%] CIBER: A Comprehensive Benchmark for Security Evaluation of Code Interpreter Agents
Lei Ba; Qinbin Li; Songze Li - [51%] Adversarial Hubness Detector: Detecting Hubness Poisoning in Retrieval-Augmented Generation Systems
Idan Habler; Vineeth Sai Narajala; Stav Koren; Amy Chang; Tiffany Saade - [50%] Bypassing AI Control Protocols via Agent-as-a-Proxy Attacks
Jafar Isbarov; Murat Kantarcioglu - [50%] LeakBoost: Perceptual-Loss-Based Membership Inference Attack
Amit Kravchik Taub; Fred M. Grabovski; Guy Amit; Yisroel Mirsky - [50%] Rethinking Latency Denial-of-Service: Attacking the LLM Serving Framework, Not the Model
Tianyi Wang; Huawei Fan; Yuanchao Shu; Peng Cheng; Cong Wang - [50%] Toward Reliable Tea Leaf Disease Diagnosis Using Deep Learning Model: Enhancing Robustness With Explainable AI and Adversarial Training
Samanta Ghosh; Jannatul Adan Mahi; Shayan Abrar; Md Parvez Mia; Asaduzzaman Rayhan; Abdul Awal Yasir; Asaduzzaman Hridoy - [50%] Echoes of ownership: Adversarial-guided dual injection for copyright protection in MLLMs
Chengwei Xia; Fan Ma; Ruijie Quan; Yunqiu Xu; Kun Zhan; Yi Yang - [49%] MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs
Junhyeok Lee; Han Jang; Kyu Sung Choi - [49%] SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks
Mingqian Feng; Xiaodong Liu; Weiwei Yang; Jialin Song; Xuekai Zhu; Chenliang Xu; Jianfeng Gao - [49%] The Weight of a Bit: EMFI Sensitivity Analysis of Embedded Deep Learning Models
Jakub Breier; Štefan Kučerák; Xiaolu Hou - [49%] Does Order Matter : Connecting The Law of Robustness to Robust Generalization
Mihir More; Aritra Das; Jaee Ponde; Himadri Mandal; Vishnu Varadarajan; Debayan Gupta - [48%] SPGCL: Simple yet Powerful Graph Contrastive Learning via SVD-Guided Structural Perturbation
Hao Deng; Zhang Guo; Shuiping Gou; Bo Liu - [48%] Explanations Leak: Membership Inference with Differential Privacy and Active Learning Defense
Fatima Ezzeddine; Osama Zammar; Silvia Giordano; Omran Ayoub - [48%] Comparative Insights on Adversarial Machine Learning from Industry and Academia: A User-Study Approach
Vishruti Kakkad; Paul Chung; Hanan Hibshi; Maverick Woo - [48%] Reinforcement Learning with Backtracking Feedback
Bilgehan Sel; Vaishakh Keshava; Phillip Wallis; Lukas Rutishauser; Ming Jin; Dingcheng Li - [48%] Infusion: Shaping Model Behavior by Editing Training Data via Influence Functions
J Rosser; Robert Kirk; Edward Grefenstette; Jakob Foerster; Laura Ruis - [48%] When Backdoors Go Beyond Triggers: Semantic Drift in Diffusion Models Under Encoder Attacks
Shenyang Chen; Liuwan Zhu - [47%] Steering Externalities: Benign Activation Steering Unintentionally Increases Jailbreak Risk for Large Language Models
Chen Xiong; Zhiyuan He; Pin-Yu Chen; Ching-Yun Ko; Tsung-Yi Ho - [46%] Sufficient Conditions for Stability of Minimum-Norm Interpolating Deep ReLU Networks
Ouns El Harzli; Yoonsoo Nam; Ilja Kuzborskij; Bernardo Cuenca Grau; Ard A. Louis - [45%] WebSentinel: Detecting and Localizing Prompt Injection Attacks for Web Agents
Xilong Wang; Yinuo Liu; Zhun Wang; Dawn Song; Neil Gong - [45%] Grokking in Linear Models for Logistic Regression
Nataraj Das; Atreya Vedantam; Chandrashekar Lakshminarayanan - [45%] A unified framework for evaluating the robustness of machine-learning interpretability for prospect risking
Prithwijit Chowdhury; Ahmad Mustafa; Mohit Prabhushankar; Ghassan AlRegib - [45%] Sequential Membership Inference Attacks
Thomas Michel; Debabrota Basu; Emilie Kaufmann - [44%] A Unified Matrix-Spectral Framework for Stability and Interpretability in Deep Learning
Ronald Katende - [44%] EdgeMask-DG*: Learning Domain-Invariant Graph Structures via Adversarial Edge Masking
Rishabh Bhattacharya; Naresh Manwani - [44%] Dependable Artificial Intelligence with Reliability and Security (DAIReS): A Unified Syndrome Decoding Approach for Hallucination and Backdoor Trigger Detection
Hema Karnam Surendrababu; Nithin Nagaraj - [44%] Incentive-Aware AI Safety via Strategic Resource Allocation: A Stackelberg Security Games Perspective
Cheol Woo Kim; Davin Choo; Tzeh Yuan Neoh; Milind Tambe - [44%] Latent Regularization in Generative Test Input Generation
Giorgi Merabishvili; Oliver Weißl; Andrea Stocco - [44%] Skill-Inject: Measuring Agent Vulnerability to Skill File Attacks
David Schmotz; Luca Beurer-Kellner; Sahar Abdelnabi; Maksym Andriushchenko - [43%] Verification of the Implicit World Model in a Generative Model via Adversarial Sequences
András Balogh; Márk Jelasity - [43%] Learning to Stay Safe: Adaptive Regularization Against Safety Degradation during Fine-Tuning
Jyotin Goel; Souvik Maji; Pratik Mazumder - [42%] Improving Robustness of Vision-Language-Action Models by Restoring Corrupted Visual Inputs
Daniel Yezid Guarnizo Orjuela; Leonardo Scappatura; Veronica Di Gennaro; Riccardo Andrea Izzo; Gianluca Bardaro; Matteo Matteucci - [42%] Extracting Recurring Vulnerabilities from Black-Box LLM-Generated Software
Tomer Kordonsky; Amit LeVi; Maayan Yamin; Noam Benzimra; Avi Mendelson - [42%] Are Reasoning LLMs Robust to Interventions on Their Chain-of-Thought?
Alexander von Recum; Leander Girrbach; Zeynep Akata - [42%] When Fusion Helps and When It Breaks: View-Aligned Robustness in Same-Source Financial Imaging
Rui Ma - [42%] Realistic Face Reconstruction from Facial Embeddings via Diffusion Models
Dong Han; Yong Li; Joachim Denzler - [41%] Safer by Diffusion, Broken by Context: Diffusion LLM's Safety Blessing and Its Failure Mode
Zeyuan He; Yupeng Chen; Lang Lin; Yihan Wang; Shenxu Chang; Eric Sommerlade; Philip Torr; Junchi Yu; Adel Bibi; Jialin Yu - [41%] MemPot: Defending Against Memory Extraction Attack with Optimized Honeypots
Yuhao Wang; Shengfang Zhai; Guanghao Jin; Yinpeng Dong; Linyi Yang; Jiaheng Zhang - [41%] MUZZLE: Adaptive Agentic Red-Teaming of Web Agents Against Indirect Prompt Injection Attacks
Georgios Syros; Evan Rose; Brian Grinstead; Christoph Kerschbaumer; William Robertson; Cristina Nita-Rotaru; Alina Oprea - [41%] BlackCATT: Black-box Collusion Aware Traitor Tracing in Federated Learning
Elena Rodríguez-Lois; Fabio Brau; Maura Pintor; Battista Biggio; Fernando Pérez-González - [41%] Assessing Per-Sample Membership Inference Vulnerability without Retraining
Valentin Dorseuil; Jamal Atif; Olivier Cappé - [41%] AuditBench: Evaluating Alignment Auditing Techniques on Models with Hidden Behaviors
Abhay Sheshadri; Aidan Ewart; Kai Fronsdal; Isha Gupta; Samuel R. Bowman; Sara Price; Samuel Marks; Rowan Wang - [40%] $\textbf{AGT$^{AO}$}$: Robust and Stabilized LLM Unlearning via Adversarial Gating Training with Adaptive Orthogonality
Pengyu Li; Lingling Zhang; Zhitao Gao; Yanrui Wu; Yuxuan Dong; Huan Liu; Bifan Wei; Jun Liu - [40%] Stress-Testing Alignment Audits With Prompt-Level Strategic Deception
Oliver Daniels; Perusha Moodley; Benjamin M. Marlin; David Lindner - [40%] One RNG to Rule Them All: How Randomness Becomes an Attack Vector in Machine Learning
Kotekar Annapoorna Prabhu; Andrew Gan; Zahra Ghodsi - [40%] Robust Vision Systems for Connected and Autonomous Vehicles: Security Challenges and Attack Vectors
Sandeep Gupta; Roberto Passerone - [40%] ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction
Che Wang; Fuyao Zhang; Jiaming Zhang; Ziqi Zhang; Yinghui Wang; Longtao Huang; Jianbo Gao; Zhong Chen; Wei Yang Bryan Lim
2026-01 (204 papers)
- [100%] How Worst-Case Are Adversarial Attacks? Linking Adversarial and Perturbation Robustness
Giulio Rossolini - [100%] Erosion Attack for Adversarial Training to Enhance Semantic Segmentation Robustness
Yufei Song; Ziqi Zhou; Menghao Deng; Yifan Hu; Shengshan Hu; Minghui Li; Leo Yu Zhang - [99%] Rectifying Adversarial Examples Using Their Vulnerabilities
Fumiya Morimoto; Ryuto Morita; Satoshi Ono - [99%] Adversarial Samples Are Not Created Equal
Jennifer Crawford; Amol Khanna; Fred Lu; Amy R. Wagoner; Stella Biderman; Andre T. Nguyen; Edward Raff - [99%] Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization
Jiwei Guan; Haibo Jin; Haohan Wang - [99%] Higher-Order Adversarial Patches for Real-Time Object Detectors
Jens Bayer; Stefan Becker; David Münch; Michael Arens; Jürgen Beyerer - [99%] HogVul: Black-box Adversarial Code Generation Framework Against LM-based Vulnerability Detectors
Jingxiao Yang; Ping He; Tianyu Du; Sun Bing; Xuhong Zhang - [99%] Deepfake detectors are DUMB: A benchmark to assess adversarial training robustness under transferability constraints
Adrian Serrano; Erwan Umlil; Ronan Thomas - [99%] SRAW-Attack: Space-Reweighted Adversarial Warping Attack for SAR Target Recognition
Yiming Zhang; Weibo Qin; Yuntian Liu; Feng Wang - [99%] Adversarial Defense in Vision-Language Models: An Overview
Xiaowei Fu; Lei Zhang - [99%] Adversarial Vulnerability Transcends Computational Paradigms: Feature Engineering Provides No Defense Against Neural Adversarial Transfer
Achraf Hsain; Ahmed Abdelkader; Emmanuel Baldwin Mbaya; Hamoud Aljamaan - [98%] On the Adversarial Robustness of 3D Large Vision-Language Models
Chao Liu; Ngai-Man Cheung - [98%] Adversarial Attacks on Medical Hyperspectral Imaging Exploiting Spectral-Spatial Dependencies and Multiscale Features
Yunrui Gu; Zhenzhe Gao; Cong Kong; Jiawei Du; Zhaoxia Yin - [98%] Adversarial Evasion Attacks on Computer Vision using SHAP Values
Frank Mollard; Marcus Becker; Florian Roehrbein - [98%] A Two-Stage Globally-Diverse Adversarial Attack for Vision-Language Pre-training Models
Wutao Chen; Huaqin Zou; Chen Wan; Lifeng Huang - [98%] One Word is Enough: Minimal Adversarial Perturbations for Neural Text Ranking
Tanmay Karmakar; Sourav Saha; Debapriyo Majumdar; Surjyanee Halder - [97%] Explainability-Guided Defense: Attribution-Aware Model Refinement Against Adversarial Data Attacks
Longwei Wang; Mohammad Navid Nayyem; Abdullah Al Rakin; KC Santosh; Chaowei Zhang; Yang Zhou - [97%] NeuroShield: A Neuro-Symbolic Framework for Adversarial Robustness
Ali Shafiee Sarvestani; Jason Schmidt; Arman Roohi - [97%] Rethinking Transferable Adversarial Attacks on Point Clouds from a Compact Subspace Perspective
Keke Tang; Xianheng Liu; Weilong Peng; Xiaofei Wang; Daizong Liu; Peican Zhu; Can Lu; Zhihong Tian - [96%] Proxy Robustness in Vision Language Models is Effortlessly Transferable
Xiaowei Fu; Fuxiang Huang; Lei Zhang - [96%] SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models
Aafiya Hussain; Gaurav Srivastava; Alvi Ishmam; Zaber Hakim; Chris Thomas - [96%] Dynamic Mask-Based Backdoor Attack Against Vision AI Models: A Case Study on Mushroom Detection
Zeineb Dridi; Jihen Bennaceur; Amine Ben Hassouna - [96%] LAMP: Learning Universal Adversarial Perturbations for Multi-Image Tasks via Pre-trained Models
Alvi Md Ishmam; Najibul Haque Sarker; Zaber Ibn Abdul Hakim; Chris Thomas - [96%] An Effective Energy Mask-based Adversarial Evasion Attacks against Misclassification in Speaker Recognition Systems
Chanwoo Park; Chanwoo Kim - [95%] PatchBlock: A Lightweight Defense Against Adversarial Patches for Embedded EdgeAI Devices
Nandish Chattopadhyay; Abdul Basit; Amira Guesmi; Muhammad Abdullah Hanif; Bassem Ouni; Muhammad Shafique - [95%] Sparse Threats, Focused Defense: Criticality-Aware Robust Reinforcement Learning for Safe Autonomous Driving
Qi Wei; Junchao Fan; Zhao Yang; Jianhua Wang; Jingkai Mao; Xiaolin Chang - [95%] Quadratic Upper Bound for Boosting Robustness
Euijin You; Hyang-Won Lee - [95%] On the Effects of Adversarial Perturbations on Distribution Robustness
Yipei Wang; Zhaoying Pan; Xiaoqian Wang - [94%] Towards Robust Universal Perturbation Attacks: A Float-Coded, Penalty-Driven Evolutionary Approach
Shiqi Wang; Mahdi Khosravy; Neeraj Gupta; Olaf Witkowski - [94%] On damage of interpolation to adversarial robustness in regression
Jingfu Peng; Yuhong Yang - [94%] ICL-EVADER: Zero-Query Black-Box Evasion Attacks on In-Context Learning and Their Defenses
Ningyuan He; Ronghong Huang; Qianqian Tang; Hongyu Wang; Xianghang Mi; Shanqing Guo - [94%] Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization
Hui Lu; Yi Yu; Yiming Yang; Chenyu Yi; Xueyi Ke; Qixing Zhang; Bingquan Shen; Alex Kot; Xudong Jiang - [93%] FMVP: Masked Flow Matching for Adversarial Video Purification
Duoxun Tang; Xueyi Zhang; Chak Hin Wang; Xi Xiao; Dasen Dai; Xinhang Jiang; Wentao Shi; Rui Li; Qing Li - [93%] DUAP: Dual-task Universal Adversarial Perturbations Against Voice Control Systems
Suyang Sun; Weifei Jin; Yuxin Cao; Wei Song; Jie Hao - [93%] OTI: A Model-free and Visually Interpretable Measure of Image Attackability
Jiaming Liang; Haowei Liu; Chi-Man Pun - [92%] NADD: Amplifying Noise for Effective Diffusion-based Adversarial Purification
David D. Nguyen; The-Anh Ta; Yansong Gao; Alsharif Abuadbba - [92%] MacPrompt: Maraconic-guided Jailbreak against Text-to-Image Models
Xi Ye; Yiwen Liu; Lina Wang; Run Wang; Geying Yang; Yufei Hou; Jiayi Yu - [92%] Uncovering and Understanding FPR Manipulation Attack in Industrial IoT Networks
Mohammad Shamim Ahsan; Peng Liu - [91%] Jailbreaking LLMs Without Gradients or Priors: Effective and Transferable Attacks
Zhakshylyk Nurlanov; Frank R. Schmidt; Florian Bernard - [91%] Reward-Preserving Attacks For Robust Reinforcement Learning
Lucas Schott; Elies Gherbi; Hatem Hajri; Sylvain Lamprier - [91%] Robust Fake News Detection using Large Language Models under Adversarial Sentiment Attacks
Sahar Tahmasebi; Eric Müller-Budack; Ralph Ewerth - [91%] LLM-Based Adversarial Persuasion Attacks on Fact-Checking Systems
João A. Leite; Olesya Razuvayevskaya; Kalina Bontcheva; Carolina Scarton - [91%] Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP
Sen Nie; Jie Zhang; Zhuo Wang; Shiguang Shan; Xilin Chen - [91%] Stealthy Poisoning Attacks Bypass Defenses in Regression Settings
Javier Carnerero-Cano; Luis Muñoz-González; Phillippa Spencer; Emil C. Lupu - [90%] RefSR-Adv: Adversarial Attack on Reference-based Image Super-Resolution Models
Jiazhu Dai; Huihui Jiang - [90%] Adversarial Instance Generation and Robust Training for Neural Combinatorial Optimization with Multiple Objectives
Wei Liu; Yaoxin Wu; Yingqian Zhang; Thomas Bäck; Yingjie Fan - [90%] Diffusion-Driven Deceptive Patches: Adversarial Manipulation and Forensic Detection in Facial Identity Verification
Shahrzad Sayyafzadeh; Hongmei Chi; Shonda Bernadin - [90%] BadImplant: Injection-based Multi-Targeted Graph Backdoor Attack
Md Nabi Newaz Khan; Abdullah Arafat Miah; Yu Bi - [90%] Feature-Space Smoothing: Certified Robustness of Deep Representations
Song Xia; Meiwen Ding; Chenqi Kong; Wenhan Yang; Xudong Jiang - [89%] MORE: Multi-Objective Adversarial Attacks on Speech Recognition
Xiaoxue Gao; Zexin Li; Yiming Chen; Nancy F. Chen - [87%] FAROS: Robust Federated Learning with Adaptive Scaling against Backdoor Attacks
Chenyu Hu; Qiming Hu; Sinan Chen; Nianyu Li; Mingyue Zhang; Jialong Li - [87%] Paraphrasing Adversarial Attack on LLM-as-a-Reviewer
Masahiro Kaneko - [87%] DeMark: A Query-Free Black-Box Attack on Deepfake Watermarking Defenses
Wei Song; Zhenchang Xing; Liming Zhu; Yulei Sui; Jingling Xue - [87%] From Internal Diagnosis to External Auditing: A VLM-Driven Paradigm for Data-Free Online Backdoor Defense
Binyan Xu; Fan Yang; Xilin Dai; Di Tang; Kehuan Zhang - [86%] From Adversarial Poetry to Adversarial Tales: An Interpretability Research Agenda
Piercosma Bisconti; Marcello Galisai; Matteo Prandi; Federico Pierucci; Olga Sorokoletova; Francesco Giarrusso; Vincenzo Suriani; Marcantonio Bracale Syrnikov; Daniele Nardi - [86%] Defense Against Indirect Prompt Injection via Tool Result Parsing
Qiang Yu; Xinran Cheng; Chuanyi Liu - [86%] DDSA: Dual-Domain Strategic Attack for Spatial-Temporal Efficiency in Adversarial Robustness Testing
Jinwei Hu; Shiyuan Meng; Yi Dong; Xiaowei Huang - [85%] Adversarial Question Answering Robustness: A Multi-Level Error Analysis and Mitigation Study
Agniv Roy Choudhury; Vignesh Ponselvan Rajasingh - [85%] Low-Cost Hard-Label Adversarial Attack with Theoretical Foundations
Jun Liu; Leo Yu Zhang; Fengpeng Li; Isao Echizen; Jiantao Zhou - [84%] Physical Prompt Injection Attacks on Large Vision-Language Models
Chen Ling; Kai Hu; Hangcheng Liu; Xingshuo Han; Tianwei Zhang; Changhai Ou - [83%] SARA: Stress Test Reasoning in Audio Deepfake Detection
Binh Nguyen; Charles Fleming; Thai Le - [83%] SAFE: Secure and Accurate Federated Learning for Privacy-Preserving Brain-Computer Interfaces
Tianwang Jia; Xiaoqing Chen; Dongrui Wu - [82%] Memory Poisoning Attack and Defense on Memory Based LLM-Agents
Balachandra Devarangadi Sunil; Isheeta Sinha; Piyush Maheshwari; Shantanu Todmal; Shreyan Mallik; Shuchi Mishra - [82%] On the Extreme Variance of Certified Local Robustness Across Model Seeds
Minh Le; Phuong Cao - [82%] Differentiable Architecture Search for Adversarially Robust Quantum Computer Vision
Mohamed Afane; Quanjiang Long; Haoting Shen; Ying Mao; Junaid Farooq; Ying Wang; Juntao Chen - [82%] RerouteGuard: Understanding and Mitigating Adversarial Risks for LLM Routing
Wenhui Zhang; Huiyu Xu; Zhibo Wang; Zhichao Li; Zeqing He; Xuelin Wei; Kui Ren - [81%] State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space
Ji Guo; Wenbo Jiang; Yansong Lin; Yijing Liu; Ruichen Zhang; Guomin Lu; Aiguo Chen; Xinshuo Han; Hongwei Li - [81%] Universal Adversarial Purification with DDIM Metric Loss for Stable Diffusion
Li Zheng; Liangbin Xie; Jiantao Zhou; He YiMin - [81%] ARMOR: Agentic Reasoning for Methods Orchestration and Reparameterization for Robust Adversarial Attacks
Gabriel Lee Jun Rong; Christos Korgialas; Dion Jia Xu Ho; Pai Chet Ng; Xiaoxiao Miao; Konstantinos N. Plataniotis - [80%] GCG Attack On A Diffusion LLM
Ruben Neyroud; Sam Corley - [80%] Zero-Shot Embedding Drift Detection: A Lightweight Defense Against Prompt Injections in LLMs
Anirudh Sekar; Mrinal Agarwal; Rachel Sharma; Akitsugu Tanaka; Jasmine Zhang; Arjun Damerla; Kevin Zhu - [80%] On the Adversarial Robustness of Large Vision-Language Models under Visual Token Compression
Xinwei Zhang; Hangcheng Liu; Li Bai; Hao Wang; Qingqing Ye; Tianwei Zhang; Haibo Hu - [79%] Noise-Aware and Dynamically Adaptive Federated Defense Framework for SAR Image Target Recognition
Yuchao Hou; Zixuan Zhang; Jie Wang; Wenke Huang; Lianhui Liang; Di Wu; Zhiquan Liu; Youliang Tian; Jianming Zhu; Jisheng Dang; Junhao Dong; Zhongliang Guo - [79%] Topology-Independent Robustness of the Weighted Mean under Label Poisoning Attacks in Heterogeneous Decentralized Learning
Jie Peng; Weiyu Li; Stefan Vlaski; Qing Ling - [79%] Detecting Semantic Backdoors in a Mystery Shopping Scenario
Arpad Berta; Gabor Danner; Istvan Hegedus; Mark Jelasity - [79%] SilentDrift: Exploiting Action Chunking for Stealthy Backdoor Attacks on Vision-Language-Action Models
Bingxin Xu; Yuzhang Shang; Binghui Wang; Emilio Ferrara - [78%] Merging Triggers, Breaking Backdoors: Defensive Poisoning for Instruction-Tuned Language Models
San Kim; Gary Geunbae Lee - [78%] From Snow to Rain: Evaluating Robustness, Calibration, and Complexity of Model-Based Robust Training
Josué Martínez-Martínez; Olivia Brown; Giselle Zeno; Pooya Khorrami; Rajmonda Caceres - [77%] Adversarial Contrastive Learning for LLM Quantization Attacks
Dinghong Song; Zhiwei Xu; Hai Wan; Xibin Zhao; Pengfei Su; Dong Li - [77%] Jailbreaking LLMs & VLMs: Mechanisms, Evaluation, and Unified Defense
Zejian Chen; Chaozhuo Li; Chao Li; Xi Zhang; Litian Zhang; Yiming He - [77%] Skeletonization-Based Adversarial Perturbations on Large Vision Language Model's Mathematical Text Recognition
Masatomo Yoshida; Haruto Namura; Nicola Adami; Masahiro Okuda - [77%] StablePDENet: Enhancing Stability of Operator Learning for Solving Differential Equations
Chutian Huang; Chang Ma; Kaibo Wang; Yang Xiang - [76%] Robust Graph Fine-Tuning with Adversarial Graph Prompting
Ziyan Zhang; Bo Jiang; Jin Tang - [76%] Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
Peng-Fei Zhang; Zi Huang - [76%] Decoder Gradient Shields: A Family of Provable and High-Fidelity Methods Against Gradient-Based Box-Free Watermark Removal
Haonan An; Guang Hua; Wei Du; Hangcheng Cao; Yihang Tao; Guowen Xu; Susanto Rahardja; Yuguang Fang - [75%] Be Your Own Red Teamer: Safety Alignment via Self-Play and Reflective Experience Replay
Hao Wang; Yanting Wang; Hao Li; Rui Li; Lei Sha - [75%] Beauty and the Beast: Imperceptible Perturbations Against Diffusion-Based Face Swapping via Directional Attribute Editing
Yilong Huang; Songze Li - [74%] Jailbreaking Large Language Models through Iterative Tool-Disguised Attacks via Reinforcement Learning
Zhaoqi Wang; Zijian Zhang; Daqing He; Pengtao Kou; Xin Li; Jiamou Liu; Jincheng An; Yong Liu - [74%] How Secure is Secure Code Generation? Adversarial Prompts Put LLM Defenses to the Test
Melissa Tessa; Iyiola E. Olatunji; Aicha War; Jacques Klein; Tegawendé F. Bissyandé - [73%] Theory of Minimal Weight Perturbations in Deep Networks and its Applications for Low-Rank Activated Backdoor Attacks
Bethan Evans; Jared Tanner - [72%] CS-GBA: A Critical Sample-based Gradient-guided Backdoor Attack for Offline Reinforcement Learning
Yuanjie Zhao; Junnan Qiu; Yue Ding; Jie Li - [72%] Backdoor Attacks on Multi-modal Contrastive Learning
Simi D Kuniyilh; Rita Machacy - [72%] SecureSplit: Mitigating Backdoor Attacks in Split Learning
Zhihao Dou; Dongfei Cui; Weida Wang; Anjun Gao; Yueyang Quan; Mengyao Ma; Viet Vo; Guangdong Bai; Zhuqing Liu; Minghong Fang - [72%] Thought-Transfer: Indirect Targeted Poisoning Attacks on Chain-of-Thought Reasoning Models
Harsh Chaudhari; Ethan Rathbun; Hanna Foerster; Jamie Hayes; Matthew Jagielski; Milad Nasr; Ilia Shumailov; Alina Oprea - [71%] RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models
Rishit Chugh - [70%] When Backdoors Meet Partial Observability: Attacking Real-World Reinforcement Learning
Tairan Huang; Qingqing Ye; Yulin Jin; Jiawei Lian; Yaxin Xiao; Yi Wang; Haibo Hu - [69%] Defenses Against Prompt Attacks Learn Surface Heuristics
Shawn Li; Chenxiao Yu; Zhiyu Ni; Hao Li; Charith Peris; Chaowei Xiao; Yue Zhao - [69%] BadDet+: Robust Backdoor Attacks for Object Detection
Kealan Dunnett; Reza Arablouei; Dimity Miller; Volkan Dedeoglu; Raja Jurdak - [68%] Robust Privacy: Inference-Stage Privacy through Certified Robustness
Jiankai Jin; Xiangzheng Zhang; Zhao Liu; Wenzhuo Xu; Dongdong Yang; Deyue Zhang; Quanchen Zou - [68%] SETA: Statistical Fault Attribution for Compound AI Systems
Sayak Chowdhury; Meenakshi D'Souza - [67%] IO-RAE: Information-Obfuscation Reversible Adversarial Example for Audio Privacy Protection
Jiajie Zhu; Xia Du; Xiaoyuan Liu; Jizhe Zhou; Qizhen Xu; Zheng Lin; Chi-Man Pun - [67%] dataRLsec: Safety, Security, and Reliability With Robust Offline Reinforcement Learning for DPAs
Shriram KS Pandian; Naresh Kshetri - [67%] Leveraging Soft Prompts for Privacy Attacks in Federated Prompt Tuning
Quan Minh Nguyen; Min-Seon Kim; Hoang M. Ngo; Trong Nghia Hoang; Hyuk-Yoon Kwon; My T. Thai - [67%] SpooFL: Spoofing Federated Learning
Isaac Baglin; Xiatian Zhu; Simon Hadfield - [66%] TrojanPraise: Jailbreak LLMs via Benign Fine-Tuning
Zhixin Xie; Xurui Song; Jun Luo - [66%] SemBind: Binding Diffusion Watermarks to Semantics Against Black-Box Forgery Attacks
Xin Zhang; Zijin Yang; Kejiang Chen; Linfeng Ma; Weiming Zhang; Nenghai Yu - [65%] VocalBridge: Latent Diffusion-Bridge Purification for Defeating Perturbation-Based Voiceprint Defenses
Maryam Abbasihafshejani; AHM Nazmus Sakib; Murtuza Jadliwala - [65%] HyperNet-Adaptation for Diffusion-Based Test Case Generation
Oliver Weißl; Vincenzo Riccio; Severin Kacianka; Andrea Stocco - [65%] Proactive Hardening of LLM Defenses with HASTE
Henry Chen; Victor Aranda; Samarth Keshari; Ryan Heartfield; Nicole Nichols - [64%] Sockpuppetting: Jailbreaking LLMs by Combining Prefilling with Optimization
Asen Dotsinski; Panagiotis Eustratiadis - [63%] Multi-turn Jailbreaking Attack in Multi-Modal Large Language Models
Badhan Chandra Das; Md Tasnim Jawad; Joaquin Molto; M. Hadi Amini; Yanzhao Wu - [63%] Agents at Risk: How Users Unwittingly Undermine LLM Safety
Fengchao Chen; Tingmin Wu; Van Nguyen; Surya. Nepal; Carsten Rudolph - [63%] Res-MIA: A Training-Free Resolution-Based Membership Inference Attack on Federated Learning Models
Mohammad Zare; Pirooz Shamsinejadbabaki - [63%] Perturbation-Induced Linearization: Constructing Unlearnable Data with Solely Linear Classifiers
Jinlin Liu; Wei Chen; Xiaojin Zhang - [62%] JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification
Xi Wang; Songlei Jian; Shasha Li; Xiaopeng Li; Zhaoye Li; Bin Ji; Baosheng Wang; Jie Yu - [62%] The Role of Noisy Data in Improving CNN Robustness for Image Classification
Oscar H. Ramírez-Agudelo; Nicoleta Gorea; Aliza Reif; Lorenzo Bonasera; Michael Karl - [62%] MASH: Evading Black-Box AI-Generated Text Detectors via Style Humanization
Yongtong Gu; Songze Li; Xia Hu - [62%] PINA: Prompt Injection Attack against Navigation Agents
Jiani Liu; Yixin He; Lanlan Fan; Qidi Zhong; Yushi Cheng; Meng Zhang; Yanjiao Chen; Wenyuan Xu - [61%] Learning Resilient Elections with Adversarial GNNs
Hao Xiang Li; Yash Shah; Lorenzo Giusti - [61%] Baiting AI: Deceptive Adversary Against AI-Protected Industrial Infrastructures
Aryan Pasikhani; Prosanta Gope; Yang Yang; Shagufta Mehnaz; Biplab Sikdar - [61%] Prompt Injection Attacks on Agentic Coding Assistants: A Systematic Analysis of Vulnerabilities in Skills, Tools, and Protocol Ecosystems
Narek Maloyan; Dmitry Namiot - [60%] Break Me If You Can: Self-Jailbreaking of Aligned LLMs via Lexical Insertion Prompting
Devang Kulshreshtha; Hang Su; Haibo Jin; Chinmay Hegde; Haohan Wang - [59%] Inference Attacks Against Graph Generative Diffusion Models
Xiuling Wang; Xin Huang; Guibo Luo; Jianliang Xu - [59%] A Novel Contrastive Loss for Zero-Day Network Intrusion Detection
Jack Wilkie; Hanan Hindy; Craig Michie; Christos Tachtatzis; James Irvine; Robert Atkinson - [59%] Jailbreaks on Vision Language Model via Multimodal Reasoning
Aarush Noheria; Yuguang Yao - [58%] Quantifying Quanvolutional Neural Networks Robustness for Speech in Healthcare Applications
Ha Tran; Bipasha Kashyap; Pubudu N. Pathirana - [58%] Reasoning Hijacking: The Fragility of Reasoning Alignment in Large Language Models
Yuansen Liu; Yixuan Tang; Anthony Kum Hoe Tun - [58%] Adversarial News and Lost Profits: Manipulating Headlines in LLM-Driven Algorithmic Trading
Advije Rizvani; Giovanni Apruzzese; Pavel Laskov - [58%] Counterfactual Training: Teaching Models Plausible and Actionable Explanations
Patrick Altmeyer; Aleksander Buszydlik; Arie van Deursen; Cynthia C. S. Liem - [58%] Hair-Trigger Alignment: Black-Box Evaluation Cannot Guarantee Post-Update Alignment
Yavuz Bakman; Duygu Nur Yaldiz; Eleni Triantafillou; Peter Kairouz; Salman Avestimehr; Sai Praneeth Karimireddy - [57%] Hidden State Poisoning Attacks against Mamba-based Language Models
Alexandre Le Mercier; Chris Develder; Thomas Demeester - [57%] Private Prediction via PAC Privacy
Xiaochen Zhu; Mayuri Sridhar; Srinivas Devadas - [57%] Safeguarding Facial Identity against Diffusion-based Face Swapping via Cascading Pathway Disruption
Liqin Wang; Qianyue Hu; Wei Lu; Xiangyang Luo - [57%] Gauge-invariant representation holonomy
Vasileios Sevetlidis; George Pavlidis - [56%] GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models
Xiangdong Hu; Yangyang Jiang; Qin Hu; Xiaojun Jia - [56%] $PC^2$: Politically Controversial Content Generation via Jailbreaking Attacks on GPT-based Text-to-Image Models
Wonwoo Choi; Minjae Seo; Minkyoo Song; Hwanjo Heo; Seungwon Shin; Myoungsung You - [56%] Attack-Resistant Watermarking for AIGC Image Forensics via Diffusion-based Semantic Deflection
Qingyu Liu; Yitao Zhang; Zhongjie Ba; Chao Shuai; Peng Cheng; Tianhang Zheng; Zhibo Wang - [56%] Less Is More — Until It Breaks: Security Pitfalls of Vision Token Compression in Large Vision-Language Models
Xiaomei Zhang; Zhaoxi Zhang; Leo Yu Zhang; Yanjun Zhang; Guanhong Tao; Shirui Pan - [56%] SoK: Challenges in Tabular Membership Inference Attacks
Cristina Pêra; Tânia Carvalho; Maxime Cordy; Luís Antunes - [56%] Counterfactual Explanations on Robust Perceptual Geodesics
Eslam Zaher; Maciej Trzaskowski; Quan Nguyen; Fred Roosta - [55%] ShrimpXNet: A Transfer Learning Framework for Shrimp Disease Classification with Augmented Regularization, Adversarial Training, and Explainable AI
Israk Hasan Jone; D. M. Rafiun Bin Masud; Promit Sarker; Sayed Fuad Al Labib; Nazmul Islam; Farhad Billah - [55%] Learning with Monotone Adversarial Corruptions
Kasper Green Larsen; Chirag Pabbaraju; Abhishek Shetty - [55%] HoneyTrap: Deceiving Large Language Model Attackers to Honeypot Traps with Resilient Multi-Agent Defense
Siyuan Li; Xi Lin; Jun Wu; Zehao Liu; Haoyu Li; Tianjie Ju; Xiang Chen; Jianhua Li - [55%] Safety Is Not Universal: The Selective Safety Trap in LLM Alignment
Iago Alves Brito; Walcy Santos Rezende Rios; Julia Soares Dollis; Diogo Fernandes Costa Silva; Arlindo Rodrigues Galvão Filho - [55%] FinVault: Benchmarking Financial Agent Safety in Execution-Grounded Environments
Zhi Yang; Runguo Li; Qiqi Qiang; Jiashun Wang; Fangqi Lou; Mengping Li; Dongpo Cheng; Rui Xu; Heng Lian; Shuo Zhang; Xiaolong Liang; Xiaoming Huang; Zheng Wei; Zhaowei Liu; Xin Guo; Huacan Wang; Ronghao Chen; Liwen Zhang - [55%] BREPS: Bounding-Box Robustness Evaluation of Promptable Segmentation
Andrey Moskalenko; Danil Kuznetsov; Irina Dudko; Anastasiia Iasakova; Nikita Boldyrev; Denis Shepelev; Andrei Spiridonov; Andrey Kuznetsov; Vlad Shakhuro - [54%] Inhibitory Attacks on Backdoor-based Fingerprinting for Large Language Models
Hang Fu; Wanli Peng; Yinghan Zhou; Jiaxuan Wu; Juan Wen; Yiming Xue - [54%] Supporting Secured Integration of Microarchitectural Defenses
Kartik Ramkrishnan; Stephen McCamant; Antonia Zhai; Pen-Chung Yew - [54%] SpatialJB: How Text Distribution Art Becomes the "Jailbreak Key" for LLM Guardrails
Zhiyi Mou; Jingyuan Yang; Zeheng Qian; Wangze Ni; Tianfang Xiao; Ning Liu; Chen Zhang; Zhan Qin; Kui Ren - [54%] Towards Compact and Robust DNNs via Compression-aware Sharpness Minimization
Jialuo He; Huangxun Chen - [54%] A Systematic Literature Review on LLM Defenses Against Prompt Injection and Jailbreaking: Expanding NIST Taxonomy
Pedro H. Barcha Correia; Ryan W. Achjian; Diego E. G. Caetano de Oliveira; Ygor Acacio Maria; Victor Takashi Hayashi; Marcos Lopes; Charles Christian Miers; Marcos A. Simplicio - [54%] Learn from A Rationalist: Distilling Intermediate Interpretable Rationales
Jiayi Dai; Randy Goebel - [53%] RADAR: Retrieval-Augmented Detector with Adversarial Refinement for Robust Fake News Detection
Song-Duo Ma; Yi-Hung Liu; Hsin-Yu Lin; Pin-Yu Chen; Hong-Yan Huang; Shau-Yung Hsu; Yun-Nung Chen - [53%] MongoDB Injection Query Classification Model using MongoDB Log files as Training Data
Shaunak Perni; Minal Shirodkar; Ramdas Karmalli - [52%] Overcoming the Retrieval Barrier: Indirect Prompt Injection in the Wild for LLM Systems
Hongyan Chang; Ergute Bao; Xinjian Luo; Ting Yu - [52%] Hidden Monotonicity: Explaining Deep Neural Networks via their DC Decomposition
Jakob Paul Zimmermann; Georg Loho - [52%] SecureCAI: Injection-Resilient LLM Assistants for Cybersecurity Operations
Mohammed Himayath Ali; Mohammed Aqib Abdullah; Mohammed Mudassir Uddin; Shahnawaz Alam - [52%] Beyond Denial-of-Service: The Puppeteer's Attack for Fine-Grained Control in Ranking-Based Federated Learning
Zhihao Chen; Zirui Gong; Jianting Ning; Yanjun Zhang; Leo Yu Zhang - [52%] Hardware-Triggered Backdoors
Jonas Möller; Erik Imgrund; Thorsten Eisenhofer; Konrad Rieck - [51%] DiMEx: Breaking the Cold Start Barrier in Data-Free Model Extraction via Latent Diffusion Priors
Yash Thesia; Meera Suthar - [51%] TRYLOCK: Defense-in-Depth Against LLM Jailbreaks via Layered Preference and Representation Engineering
Scott Thornton - [51%] MCP-ITP: An Automated Framework for Implicit Tool Poisoning in MCP
Ruiqi Li; Zhiqiang Wang; Yunhao Yao; Xiang-Yang Li - [51%] SafeThinker: Reasoning about Risk to Deepen Safety Beyond Shallow Alignment
Xianya Fang; Xianying Luo; Yadong Wang; Xiang Chen; Yu Tian; Zequn Sun; Rui Liu; Jun Fang; Naiqiang Tan; Yuanning Cui; Sheng-Jun Huang - [50%] Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
Yinzhi Zhao; Ming Wang; Shi Feng; Xiaocui Yang; Daling Wang; Yifei Zhang - [50%] Deep Leakage with Generative Flow Matching Denoiser
Isaac Baglin; Xiatian Zhu; Simon Hadfield - [50%] Persona Jailbreaking in Large Language Models
Jivnesh Sandhan; Fei Cheng; Tushar Sandhan; Yugo Murawaki - [50%] SHIELD: An Auto-Healing Agentic Defense Framework for LLM Resource Exhaustion Attacks
Nirhoshan Sivaroopan; Kanchana Thilakarathna; Albert Zomaya; Manu; Yi Guo; Jo Plested; Tim Lynar; Jack Yang; Wangli Yang - [50%] Lossless Copyright Protection via Intrinsic Model Fingerprinting
Lingxiao Chen; Liqin Wang; Wei Lu; Xiangyang Luo - [49%] Objective Matters: Fine-Tuning Objectives Shape Safety, Robustness, and Persona Drift
Daniel Vennemeyer; Punya Syon Pandey; Phan Anh Duong; Michael Umeokoli; Samuel Ratnam - [49%] A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models
Chengyin Hu; Xiang Chen; Zhe Jia; Weiwen Shi; Fengyu Zhang; Jiujiang Guo; Yiwei Wei - [48%] QUPID: A Partitioned Quantum Neural Network for Anomaly Detection in Smart Grid
Hoang M. Ngo; Tre' R. Jeter; Jung Taek Seo; My T. Thai - [48%] Local-to-Global Logical Explanations for Deep Vision Models
Bhavan Vasu; Giuseppe Raffa; Prasad Tadepalli - [48%] Self Voice Conversion as an Attack against Neural Audio Watermarking
Yigitcan Özer; Wanying Ge; Zhe Zhang; Xin Wang; Junichi Yamagishi - [48%] Smoothing the Black-Box: Signed-Distance Supervision for Black-Box Model Copying
Rubén Jiménez; Oriol Pujol - [47%] LoRA as Oracle
Marco Arazzi; Antonino Nocera - [47%] ICON: Intent-Context Coupling for Efficient Multi-Turn Jailbreak Attack
Xingwei Lin; Wenhao Lin; Sicong Cao; Jiahao Yu; Renke Huang; Lei Xue; Chunming Wu - [46%] SafeRedir: Prompt Embedding Redirection for Robust Unlearning in Image Generation Models
Renyang Liu; Kangjie Chen; Han Qiu; Jie Zhang; Kwok-Yan Lam; Tianwei Zhang; See-Kiong Ng - [46%] When Reasoning Leaks Membership: Membership Inference Attack on Black-box Large Reasoning Models
Ruihan Hu; Yu-Ming Shang; Wei Luo; Ye Tao; Xi Zhang - [46%] The Unseen Threat: Residual Knowledge in Machine Unlearning under Perturbed Samples
Hsiang Hsu; Pradeep Niroula; Zichang He; Ivan Brugere; Freddy Lecue; Chun-Fu Chen - [45%] The Silicon Psyche: Anthropomorphic Vulnerabilities in Large Language Models
Giuseppe Canale; Kashyap Thimmaraju - [45%] xDNN(ASP): Explanation Generation System for Deep Neural Networks powered by Answer Set Programming
Ly Ly Trieu; Tran Cao Son - [45%] ResMAS: Resilience Optimization in LLM-based Multi-agent Systems
Zhilun Zhou; Zihan Liu; Jiahe Liu; Qingyu Shao; Yihan Wang; Kun Shao; Depeng Jin; Fengli Xu - [45%] CODE: A Contradiction-Based Deliberation Extension Framework for Overthinking Attacks on Retrieval-Augmented Generation
Xiaolei Zhang; Xiaojun Jia; Liquan Chen; Songze Li - [45%] INFA-Guard: Mitigating Malicious Propagation via Infection-Aware Safeguarding in LLM-Based Multi-Agent Systems
Yijin Zhou; Xiaoya Lu; Dongrui Liu; Junchi Yan; Jing Shao - [45%] On the Insecurity of Keystroke-Based AI Authorship Detection: Timing-Forgery Attacks Against Motor-Signal Verification
David Condrey - [45%] Deep Neural Networks as Iterated Function Systems and a Generalization Bound
Jonathan Vacher - [44%] When Bots Take the Bait: Exposing and Mitigating the Emerging Social Engineering Attack in Web Automation Agent
Xinyi Wu; Geng Hong; Yueyue Chen; MingXuan Liu; Feier Jin; Xudong Pan; Jiarun Dai; Baojun Liu - [44%] Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains
Yuan Gao; Zhigang Liu; Xinyu Yao; Bo Chen; Xiaobing Zhao - [43%] Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models
Kai Hu; Abhinav Aggarwal; Mehran Khodabandeh; David Zhang; Eric Hsin; Li Chen; Ankit Jain; Matt Fredrikson; Akash Bharadwaj - [43%] United We Defend: Collaborative Membership Inference Defenses in Federated Learning
Li Bai; Junxu Liu; Sen Zhang; Xinwei Zhang; Qingqing Ye; Haibo Hu - [43%] Techniques of Modern Attacks
Alexander Shim - [42%] Overlooked Safety Vulnerability in LLMs: Malicious Intelligent Optimization Algorithm Request and its Jailbreak
Haoran Gu; Handing Wang; Yi Mei; Mengjie Zhang; Yaochu Jin - [42%] What Matters For Safety Alignment?
Xing Li; Hui-Ling Zhen; Lihao Yin; Xianzhi Yu; Zhenhua Dong; Mingxuan Yuan - [42%] Constitutional Classifiers++: Efficient Production-Grade Defenses against Universal Jailbreaks
Hoagy Cunningham; Jerry Wei; Zihan Wang; Andrew Persic; Alwin Peng; Jordan Abderrachid; Raj Agarwal; Bobby Chen; Austin Cohen; Andy Dau; Alek Dimitriev; Rob Gilson; Logan Howard; Yijin Hua; Jared Kaplan; Jan Leike; Mu Lin; Christopher Liu; Vladimir Mikulik; Rohit Mittapalli; Clare O'Hara; Jin Pan; Nikhil Saxena; Alex Silverstein; Yue Song; Xunjie Yu; Giulio Zhou; Ethan Perez; Mrinank Sharma - [42%] On the Evidentiary Limits of Membership Inference for Copyright Auditing
Murat Bilgehan Ertan; Emirhan Böge; Min Chen; Kaleel Mahmood; Marten van Dijk - [42%] Connect the Dots: Knowledge Graph-Guided Crawler Attack on Retrieval-Augmented Generation Systems
Mengyu Yao; Ziqi Zhang; Ning Luo; Shaofei Li; Yifeng Cai; Xiangqun Chen; Yao Guo; Ding Li - [42%] LipNeXt: Scaling up Lipschitz-based Certified Robustness to Billion-parameter Models
Kai Hu; Haoqi Hu; Matt Fredrikson - [41%] CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns
Zhenhong Zhou; Shilinlu Yan; Chuanpu Liu; Qiankun Li; Kun Wang; Zhigang Zeng - [41%] Bias Detection and Rotation-Robustness Mitigation in Vision-Language Models and Generative Image Models
Tarannum Mithila - [41%] Serverless AI Security: Attack Surface Analysis and Runtime Protection Mechanisms for FaaS-Based Machine Learning
Chetan Pathade; Vinod Dhimam; Sheheryar Ahmad; Ilsa Lareb - [41%] Automatic Adjustment of HPA Parameters and Attack Prevention in Kubernetes Using Random Forests
Hanlin Zhou; Huah Yong Chan; Jingfei Ni; Mengchun Wu; Qing Deng - [41%] Comparison requires valid measurement: Rethinking attack success rate comparisons in AI red teaming
Alexandra Chouldechova; A. Feder Cooper; Solon Barocas; Abhinav Palia; Dan Vann; Hanna Wallach - [40%] COMPASS: A Framework for Evaluating Organization-Specific Policy Alignment in LLMs
Dasol Choi; DongGeon Lee; Brigitta Jesica Kartono; Helena Berndt; Taeyoun Kwon; Joonwon Jang; Haon Park; Hwanjo Yu; Minsuk Kahng - [40%] ForgetMark: Stealthy Fingerprint Embedding via Targeted Unlearning in Language Models
Zhenhua Xu; Haobo Zhang; Zhebo Wang; Qichen Liu; Haitao Xu; Wenpeng Xing; Meng Han
2025-12 (209 papers)
- [100%] Superpixel Attack: Enhancing Black-box Adversarial Attack with Image-driven Division Areas
Issa Oe; Keiichiro Yamamura; Hiroki Ishikura; Ryo Hamahira; Katsuki Fujisawa - [100%] Defense That Attacks: How Robust Models Become Better Attackers
Mohamed Awad; Mahmoud Akrm; Walid Gomaa - [100%] LLM-Driven Feature-Level Adversarial Attacks on Android Malware Detectors
Tianwei Lan; Farid Naït-Abdesselam - [99%] Out-of-the-box: Black-box Causal Attacks on Object Detectors
Melane Navaratnarajah; David A. Kelly; Hana Chockler - [99%] ByteShield: Adversarially Robust End-to-End Malware Detection through Byte Masking
Daniel Gibert; Felip Manyà - [99%] Empirical evaluation of the Frank-Wolfe methods for constructing white-box adversarial attacks
Kristina Korotkova; Aleksandr Katrutsa - [99%] Adversarial Attacks Against Deep Learning-Based Radio Frequency Fingerprint Identification
Jie Ma; Junqing Zhang; Guanxiong Shen; Alan Marshall; Chip-Hong Chang - [99%] Behavior-Aware and Generalizable Defense Against Black-Box Adversarial Attacks for ML-Based IDS
Sabrine Ennaji; Elhadj Benkhelifa; Luigi Vincenzo Mancini - [99%] Autoencoder-based Denoising Defense against Adversarial Attacks on Object Detection
Min Geun Song; Gang Min Kim; Woonmin Kim; Yongsik Kim; Jeonghyun Sim; Sangbeom Park; Huy Kang Kim - [99%] Divided We Fall: Defending Against Adversarial Attacks via Soft-Gated Fractional Mixture-of-Experts with Randomized Adversarial Training
Mohammad Meymani; Roozbeh Razavi-Far - [99%] Robustness Certificates for Neural Networks Against Data Poisoning and Evasion Attacks
Sara Taheri; Mahalakshmi Sabanayagam; Debarghya Ghoshdastidar; Majid Zamani - [99%] Scaling Adversarial Training via Data Selection
Youran Ye; Dejin Wang; Ajinkya Bhandare - [99%] Projection-based Adversarial Attack using Physics-in-the-Loop Optimization for Monocular Depth Estimation
Takeru Kusakabe; Yudai Hirose; Mashiho Mukaida; Satoshi Ono - [98%] Fast and Flexible Robustness Certificates for Semantic Segmentation
Thomas Massena; Corentin Friedrich; Franck Mamalet; Mathieu Serrurier - [98%] Sample-wise Adaptive Weighting for Transfer Consistency in Adversarial Distillation
Hongsin Lee; Hye Won Chung - [98%] The Eminence in Shadow: Exploiting Feature Boundary Ambiguity for Robust Backdoor Attacks
Zhou Feng; Jiahao Chen; Chunyi Zhou; Yuwen Pu; Tianyu Du; Jinbao Li; Jianhai Chen; Shouling Ji - [98%] Smudged Fingerprints: A Systematic Evaluation of the Robustness of AI Image Fingerprints
Kai Yao; Marc Juarez - [98%] GradID: Adversarial Detection via Intrinsic Dimensionality of Gradients
Mohammad Mahdi Razmjoo; Mohammad Mahdi Sharifian; Saeed Bagheri Shouraki - [98%] Adversarial Robustness in Financial Machine Learning: Defenses, Economic Impact, and Governance Evidence
Samruddhi Baviskar - [98%] Less Is More: Sparse and Cooperative Perturbation for Point Cloud Attacks
Keke Tang; Tianyu Hao; Xiaofei Wang; Weilong Peng; Denghui Zhang; Peican Zhu; Zhihong Tian - [98%] Towards Reliable Evaluation of Adversarial Robustness for Spiking Neural Networks
Jihang Wang; Dongcheng Zhao; Ruolin Chen; Qian Zhang; Yi Zeng - [97%] Physical ID-Transfer Attacks against Multi-Object Tracking via Adversarial Trajectory
Chenyi Wang; Yanmao Man; Raymond Muller; Ming Li; Z. Berkay Celik; Ryan Gerdes; Jonathan Petit - [97%] PHANTOM: PHysical ANamorphic Threats Obstructing Connected Vehicle Mobility
Md Nahid Hasan Shuvo; Moinul Hossain - [97%] Adversarial VR: An Open-Source Testbed for Evaluating Adversarial Robustness of VR Cybersickness Detection and Mitigation
Istiak Ahmed; Ripan Kumar Kundu; Khaza Anuarul Hoque - [97%] IoT-based Android Malware Detection Using Graph Neural Network With Adversarial Defense
Rahul Yumlembam; Biju Issac; Seibu Mary Jacob; Longzhi Yang - [97%] RobustMask: Certified Robustness against Adversarial Neural Ranking Attack via Randomized Masking
Jiawei Liu; Zhuo Chen; Rui Zhu; Miaokun Chen; Yuyang Gong; Wei Lu; Xiaofeng Wang - [96%] Optimizing the Adversarial Perturbation with a Momentum-based Adaptive Matrix
Wei Tao; Sheng Long; Xin Liu; Wei Li; Qing Tao - [95%] The Outline of Deception: Physical Adversarial Attacks on Traffic Signs Using Edge Patches
Haojie Ji; Te Hu; Haowen Li; Long Jin; Chongshi Xin; Yuchi Yao; Jiarui Xiao - [95%] Metaphor-based Jailbreak Attacks on Text-to-Image Models
Chenyu Zhang; Lanjun Wang; Yiwen Ma; Wenhui Li; Yi Tu; An-An Liu - [95%] Adversarial Robustness of Vision in Open Foundation Models
Jonathon Fox; William J Buchanan; Pavlos Papadopoulos - [94%] Studying Various Activation Functions and Non-IID Data for Machine Learning Model Robustness
Long Dang; Thushari Hapuarachchi; Kaiqi Xiong; Jing Lin - [94%] Toward Patch Robustness Certification and Detection for Deep Learning Systems Beyond Consistent Samples
Qilin Zhou; Zhengyuan Wei; Haipeng Wang; Zhuo Wang; W. K. Chan - [94%] On Improving Deep Active Learning with Formal Verification
Jonathan Spiegelman; Guy Amir; Guy Katz - [94%] Adversarially Robust Detection of Harmful Online Content: A Computational Design Science Approach
Yidong Chai; Yi Liu; Mohammadreza Ebrahimi; Weifeng Li; Balaji Padmanabhan - [94%] Adversarial Robustness in Zero-Shot Learning:An Empirical Study on Class and Concept-Level Vulnerabilities
Zhiyuan Peng; Zihan Ye; Shreyank N Gowda; Yuping Yan; Haotian Xu; Ling Shao - [93%] FeatureLens: A Highly Generalizable and Interpretable Framework for Detecting Adversarial Examples Based on Image Features
Zhigang Yang; Yuan Liu; Jiawei Zhang; Puning Zhang; Xinqiang Ma - [93%] Forecasting Fails: Unveiling Evasion Attacks in Weather Prediction Models
Huzaifa Arif; Pin-Yu Chen; Alex Gittens; James Diffenderfer; Bhavya Kailkhura - [93%] Attacking and Securing Community Detection: A Game-Theoretic Framework
Yifan Niu; Aochuan Chen; Tingyang Xu; Jia Li - [93%] Calibrating Uncertainty for Zero-Shot Adversarial CLIP
Wenjing Lu; Zerui Tao; Yuning Qiu; Dongping Zhang; Yang Yang; Qibin Zhao - [93%] T2VAttack: Adversarial Attack on Text-to-Video Diffusion Models
Changzhen Li; Yuecong Min; Jie Zhang; Zheng Yuan; Shiguang Shan; Xilin Chen - [92%] Replicating TEMPEST at Scale: Multi-Turn Adversarial Attacks Against Trillion-Parameter Frontier Models
Richard Young - [92%] TrajSyn: Privacy-Preserving Dataset Distillation from Federated Model Trajectories for Server-Side Adversarial Training
Mukur Gupta; Niharika Gupta; Saifur Rahman; Shantanu Pal; Chandan Karmakar - [92%] TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models
Zhiwei Li; Yitian Pang; Weining Wang; Zhenan Sun; Qi Li - [92%] SafeMed-R1: Adversarial Reinforcement Learning for Generalizable and Robust Medical Reasoning in Vision-Language Models
A. A. Gde Yogi Pramana; Jason Ray; Anthony Jaya; Michael Wijaya - [92%] Time-Efficient Evaluation and Enhancement of Adversarial Robustness in Deep Neural Networks
Runqi Lin - [92%] Adversarial Lens: Exploiting Attention Layers to Generate Adversarial Examples for Evaluation
Kaustubh Dhole - [91%] Pruning Graphs by Adversarial Robustness Evaluation to Strengthen GNN Defenses
Yongyu Wang - [90%] Authority Backdoor: A Certifiable Backdoor Mechanism for Authoring DNNs
Han Yang; Shaofeng Li; Tian Dong; Xiangyu Xu; Guangchi Liu; Zhen Ling - [89%] Adversarial Robustness of Traffic Classification under Resource Constraints: Input Structure Matters
Adel Chehade; Edoardo Ragusa; Paolo Gastaldo; Rodolfo Zunino - [89%] DivQAT: Enhancing Robustness of Quantized Convolutional Neural Networks against Model Extraction Attacks
Kacem Khaled; Felipe Gohring de Magalhães; Gabriela Nicolescu - [89%] HeteroHBA: A Generative Structure-Manipulating Backdoor Attack on Heterogeneous Graphs
Honglin Gao; Lan Zhao; Junhao Ren; Xiang Li; Gaoxi Xiao - [88%] Counterfeit Answers: Adversarial Forgery against OCR-Free Document Visual Question Answering
Marco Pintore; Maura Pintor; Dimosthenis Karatzas; Battista Biggio - [88%] FBA$^2$D: Frequency-based Black-box Attack for AI-generated Image Detection
Xiaojing Chen; Dan Li; Lijun Peng; Jun YanŁetter; Zhiqing Guo; Junyang Chen; Xiao Lan; Zhongjie Ba; Yunfeng DiaoŁetter - [87%] Concept-Guided Backdoor Attack on Vision Language Models
Haoyu Shen; Weimin Lyu; Haotian Xu; Tengfei Ma - [87%] Towards Transferable Defense Against Malicious Image Edits
Jie Zhang; Shuai Dong; Shiguang Shan; Xilin Chen - [87%] Multi-Layer Confidence Scoring for Detection of Out-of-Distribution Samples, Adversarial Attacks, and In-Distribution Misclassifications
Lorenzo Capelli; Leandro de Souza Rosa; Gianluca Setti; Mauro Mangia; Riccardo Rovatti - [87%] Breaking Audio Large Language Models by Attacking Only the Encoder: A Universal Targeted Latent-Space Audio Attack
Roee Ziv; Raz Lapid; Moshe Sipper - [86%] QSTAformer: A Quantum-Enhanced Transformer for Robust Short-Term Voltage Stability Assessment against Adversarial Attacks
Yang Li; Chong Ma; Yuanzheng Li; Sen Li; Yanbo Chen; Zhaoyang Dong - [86%] Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems
M Zeeshan; Saud Satti - [85%] Quantization Blindspots: How Model Compression Breaks Backdoor Defenses
Rohan Pandey; Eric Ye - [85%] Degrading Voice: A Comprehensive Overview of Robust Voice Conversion Through Input Manipulation
Xining Song; Zhihua Wei; Rui Wang; Haixiao Hu; Yanxiang Chen; Meng Han - [85%] Exposing and Defending Membership Leakage in Vulnerability Prediction Models
Yihan Liao; Jacky Keung; Xiaoxue Ma; Jingyu Zhang; Yicheng Sun - [85%] GShield: Mitigating Poisoning Attacks in Federated Learning
Sameera K. M.; Serena Nicolazzo; Antonino Nocera; Vinod P.; Rafidha Rehiman K. A - [83%] Securing Large Language Models (LLMs) from Prompt Injection Attacks
Omar Farooq Khan Suri; John McCrae - [83%] Real-World Adversarial Attacks on RF-Based Drone Detectors
Omer Gazit; Yael Itzhakev; Yuval Elovici; Asaf Shabtai - [83%] High-Entropy Tokens as Multimodal Failure Points in Vision-Language Models
Mengqi He; Xinyu Tian; Xin Shen; Jinhong Ni; Shu Zou; Zhaoyuan Yang; Jing Zhang - [82%] SPOOF: Simple Pixel Operations for Out-of-Distribution Fooling
Ankit Gupta; Christoph Adami; Emily Dolson - [82%] SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models
Mohamed Afane; Abhishek Satyam; Ke Chen; Tao Li; Junaid Farooq; Juntao Chen - [80%] Improving the Convergence Rate of Ray Search Optimization for Query-Efficient Hard-Label Attacks
Xinjie Xu; Shuyu Cheng; Dongwei Xu; Qi Xuan; Chen Ma - [79%] CluCERT: Certifying LLM Robustness via Clustering-Guided Denoising Smoothing
Zixia Wang; Gaojie Jin; Jia Hu; Ronghui Mu - [79%] Rethinking Robustness: A New Approach to Evaluating Feature Attribution Methods
Panagiota Kiourti; Anu Singh; Preeti Duraipandian; Weichao Zhou; Wenchao Li - [79%] Patronus: Identifying and Mitigating Transferable Backdoors in Pre-trained Language Models
Tianhang Zhao; Haodong Zhao; Wei Du; Pengzhou Cheng; Junxian Li; Sufeng Duan; Haojin Zhu; Gongshen Liu - [79%] Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation
Zehao Liu; Xi Lin - [79%] Guided Diffusion-based Generation of Adversarial Objects for Real-World Monocular Depth Estimation Attacks
Yongtao Chen; Yanbo Wang; Wentao Zhao; Guole Shen; Tianchen Deng; Jingchuan Wang - [78%] On the Tension Between Optimality and Adversarial Robustness in Policy Optimization
Haoran Li; Jiayu Lv; Congying Han; Zicheng Zhang; Anqi Li; Yan Liu; Tiande Guo; Nan Jiang - [78%] Evaluating Adversarial Attacks on Federated Learning for Temperature Forecasting
Karina Chichifoi; Fabio Merizzi; Michele Colajanni - [78%] Mimicking Human Visual Development for Learning Robust Image Representations
Ankita Raj; Kaashika Prajaapat; Tapan Kumar Gandhi; Chetan Arora - [77%] MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks
Tailun Chen; Yu He; Yan Wang; Shuo Shao; Haolun Zheng; Zhihao Liu; Jinfeng Li; Zhizhen Qin; Yuefeng Chen; Zhixuan Chu; Zhan Qin; Kui Ren - [77%] ComMark: Covert and Robust Black-Box Model Watermarking with Compressed Samples
Yunfei Yang; Xiaojun Chen; Zhendong Zhao; Yu Zhou; Xiaoyan Gu; Juan Cao - [75%] Super Suffixes: Bypassing Text Generation Alignment and Guard Models Simultaneously
Andrew Adiletta; Kathryn Adiletta; Kemal Derya; Berk Sunar - [75%] CIS-BA: Continuous Interaction Space Based Backdoor Attack for Object Detection in the Real-World
Shuxin Zhao; Bo Lang; Nan Xiao; Yilang Zhang - [75%] Exploring the Security Threats of Retriever Backdoors in Retrieval-Augmented Code Generation
Tian Li; Bo Lin; Shangwen Wang; Yusong Tan - [75%] CPR: Causal Physiological Representation Learning for Robust ECG Analysis under Distribution Shifts
Shunbo Jia; Caizhi Liao - [73%] Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
Ju-Young Kim; Ji-Hong Park; Myeongjun Kim; Gun-Woo Kim - [73%] Toward Reliable Machine Unlearning: Theory, Algorithms, and Evaluation
Ali Ebrahimpour-Boroojeny - [72%] WARP: Weight Teleportation for Attack-Resilient Unlearning Protocols
Mohammad M Maheri; Xavier Cadet; Peter Chin; Hamed Haddadi - [72%] Adaptive Trust Consensus for Blockchain IoT: Comparing RL, DRL, and MARL Against Naive, Collusive, Adaptive, Byzantine, and Sleeper Attacks
Soham Padia; Dhananjay Vaidya; Ramchandra Mangrulkar - [71%] LDLT $\mathcal{L}$-Lipschitz Network: Generalized Deep End-To-End Lipschitz Network Construction
Marius F. R. Juston; Ramavarapu S. Sreenivas; Dustin Nottage; Ahmet Soylemezoglu - [71%] Black-Box Behavioral Distillation Breaks Safety Alignment in Medical LLMs
Sohely Jahan; Ruimin Sun - [71%] Conditional Adversarial Fragility in Financial Machine Learning under Macroeconomic Stress
Samruddhi Baviskar - [70%] Driving in Corner Case: A Real-World Adversarial Closed-Loop Evaluation Platform for End-to-End Autonomous Driving
Jiaheng Geng; Jiatong Du; Xinyu Zhang; Ye Li; Panqu Wang; Yanjun Huang - [70%] Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models
Zongmin Zhang; Zhen Sun; Yifan Liao; Wenhan Dong; Xinlei He; Xingshuo Han; Shengmin Xu; Xinyi Huang - [69%] Adaptive Intrusion Detection System Leveraging Dynamic Neural Models with Adversarial Learning for 5G/6G Networks
Neha; Tarunpreet Bhatia - [68%] ThinkTrap: Denial-of-Service Attacks against Black-box LLM Services via Infinite Thinking
Yunzhe Li; Jianan Wang; Hongzi Zhu; James Lin; Shan Chang; Minyi Guo - [68%] Improving the Sensitivity of Backdoor Detectors via Class Subspace Orthogonalization
Guangmingmei Yang; David J. Miller; George Kesidis - [68%] Stylized Synthetic Augmentation further improves Corruption Robustness
Georg Siedel; Rojan Regmi; Abhirami Anand; Weijia Shao; Silvia Vock; Andrey Morozov - [67%] DEFEND: Poisoned Model Detection and Malicious Client Exclusion Mechanism for Secure Federated Learning-based Road Condition Classification
Sheng Liu; Panos Papadimitratos - [67%] Pay Less Attention to Function Words for Free Robustness of Vision-Language Models
Qiwei Tian; Chenhao Lin; Zhengyu Zhao; Chao Shen - [67%] AdLift: Lifting Adversarial Perturbations to Safeguard 3D Gaussian Splatting Assets Against Instruction-Driven Editing
Ziming Hong; Tianyu Huang; Runnan Chen; Shanshan Ye; Mingming Gong; Bo Han; Tongliang Liu - [67%] Keep the Lights On, Keep the Lengths in Check: Plug-In Adversarial Detection for Time-Series LLMs in Energy Forecasting
Hua Ma; Ruoxi Sun; Minhui Xue; Xingliang Yuan; Carsten Rudolph; Surya Nepal; Ling Liu - [67%] AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications
Honglin Mu; Jinghao Liu; Kaiyang Wan; Rui Xing; Xiuying Chen; Timothy Baldwin; Wanxiang Che - [67%] DECEPTICON: How Dark Patterns Manipulate Web Agents
Phil Cuvin; Hao Zhu; Diyi Yang - [66%] Boosting RL-Based Visual Reasoning with Selective Adversarial Entropy Intervention
Yang Yu; Zhuangzhuang Chen; Lanqing Li; Xiaomeng Li - [65%] Dual Randomized Smoothing: Beyond Global Noise Variance
Chenhao Sun; Yuhao Mao; Martin Vechev - [65%] Optimal Perturbation Budget Allocation for Data Poisoning in Offline Reinforcement Learning
Junnan Qiu; Yuanjie Zhao; Jie Li - [65%] 6DAttack: Backdoor Attacks in the 6DoF Pose Estimation
Jihui Guo; Zongmin Zhang; Zhen Sun; Yuhao Yang; Jinlin Wu; Fu Zhang; Xinlei He - [64%] DefenSee: Dissecting Threat from Sight and Text — A Multi-View Defensive Pipeline for Multi-modal Jailbreaks
Zihao Wang; Kar Wai Fok; Vrizlynn L. L. Thing - [64%] One Detector Fits All: Robust and Adaptive Detection of Malicious Packages from PyPI to Enterprises
Biagio Montaruli; Luca Compagna; Serena Elisa Ponta; Davide Balzarotti - [64%] Universal Adversarial Suffixes Using Calibrated Gumbel-Softmax Relaxation
Sampriti Soor; Suklav Ghosh; Arijit Sur - [64%] Natural Geometry of Robust Data Attribution: From Convex Models to Deep Networks
Shihao Li; Jiachen Li; Dongmei Chen - [64%] Protecting Deep Neural Network Intellectual Property with Chaos-Based White-Box Watermarking
Sangeeth B; Serena Nicolazzo; Deepa K.; Vinod P - [63%] Epistemic Bias Injection: Manipulating LLM Opinion via Selective Context Retrieval
Hao Wu; Prateek Saxena - [63%] EmoRAG: Evaluating RAG Robustness to Symbolic Perturbations
Xinyun Zhou; Xinfeng Li; Yinan Peng; Ming Xu; Xuanwang Zhang; Miao Yu; Yidong Wang; Xiaojun Jia; Kun Wang; Qingsong Wen; XiaoFeng Wang; Wei Dong - [63%] Safety Alignment of LMs via Non-cooperative Games
Anselm Paulus; Ilia Kulikov; Brandon Amos; Rémi Munos; Ivan Evtimov; Kamalika Chaudhuri; Arman Zharmagambetov - [62%] Spoofing-aware Prompt Learning for Unified Physical-Digital Facial Attack Detection
Jiabao Guo; Yadian Wang; Hui Ma; Yuhao Fu; Ju Jia; Hui Liu; Shengeng Tang; Lechao Cheng; Yunfeng Diao; Ajian Liu - [62%] Odysseus: Jailbreaking Commercial Multimodal LLM-integrated Systems via Dual Steganography
Songze Li; Jiameng Cheng; Yiming Li; Xiaojun Jia; Dacheng Tao - [62%] Failure Analysis of Safety Controllers in Autonomous Vehicles Under Object-Based LiDAR Attacks
Daniyal Ganiuly; Nurzhau Bolatbek; Assel Smaiyl - [60%] Developing a Strong CPS Defender: An Evolutionary Approach
Qingyuan Hu; Christopher M. Poskitt; Jun Sun; Yuqi Chen - [59%] Don't Trust Your Upstream: Exploiting LLM Multi-Agent System via Topology-Guided Adversarial Propagation
Ruichao Liang; Le Yin; Jing Chen; Yebo Feng; Cong Wu; Xiaoyu Zhang; Huangpeng Gu; Zijian Zhang; Yang Liu - [59%] Evaluating Vulnerabilities of Connected Vehicles Under Cyber Attacks by Attack-Defense Tree
Muhammad Baqer Mollah; Honggang Wang; Hua Fang - [58%] Towards Robust Protective Perturbation against DeepFake Face Swapping
Hengyang Yao; Lin Li; Ke Sun; Jianing Qiu; Huiping Chen - [57%] Web Technologies Security in the AI Era: A Survey of CDN-Enhanced Defenses
Mehrab Hosain; Sabbir Alom Shuvo; Matthew Ogbe; Md Shah Jalal Mazumder; Yead Rahman; Md Azizul Hakim; Anukul Pandey - [57%] Towards a Systematic Taxonomy of Attacks against Space Infrastructures
Jose Luis Castanon Remy; Shouhuai Xu - [57%] Biosecurity-Aware AI: Agentic Risk Auditing of Soft Prompt Attacks on ESM-Based Variant Predictors
Huixin Zhan - [57%] Evaluating the Impact of Compression Techniques on the Robustness of CNNs under Natural Corruptions
Itallo Patrick Castro Alves Da Silva; Emanuel Adler Medeiros Pereira; Erick de Andrade Barboza; Baldoino Fonseca dos Santos Neto; Marcio de Medeiros Ribeiro - [56%] Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models
Zhongqi Wang; Jie Zhang; Shiguang Shan; Xilin Chen - [56%] PRIVEE: Privacy-Preserving Vertical Federated Learning Against Feature Inference Attacks
Sindhuja Madabushi; Ahmad Faraz Khan; Haider Ali; Ananthram Swami; Rui Ning; Hongyi Wu; Jin-Hee Cho - [56%] ArcGen: Generalizing Neural Backdoor Detection Across Diverse Architectures
Zhonghao Yang; Cheng Luo; Daojing He; Yiming Li; Yu Li - [55%] Impact of Positional Encoding: Clean and Adversarial Rademacher Complexity for Transformers under In-Context Regression
Weiyi He; Yue Xing - [55%] Hellinger loss function for Generative Adversarial Networks
Giovanni Saraceno; Anand N. Vidyashankar; Claudio Agostinelli - [55%] Superposition as Lossy Compression: Measure with Sparse Autoencoders and Connect to Adversarial Vulnerability
Leonard Bereska; Zoe Tzifa-Kratira; Reza Samavi; Efstratios Gavves - [55%] Prompt-Induced Over-Generation as Denial-of-Service: A Black-Box Attack-Side Benchmark
Manu; Yi Guo; Kanchana Thilakarathna; Nirhoshan Sivaroopan; Jo Plested; Tim Lynar; Jack Yang; Wangli Yang - [54%] PHANTOM: Progressive High-fidelity Adversarial Network for Threat Object Modeling
Jamal Al-Karaki; Muhammad Al-Zafar Khan; Rand Derar Mohammad Al Athamneh - [54%] Reasoning-Style Poisoning of LLM Agents via Stealthy Style Transfer: Process-Level Attacks and Runtime Monitoring in RSV Space
Xingfu Zhou; Pengfei Wang - [53%] Watermarks for Embeddings-as-a-Service Large Language Models
Anudeex Shetty - [53%] Robust Tabular Foundation Models
Matthew Peroni; Franck Le; Vadim Sheinin - [53%] DAMASHA: Detecting AI in Mixed Adversarial Texts via Segmentation with Human-interpretable Attribution
L. D. M. S. Sai Teja; N. Siva Gopala Krishna; Ufaq Khan; Muhammad Haris Khan; Atul Mishra - [53%] SpectralKrum: A Spectral-Geometric Defense Against Byzantine Attacks in Federated Learning
Aditya Tripathi; Karan Sharma; Rahul Mishra; Tapas Kumar Maiti - [53%] An Efficient Gradient-Based Inference Attack for Federated Learning
Pablo Montaña-Fernández; Ines Ortega-Fernandez - [53%] SoK: Understanding (New) Security Issues Across AI4Code Use Cases
Qilong Wu; Taoran Li; Tianyang Zhou; Varun Chandrasekaran - [53%] Zero-Trust Agentic Federated Learning for Secure IIoT Defense Systems
Samaresh Kumar Singh; Joyjit Roy; Martin So - [52%] SA$^{2}$GFM: Enhancing Robust Graph Foundation Models with Structure-Aware Semantic Augmentation
Junhua Shi; Qingyun Sun; Haonan Yuan; Xingcheng Fu - [52%] Phishing Email Detection Using Large Language Models
Najmul Hasan; Prashanth BusiReddyGari; Haitao Zhao; Yihao Ren; Jinsheng Xu; Shaohu Zhang - [52%] Detecting Prompt Injection Attacks Against Application Using Classifiers
Safwan Shaheer; G. M. Refatul Islam; Mohammad Rafid Hamid; Md. Abrar Faiaz Khan; Md. Omar Faruk; Yaseen Nur - [52%] Tackling Snow-Induced Challenges: Safe Autonomous Lane-Keeping with Robust Reinforcement Learning
Amin Jalal Aghdasian; Farzaneh Abdollahi; Ali Kamali Iglie - [52%] Robust and Calibrated Detection of Authentic Multimedia Content
Sarim Hashmi; Abdelrahman Elsayed; Mohammed Talha Alam; Samuele Poppi; Nils Lukas - [52%] Time-Varying Audio Effect Modeling by End-to-End Adversarial Training
Yann Bourdin; Pierrick Legrand; Fanny Roche - [52%] Assessing the Effectiveness of Membership Inference on Generative Music
Kurtis Chow; Omar Samiullah; Vinesh Sridhar; Hewen Zhang - [51%] Invasive Context Engineering to Control Large Language Models
Thomas Rivasseau - [51%] SoK: a Comprehensive Causality Analysis Framework for Large Language Model Security
Wei Zhao; Zhe Li; Jun Sun - [51%] DeContext as Defense: Safe Image Editing in Diffusion Transformers
Linghui Shen; Mingyue Cui; Xingyi Yang - [51%] Causal-Guided Detoxify Backdoor Attack of Open-Weight LoRA Models
Linzhi Chen; Yang Sun; Hongru Wei; Yuqi Chen - [51%] Attack-Aware Deepfake Detection under Counter-Forensic Manipulations
Noor Fatima; Hasan Faraz Khan; Muzammil Behzad - [50%] ARGUS: Defending Against Multimodal Indirect Prompt Injection via Steering Instruction-Following Behavior
Weikai Lu; Ziqian Zeng; Kehua Zhang; Haoran Li; Huiping Zhuang; Ruidong Wang; Cen Chen; Hao Peng - [50%] Topologically-Stabilized Graph Neural Networks: Empirical Robustness Across Domains
Jelena Losic - [50%] Jailbreaking Attacks vs. Content Safety Filters: How Far Are We in the LLM Safety Arms Race?
Yuan Xin; Dingfan Chen; Linyi Yang; Michael Backes; Xiao Zhang - [50%] Towards Provably Secure Generative AI: Reliable Consensus Sampling
Yu Cui; Hang Fu; Sicheng Pan; Zhuoyu Sun; Yifei Liu; Yuhong Nie; Bo Ran; Baohan Huang; Xufeng Zhang; Haibin Zhang; Cong Zuo; Licheng Wang - [49%] Mitigating Indirect Prompt Injection via Instruction-Following Intent Analysis
Mintong Kang; Chong Xiang; Sanjay Kariyappa; Chaowei Xiao; Bo Li; Edward Suh - [49%] A Comprehensive Study of Supervised Machine Learning Models for Zero-Day Attack Detection: Analyzing Performance on Imbalanced Data
Zahra Lotfi; Mostafa Lotfi - [49%] Universal Adversarial Suffixes for Language Models Using Reinforcement Learning with Calibrated Reward
Sampriti Soor; Suklav Ghosh; Arijit Sur - [49%] Beyond the Benchmark: Innovative Defenses Against Prompt Injection Attacks
Safwan Shaheer; G. M. Refatul Islam; Mohammad Rafid Hamid; Tahsin Zaman Jilan - [49%] Neutralization of IMU-Based GPS Spoofing Detection using external IMU sensor and feedback methodology
Ji Hyuk Jung; Ji Won Yoon - [48%] TPV: Parameter Perturbations Through the Lens of Test Prediction Variance
Devansh Arpit - [48%] Quantifying Return on Security Controls in LLM Systems
Richard Helder Moulton; Austin O'Brien; John D. Hastings - [47%] From Risk to Resilience: Towards Assessing and Mitigating the Risk of Data Reconstruction Attacks in Federated Learning
Xiangrui Xu; Zhize Li; Yufei Han; Bin Wang; Jiqiang Liu; Wei Wang - [47%] Privacy-Preserving Semantic Communications via Multi-Task Learning and Adversarial Perturbations
Yalin E. Sagduyu; Tugba Erpek; Aylin Yener; Sennur Ulukus - [46%] NetDeTox: Adversarial and Efficient Evasion of Hardware-Security GNNs via RL-LLM Orchestration
Zeng Wang; Minghao Shao; Akashdeep Saha; Ramesh Karri; Johann Knechtel; Muhammad Shafique; Ozgur Sinanoglu - [46%] Faster Verified Explanations for Neural Networks
Alessandro De Palma; Greta Dolcetti; Caterina Urban - [46%] Projection-Free CNN Pruning via Frank-Wolfe with Momentum: Sparser Models with Less Pretraining
Hamza ElMokhtar Shili; Natasha Patnaik; Isabelle Ruble; Kathryn Jarjoura; Daniel Suarez Aguirre - [46%] Interpreting Structured Perturbations in Image Protection Methods for Diffusion Models
Michael R. Martin; Garrick Chan; Kwan-Liu Ma - [46%] Read or Ignore? A Unified Benchmark for Typographic-Attack Robustness and Text Recognition in Vision-Language Models
Futa Waseda; Shojiro Yamabe; Daiki Shiono; Kento Sasaki; Tsubasa Takahashi - [46%] STACHE: Local Black-Box Explanations for Reinforcement Learning Policies
Andrew Elashkin; Orna Grumberg - [46%] Stealth and Evasion in Rogue AP Attacks: An Analysis of Modern Detection and Bypass Techniques
Kaleb Bacztub; Braden Vester; Matteo Hodge; Liulseged Abate - [46%] The Laminar Flow Hypothesis: Detecting Jailbreaks via Semantic Turbulence in Large Language Models
Md. Hasib Ur Rahman - [46%] MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking
Jianyi Zhang; Shizhao Liu; Ziyin Zhou; Zhen Li - [45%] PrunedCaps: A Case For Primary Capsules Discrimination
Ramin Sharifi; Pouya Shiri; Amirali Baniasadi - [45%] UACER: An Uncertainty-Adaptive Critic Ensemble Framework for Robust Adversarial Reinforcement Learning
Jiaxi Wu; Tiantian Zhang; Yuxing Wang; Yongzhe Chang; Xueqian Wang - [44%] Safe2Harm: Semantic Isomorphism Attacks for Jailbreaking Large Language Models
Fan Yang - [44%] HOLE: Homological Observation of Latent Embeddings for Neural Network Interpretability
Sudhanva Manjunath Athreya; Paul Rosen - [44%] Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring
Peichun Hua; Hao Li; Shanghao Shi; Zhiyuan Yu; Ning Zhang - [44%] Pixel Seal: Adversarial-only training for invisible image and video watermarking
Tomáš Souček; Pierre Fernandez; Hady Elsahar; Sylvestre-Alvise Rebuffi; Valeriu Lacatusu; Tuan Tran; Tom Sander; Alexandre Mourachko - [44%] Fundamental Novel Consistency Theory: $H$-Consistency Bounds
Yutao Zhong - [43%] The Trojan Knowledge: Bypassing Commercial LLM Guardrails via Harmless Prompt Weaving and Adaptive Tree Search
Rongzhe Wei; Peizhi Niu; Xinjie Shen; Tony Tu; Yifan Li; Ruihan Wu; Eli Chien; Pin-Yu Chen; Olgica Milenkovic; Pan Li - [43%] TradeTrap: Are LLM-based Trading Agents Truly Reliable and Faithful?
Lewen Yan; Jilin Mei; Tianyi Zhou; Lige Huang; Jie Zhang; Dongrui Liu; Jing Shao - [43%] ObliInjection: Order-Oblivious Prompt Injection Attack to LLM Agents with Multi-source Data
Reachal Wang; Yuqi Jia; Neil Zhenqiang Gong - [43%] How to Trick Your AI TA: A Systematic Study of Academic Jailbreaking in LLM Code Evaluation
Devanshu Sahoo; Vasudev Majhi; Arjun Neekhra; Yash Sinha; Murari Mandal; Dhruv Kumar - [43%] When Reject Turns into Accept: Quantifying the Vulnerability of LLM-Based Scientific Reviewers to Indirect Prompt Injection
Devanshu Sahoo; Manish Prasad; Vasudev Majhi; Jahnvi Singh; Vinay Chamola; Yash Sinha; Murari Mandal; Dhruv Kumar - [43%] Persistent Backdoor Attacks under Continual Fine-Tuning of LLMs
Jing Cui; Yufei Han; Jianbin Jiao; Junge Zhang - [43%] Intrusion Detection in Internet of Vehicles Using Machine Learning
Hop Le; Izzat Alsmadi - [43%] Adversarial versification in portuguese as a jailbreak operator in LLMs
Joao Queiroz - [43%] CoTDeceptor:Adversarial Code Obfuscation Against CoT-Enhanced LLM Code Agents
Haoyang Li; Mingjin Li; Jinxin Zuo; Siqi Li; Xiao Li; Hao Wu; Yueming Lu; Xiaochuan He - [42%] Contextual Image Attack: How Visual Context Exposes Multimodal Safety Vulnerabilities
Yuan Xiong; Ziqi Miao; Lijun Li; Chen Qian; Jie Li; Jing Shao - [42%] Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs
Tengyun Ma; Jiaqi Yao; Daojing He; Shihao Peng; Yu Li; Shaohui Liu; Zhuotao Tian - [42%] RunawayEvil: Jailbreaking the Image-to-Video Generative Models
Songping Wang; Rufan Qian; Yueming Lyu; Qinglong Liu; Linzhuang Zou; Jie Qin; Songhua Liu; Caifeng Shan - [42%] Cognitive Control Architecture (CCA): A Lifecycle Supervision Framework for Robustly Aligned AI Agents
Zhibo Liang; Tianze Hu; Zaiye Chen; Mingjie Tang - [42%] A Novel Wasserstein Quaternion Generative Adversarial Network for Color Image Generation
Zhigang Jia; Duan Wang; Hengkai Wang; Yajun Xie; Meixiang Zhao; Xiaoyu Zhao - [42%] AegisAgent: An Autonomous Defense Agent Against Prompt Injection Attacks in LLM-HARs
Yihan Wang; Huanqi Yang; Shantanu Pal; Weitao Xu - [42%] HWL-HIN: A Hypergraph-Level Hypergraph Isomorphism Network as Powerful as the Hypergraph Weisfeiler-Lehman Test with Application to Higher-Order Network Robustness
Chengyu Tian; Wenbin Pei - [42%] Deep Probabilistic Supervision for Image Classification
Anton Adelöw; Matteo Gamba; Atsuto Maki - [41%] Neural Chameleons: Language Models Can Learn to Hide Their Thoughts from Unseen Activation Monitors
Max McGuinness; Alex Serrano; Luke Bailey; Scott Emmons - [41%] Dual Attention Guided Defense Against Malicious Edits
Jie Zhang; Shuai Dong; Shiguang Shan; Xilin Chen - [41%] Machine Learning Power Side-Channel Attack on SNOW-V
Deepak; Rahul Balout; Anupam Golder; Suparna Kundu; Angshuman Karmakar; Debayan Das - [41%] M-ErasureBench: A Comprehensive Multimodal Evaluation Benchmark for Concept Erasure in Diffusion Models
Ju-Hsuan Weng; Jia-Wei Liao; Cheng-Fu Chou; Jun-Cheng Chen - [41%] Self-Supervised Neural Architecture Search for Multimodal Deep Neural Networks
Shota Suzuki; Satoshi Ono - [40%] Tuning for TraceTarnish: Techniques, Trends, and Testing Tangible Traits
Robert Dilworth - [40%] Auto-SPT: Automating Semantic Preserving Transformations for Code
Ashish Hooda; Mihai Christodorescu; Chuangang Ren; Aaron Wilson; Kassem Fawaz; Somesh Jha - [40%] On the Bayes Inconsistency of Disagreement Discrepancy Surrogates
Neil G. Marchant; Andrew C. Cullen; Feng Liu; Sarah M. Erfani - [40%] How a Bit Becomes a Story: Semantic Steering via Differentiable Fault Injection
Zafaryab Haider; Md Hafizur Rahman; Shane Moeykens; Vijay Devabhaktuni; Prabuddha Chakraborty - [40%] Frequency Regularization: Unveiling the Spectral Inductive Bias of Deep Neural Networks
Jiahao Lu
2025-11 (263 papers)
- [100%] Parameter Interpolation Adversarial Training for Robust Image Classification
Xin Liu; Yichen Yang; Kun He; John E. Hopcroft - [100%] Protecting the Neural Networks against FGSM Attack Using Machine Unlearning
Amir Hossein Khorasani; Ali Jahanian; Maryam Rastgarpour - [100%] Deep learning models are vulnerable, but adversarial examples are even more vulnerable
Jun Li; Yanwei Xu; Keran Li; Xiaoli Zhang - [100%] DeepDefense: Layer-Wise Gradient-Feature Alignment for Building Robust Neural Networks
Ci Lin; Tet Yeap; Iluju Kiringa; Biwei Zhang - [99%] Enhancing Adversarial Transferability in Visual-Language Pre-training Models via Local Shuffle and Sample-based Attack
Xin Liu; Aoyang Zhou; Aoyang Zhou - [99%] Beyond Deceptive Flatness: Dual-Order Solution for Strengthening Adversarial Transferability
Zhixuan Zhang; Pingyu Wang; Xingjian Zheng; Linbo Qing; Qi Liu - [99%] Diffusion Guided Adversarial State Perturbations in Reinforcement Learning
Xiaolin Sun; Feidi Liu; Zhengming Ding; ZiZhan Zheng - [99%] Diversifying Counterattacks: Orthogonal Exploration for Robust CLIP Inference
Chengze Jiang; Minjing Dong; Xinli Shi; Jie Gui - [99%] Angular Gradient Sign Method: Uncovering Vulnerabilities in Hyperbolic Networks
Minsoo Jo; Dongyoon Yang; Taesup Kim - [99%] Certified but Fooled! Breaking Certified Defences with Ghost Certificates
Quoc Viet Vo; Tashreque M. Haq; Paul Montague; Tamas Abraham; Ehsan Abbasnejad; Damith C. Ranasinghe - [99%] SoK: Critical Evaluation of Quantum Machine Learning for Adversarial Robustness
Saeefa Rubaiyet Nowmi; Jesus Lopez; Md Mahmudul Alam Imon; Shahrooz Pouryousef; Mohammad Saidur Rahman - [99%] TopoReformer: Mitigating Adversarial Attacks Using Topological Purification in OCR Models
Bhagyesh Kumar; A S Aravinthakashan; Akshat Satyanarayan; Ishaan Gakhar; Ujjwal Verma - [98%] A Generative Adversarial Approach to Adversarial Attacks Guided by Contrastive Language-Image Pre-trained Model
Sampriti Soor; Alik Pramanick; Jothiprakash K; Arijit Sur - [98%] destroR: A Benchmark and Adversarial-Training Defense for Bangla Transfer Models under Meaning-Preserving Attacks
Saadat Rafid Ahmed; Rubayet Shareen; Radoan Sharkar; Nazia Hossain; Mansur Mahi; Farig Yousuf Sadeque - [98%] Towards Trustworthy Wi-Fi CSI-based Sensing: Systematic Evaluation of Adversarial Robustness
Shreevanth Krishnaa Gopalakrishnan; Stephen Hailes - [97%] Diffusion Models are Robust Pretrainers
Mika Yagoda; Shady Abu-Hussein; Raja Giryes - [97%] Invisible Triggers, Visible Threats! Road-Style Adversarial Creation Attack for Visual 3D Detection in Autonomous Driving
Jian Wang; Lijun He; Yixing Yong; Haixia Bi; Fan Li - [97%] SIFT-Graph: Benchmarking Multimodal Defense Against Image Adversarial Attacks With Robust Feature Graph
Jingjie He; Weijie Liang; Zihan Shan; Matthew Caesar - [97%] Debiased Dual-Invariant Defense for Adversarially Robust Person Re-Identification
Yuhang Zhou; Yanxiang Zhao; Zhongyun Hua; Zhipu Liu; Zhaoquan Gu; Qing Liao; Leo Yu Zhang - [97%] Trapped by Their Own Light: Deployable and Stealth Retroreflective Patch Attacks on Traffic Sign Recognition Systems
Go Tsuruoka; Takami Sato; Qi Alfred Chen; Kazuki Nomoto; Ryunosuke Kobayashi; Yuna Tanaka; Tatsuya Mori - [97%] Calibrated Adversarial Sampling: Multi-Armed Bandit-Guided Generalization Against Unforeseen Attacks
Rui Wang; Zeming Wei; Xiyue Zhang; Meng Sun - [97%] Enhancing All-to-X Backdoor Attacks with Optimized Target Class Mapping
Lei Wang; Yulong Tian; Hao Han; Fengyuan Xu - [97%] Cheating Stereo Matching in Full-scale: Physical Adversarial Attack against Binocular Depth Estimation in Autonomous Driving
Kangqiao Zhao; Shuo Huai; Xurui Song; Jun Luo - [97%] Attacking Autonomous Driving Agents with Adversarial Machine Learning: A Holistic Evaluation with the CARLA Leaderboard
Henry Wong; Clement Fung; Weiran Lin; Karen Li; Stanley Chen; Lujo Bauer - [97%] ABLE: Using Adversarial Pairs to Construct Local Models for Explaining Model Predictions
Krishna Khadka; Sunny Shree; Pujan Budhathoki; Yu Lei; Raghu Kacker; D. Richard Kuhn - [96%] SAAIPAA: Optimizing aspect-angles-invariant physical adversarial attacks on SAR target recognition models
Isar Lemeire; Yee Wei Law; Sang-Heon Lee; William Meakin; Tat-Jun Chin - [96%] Quantifying the Risk of Transferred Black Box Attacks
Disesdi Susanna Cox; Niklas Bunzel - [96%] Abstract Gradient Training: A Unified Certification Framework for Data Poisoning, Unlearning, and Differential Privacy
Philip Sosnin; Matthew Wicker; Josh Collyer; Calvin Tsay - [96%] CertMask: Certifiable Defense Against Adversarial Patches via Theoretically Optimal Mask Coverage
Xuntao Lyu; Ching-Chi Lin; Abdullah Al Arafat; Georg von der Brüggen; Jian-Jia Chen; Zhishan Guo - [96%] Volatility in Certainty (VC): A Metric for Detecting Adversarial Perturbations During Inference in Neural Network Classifiers
Vahid Hemmati; Ahmad Mohammadi; Abdul-Rauf Nuhu; Reza Ahmari; Parham Kebria; Abdollah Homaifar - [96%] Accuracy is Not Enough: Poisoning Interpretability in Federated Learning via Color Skew
Farhin Farhad Riya; Shahinul Hoque; Jinyuan Stella Sun; Olivera Kotevska - [96%] Dynamic Black-box Backdoor Attacks on IoT Sensory Data
Ajesh Koyatan Chathoth; Stephen Lee - [96%] Vulnerability-Aware Robust Multimodal Adversarial Training
Junrui Zhang; Xinyu Zhao; Jie Peng; Chenjie Wang; Jianmin Ji; Tianlong Chen - [96%] Ensuring Calibration Robustness in Split Conformal Prediction Under Adversarial Attacks
Xunlei Qian; Yue Xing - [96%] Targeted Manipulation: Slope-Based Attacks on Financial Time-Series Data
Dominik Luszczynski - [96%] Attention-Guided Patch-Wise Sparse Adversarial Attacks on Vision-Language-Action Models
Naifu Zhang; Wei Tao; Xi Xiao; Qianpu Sun; Yuxin Zheng; Wentao Mo; Peiqiang Wang; Nan Zhang - [95%] Enhancing Adversarial Transferability by Balancing Exploration and Exploitation with Gradient-Guided Sampling
Zenghao Niu; Weicheng Xie; Siyang Song; Zitong Yu; Feng Liu; Linlin Shen - [95%] eXIAA: eXplainable Injections for Adversarial Attack
Leonardo Pesce; Jiawen Wei; Gianmarco Mengaldo - [95%] BackWeak: Backdooring Knowledge Distillation Simply with Weak Triggers and Fine-tuning
Shanmin Wang; Dongdong Zhao - [95%] When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models
Yuping Yan; Yuhan Xie; Yixin Zhang; Lingjuan Lyu; Handing Wang; Yaochu Jin - [95%] Medusa: Cross-Modal Transferable Adversarial Attacks on Multimodal Medical Retrieval-Augmented Generation
Yingjia Shang; Yi Liu; Huimin Wang; Furong Li; Wenfang Sun; Wu Chengyu; Yefeng Zheng - [95%] Adversarial Confusion Attack: Disrupting Multimodal Large Language Models
Jakub Hoscilowicz; Artur Janicki - [94%] T-MLA: A targeted multiscale log-exponential attack framework for neural image compression
Nikolay I. Kalmykov; Razan Dibo; Kaiyu Shen; Xu Zhonghan; Anh-Huy Phan; Yipeng Liu; Ivan Oseledets - [94%] Runtime Safety Monitoring of Deep Neural Networks for Perception: A Survey
Albert Schotschneider; Svetlana Pavlitska; J. Marius Zöllner - [94%] Filtered-ViT: A Robust Defense Against Multiple Adversarial Patch Attacks
Aja Khanal; Ahmed Faid; Apurva Narayan - [94%] SEBA: Sample-Efficient Black-Box Attacks on Visual Reinforcement Learning
Tairan Huang; Yulin Jin; Junxu Liu; Qingqing Ye; Haibo Hu - [94%] Hail to the Thief: Exploring Attacks and Defenses in Decentralised GRPO
Nikolay Blagoev; Oğuzhan Ersoy; Lydia Yiyu Chen - [94%] Transferable Dual-Domain Feature Importance Attack against AI-Generated Image Detector
Weiheng Zhu; Gang Cao; Jing Liu; Lifang Yu; Shaowei Weng - [94%] ATAC: Augmentation-Based Test-Time Adversarial Correction for CLIP
Linxiang Su; András Balogh - [94%] Adversarial Patch Attacks on Vision-Based Cargo Occupancy Estimation via Differentiable 3D Simulation
Mohamed Rissal Hedna; Sesugh Samuel Nder - [94%] When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
Hui Lu; Yi Yu; Yiming Yang; Chenyu Yi; Qixin Zhang; Bingquan Shen; Alex C. Kot; Xudong Jiang - [93%] MiniFool — Physics-Constraint-Aware Minimizer-Based Adversarial Attacks in Deep Neural Networks
Lucie Flek; Oliver Janik; Philipp Alexander Jung; Akbar Karimi; Timo Saala; Alexander Schmidt; Matthias Schott; Philipp Soldin; Matthias Thiesmeyer; Christopher Wiebusch; Ulrich Willemsen - [93%] CatBack: Universal Backdoor Attacks on Tabular Data via Categorical Encoding
Behrad Tajalli; Stefanos Koffas; Stjepan Picek - [93%] Enhancing Adversarial Robustness of IoT Intrusion Detection via SHAP-Based Attribution Fingerprinting
Dilli Prasad Sharma; Liang Xue; Xiaowei Sun; Xiaodong Lin; Pulei Xiong - [93%] Breaking the Adversarial Robustness-Performance Trade-off in Text Classification via Manifold Purification
Chenhao Dang; Jing Ma - [93%] Unsupervised Robust Domain Adaptation: Paradigm, Theory and Algorithm
Fuxiang Huang; Xiaowei Fu; Shiyu Ye; Lina Ma; Wen Li; Xinbo Gao; David Zhang; Lei Zhang - [93%] On Robustness of Linear Classifiers to Targeted Data Poisoning
Nakshatra Gupta; Sumanth Prabhu; Supratik Chakraborty; R Venkatesh - [93%] T2I-Based Physical-World Appearance Attack against Traffic Sign Recognition Systems in Autonomous Driving
Chen Ma; Ningfei Wang; Junhao Zheng; Qing Guo; Qian Wang; Qi Alfred Chen; Chao Shen - [92%] Breaking the Stealth-Potency Trade-off in Clean-Image Backdoors with Generative Trigger Optimization
Binyan Xu; Fan Yang; Di Tang; Xilin Dai; Kehuan Zhang - [92%] On the Trade-Off Between Transparency and Security in Adversarial Machine Learning
Lucas Fenaux; Christopher Srinivasa; Florian Kerschbaum - [92%] A Novel and Practical Universal Adversarial Perturbations against Deep Reinforcement Learning based Intrusion Detection Systems
H. Zhang; L. Zhang; G. Epiphaniou; C. Maple - [91%] Fragile by Design: On the Limits of Adversarial Defenses in Personalized Generation
Zhen Chen; Yi Zhang; Xiangyu Yin; Chengxuan Qin; Xingyu Zhao; Xiaowei Huang; Wenjie Ruan - [91%] Multi-Faceted Attack: Exposing Cross-Model Vulnerabilities in Defense-Equipped Vision-Language Models
Yijun Yang; Lichao Wang; Jianping Zhang; Chi Harold Liu; Lanqing Hong; Qiang Xu - [90%] Transferable Hypergraph Attack via Injecting Nodes into Pivotal Hyperedges
Meixia He; Peican Zhu; Le Cheng; Yangming Guo; Manman Yuan; Keke Tang - [90%] Shedding Light on VLN Robustness: A Black-box Framework for Indoor Lighting-based Adversarial Attack
Chenyang Li; Wenbing Tang; Yihao Huang; Sinong Simon Zhan; Ming Hu; Xiaojun Jia; Yang Liu - [90%] PEPPER: Perception-Guided Perturbation for Robust Backdoor Defense in Text-to-Image Diffusion Models
Oscar Chew; Po-Yi Lu; Jayden Lin; Kuan-Hao Huang; Hsuan-Tien Lin - [89%] GRAPHTEXTACK: A Realistic Black-Box Node Injection Attack on LLM-Enhanced GNNs
Jiaji Ma; Puja Trivedi; Danai Koutra - [89%] Robust Defense Strategies for Multimodal Contrastive Learning: Efficient Fine-tuning Against Backdoor Attacks
Md. Iqbal Hossain; Afia Sajeeda; Neeresh Kumar Perla; Ming Shao - [89%] An Image Is Worth Ten Thousand Words: Verbose-Text Induction Attacks on VLMs
Zhi Luo; Zenghui Yuan; Wenqi Wei; Daizong Liu; Pan Zhou - [89%] Q-MLLM: Vector Quantization for Robust Multimodal Large Language Model Security
Wei Zhao; Zhe Li; Yige Li; Jun Sun - [88%] Adversarially Robust and Interpretable Magecart Malware Detection
Pedro Pereira; José Gouveia; João Vitorino; Eva Maia; Isabel Praça - [88%] MTAttack: Multi-Target Backdoor Attacks against Large Vision-Language Models
Zihan Wang; Guansong Pang; Wenjun Miao; Jin Zheng; Xiao Bai - [88%] Robust Decentralized Multi-armed Bandits: From Corruption-Resilience to Byzantine-Resilience
Zicheng Hu; Yuchen Wang; Cheng Chen - [88%] MPD-SGR: Robust Spiking Neural Networks with Membrane Potential Distribution-Driven Surrogate Gradient Regularization
Runhao Jiang; Chengzhi Jiang; Rui Yan; Huajin Tang - [88%] Semantics as a Shield: Label Disguise Defense (LDD) against Prompt Injection in LLM Sentiment Classification
Yanxi Li; Ruocheng Shan - [87%] Fixed-point graph convolutional networks against adversarial attacks
Shakib Khan; A. Ben Hamza; Amr Youssef - [87%] Adversarial Bias: Data Poisoning Attacks on Fairness
Eunice Chan; Hanghang Tong - [87%] Robust Backdoor Removal by Reconstructing Trigger-Activated Changes in Latent Representation
Kazuki Iwahana; Yusuke Yamasaki; Akira Ito; Takayuki Miura; Toshiki Shibahara - [87%] Multimodal Robust Prompt Distillation for 3D Point Cloud Models
Xiang Gu; Liming Lu; Xu Zheng; Anan Du; Yongbin Zhou; Shuchao Pang - [87%] RemedyGS: Defend 3D Gaussian Splatting against Computation Cost Attacks
Yanping Li; Zhening Liu; Zijian Li; Zehong Lin; Jun Zhang - [86%] PRBench: A Standardized Probabilistic Robustness Benchmark
Yi Zhang; Zheng Wang; Zhen Chen; Wenjie Ruan; Qing Guo; Siddartha Khastgir; Carsten Maple; Xingyu Zhao - [86%] From Insight to Exploit: Leveraging LLM Collaboration for Adaptive Adversarial Text Generation
Najrin Sultana; Md Rafi Ur Rashid; Kang Gu; Shagufta Mehnaz - [86%] Enhancing Robustness of Graph Neural Networks through p-Laplacian
Anuj Kumar Sirohi; Subhanu Halder; Kabir Kumar; Sandeep Kumar - [86%] SteganoBackdoor: Stealthy and Data-Efficient Backdoor Attacks on Language Models
Eric Xue; Ruiyi Zhang; Pengtao Xie - [85%] Robust Bidirectional Associative Memory via Regularization Inspired by the Subspace Rotation Algorithm
Ci Lin; Tet Yeap; Iluju Kiringa; Biwei Zhang - [85%] HV-Attack: Hierarchical Visual Attack for Multimodal Retrieval Augmented Generation
Linyin Luo; Yujuan Ding; Yunshan Ma; Wenqi Fan; Hanjiang Lai - [85%] Enhancing Adversarial Transferability through Block Stretch and Shrink
Quan Liu; Feng Ye; Chenhao Lu; Shuming Zhen; Guanliang Huang; Lunzhe Chen; Xudong Ke - [85%] FedPoisonTTP: A Threat Model and Poisoning Attack for Federated Test-Time Personalization
Md Akil Raihan Iftee; Syed Md. Ahnaf Hasan; Amin Ahsan Ali; AKM Mahbubur Rahman; Sajib Mistry; Aneesh Krishna - [84%] Injecting Falsehoods: Adversarial Man-in-the-Middle Attacks Undermining Factual Recall in LLMs
Alina Fastowski; Bardh Prenkaj; Yuxiao Li; Gjergji Kasneci - [84%] 3D-ANC: Adaptive Neural Collapse for Robust 3D Point Cloud Recognition
Yuanmin Huang; Wenxuan Li; Mi Zhang; Xiaohan Zhang; Xiaoyu You; Min Yang - [84%] Dataset Poisoning Attacks on Behavioral Cloning Policies
Akansha Kalra; Soumil Datta; Ethan Gilmore; Duc La; Guanhong Tao; Daniel S. Brown - [83%] Efficient Adversarial Malware Defense via Trust-Based Raw Override and Confidence-Adaptive Bit-Depth Reduction
Ayush Chaudhary; Sisir Doppalpudi - [83%] Breaking the Illusion: Consensus-Based Generative Mitigation of Adversarial Illusions in Multi-Modal Embeddings
Fatemeh Akbarian; Anahita Baninajjar; Yingyi Zhang; Ananth Balashankar; Amir Aminifar - [82%] More Agents Improve Math Problem Solving but Adversarial Robustness Gap Persists
Khashayar Alavi; Zhastay Yeltay; Lucie Flek; Akbar Karimi - [82%] Non-Parametric Probabilistic Robustness: A Conservative Risk Estimator under Unknown Perturbation Distributions
Zheng Wang; Yi Zhang; Siddartha Khastgir; Carsten Maple; Xingyu Zhao - [81%] From Pretrain to Pain: Adversarial Vulnerability of Video Foundation Models Without Task Knowledge
Hui Lu; Yi Yu; Song Xia; Yiming Yang; Deepu Rajan; Boon Poh Ng; Alex Kot; Xudong Jiang - [81%] Adversarial Attack-Defense Co-Evolution for LLM Safety Alignment via Tree-Group Dual-Aware Search and Optimization
Xurui Li; Kaisong Song; Rui Zhu; Pin-Yu Chen; Haixu Tang - [80%] Do Methods to Jailbreak and Defend LLMs Generalize Across Languages?
Berk Atil; Rebecca J. Passonneau; Fred Morstatter - [80%] Rescuing the Unpoisoned: Efficient Defense against Knowledge Corruption Attacks on RAG Systems
Minseok Kim; Hankook Lee; Hyungjoon Koo - [80%] Class-feature Watermark: A Resilient Black-box Watermark Against Model Extraction Attacks
Yaxin Xiao; Qingqing Ye; Zi Liang; Haoyang Li; RongHua Li; Huadi Zheng; Haibo Hu - [80%] Speech-Audio Compositional Attacks on Multimodal LLMs and Their Mitigation with SALMONN-Guard
Yudong Yang; Xuezhen Zhang; Zhifeng Han; Siyin Wang; Jimin Zhuang; Zengrui Jin; Jing Shao; Guangzhi Sun; Chao Zhang - [80%] Data Poisoning Vulnerabilities Across Healthcare AI Architectures: A Security Threat Analysis
Farhad Abtahi; Fernando Seoane; Iván Pau; Mario Vega-Barbas - [79%] "Give a Positive Review Only": An Early Investigation Into In-Paper Prompt Injection Attacks and Defenses for AI Reviewers
Qin Zhou; Zhexin Zhang; Zhi Li; Limin Sun - [79%] Boosting Adversarial Transferability via Ensemble Non-Attention
Yipeng Zou; Qin Liu; Jie Wu; Yu Peng; Guo Chen; Hui Zhou; Guanghui Ye - [79%] AlignTree: Efficient Defense Against LLM Jailbreak Attacks
Gil Goren; Shahar Katz; Lior Wolf - [79%] Robust Physical Adversarial Patches Using Dynamically Optimized Clusters
Harrison Bagley; Will Meakin; Simon Lucey; Yee Wei Law; Tat-Jun Chin - [78%] Friend or Foe: How LLMs' Safety Mind Gets Fooled by Intent Shift Attack
Peng Ding; Jun Kuang; Wen Sun; Zongyu Wang; Xuezhi Cao; Xunliang Cai; Jiajun Chen; Shujian Huang - [78%] Scam Shield: Multi-Model Voting and Fine-Tuned LLMs Against Adversarial Attacks
Chen-Wei Chang; Shailik Sarkar; Hossein Salemi; Hyungmin Kim; Shutonu Mitra; Hemant Purohit; Fengxiu Zhang; Michin Hong; Jin-Hee Cho; Chang-Tien Lu - [78%] RAG-targeted Adversarial Attack on LLM-based Threat Detection and Mitigation Framework
Seif Ikbarieh; Kshitiz Aryal; Maanak Gupta - [78%] Certified L2-Norm Robustness of 3D Point Cloud Recognition in the Frequency Domain
Liang Zhou; Qiming Wang; Tianze Chen - [77%] PSM: Prompt Sensitivity Minimization via LLM-Guided Black-Box Optimization
Huseein Jawad; Nicolas Brunel - [77%] CAHS-Attack: CLIP-Aware Heuristic Search Attack Method for Stable Diffusion
Shuhan Xia; Jing Dai; Hui Ouyang; Yadong Shang; Dongxiao Zhao; Peipei Li - [76%] Exploiting Latent Space Discontinuities for Building Universal LLM Jailbreaks and Data Extraction Attacks
Kayua Oleques Paim; Rodrigo Brandao Mansilha; Diego Kreutz; Muriel Figueredo Franco; Weverton Cordeiro - [76%] Unveiling Hidden Threats: Using Fractal Triggers to Boost Stealthiness of Distributed Backdoor Attacks in Federated Learning
Jian Wang; Hong Shen; Chan-Tong Lam - [76%] HealSplit: Towards Self-Healing through Adversarial Distillation in Split Federated Learning
Yuhan Xie; Chen Lyu - [76%] Jailbreaking Large Vision Language Models in Intelligent Transportation Systems
Badhan Chandra Das; Md Tasnim Jawad; Md Jueal Mia; M. Hadi Amini; Yanzhao Wu - [76%] Frequency Bias Matters: Diving into Robust and Generalized Deep Image Forgery Detection
Chi Liu; Tianqing Zhu; Wanlei Zhou; Wei Zhao - [76%] Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks
Richard J. Young - [75%] Adapt under Attack and Domain Shift: Unified Adversarial Meta-Learning and Domain Adaptation for Robust Automatic Modulation Classification
Ali Owfi; Amirmohammad Bamdad; Tolunay Seyfi; Fatemeh Afghah - [75%] Phantom Menace: Exploring and Enhancing the Robustness of VLA Models Against Physical Sensor Attacks
Xuancun Lu; Jiaxiang Chen; Shilin Xiao; Zizhi Jin; Zhangrui Chen; Hanwen Yu; Bohan Qian; Ruochen Zhou; Xiaoyu Ji; Wenyuan Xu - [75%] Physically Realistic Sequence-Level Adversarial Clothing for Robust Human-Detection Evasion
Dingkun Zhou; Patrick P. K. Chan; Hengxu Wu; Shikang Zheng; Ruiqi Huang; Yuanjie Zhao - [75%] Distillability of LLM Security Logic: Predicting Attack Success Rate of Outline Filling Attack via Ranking Regression
Tianyu Zhang; Zihang Xi; Jingyu Hua; Sheng Zhong - [74%] LoReTTA: A Low Resource Framework To Poison Continuous Time Dynamic Graphs
Himanshu Pal; Venkata Sai Pranav Bachina; Ankit Gangwal; Charu Sharma - [74%] A Robust and Explainable Transformer-Based Framework for Phishing Email Detection
Sajad U P - [73%] SPARK: Jailbreaking T2V Models by Synergistically Prompting Auditory and Recontextualized Knowledge
Zonghao Ying; Moyang Chen; Nizhang Li; Zhiqiang Wang; Wenxin Zhang; Quanchen Zou; Zonglei Jing; Aishan Liu; Xianglong Liu - [72%] Probably Approximately Global Robustness Certification
Peter Blohm; Patrick Indri; Thomas Gärtner; Sagar Malhotra - [72%] Rethinking Deep Alignment Through The Lens Of Incomplete Learning
Thong Bach; Dung Nguyen; Thao Minh Le; Truyen Tran - [72%] Illuminating the Black Box: Real-Time Monitoring of Backdoor Unlearning in CNNs via Explainable AI
Tien Dat Hoang - [71%] Black-Box Membership Inference Attack for LVLMs via Prior Knowledge-Calibrated Memory Probing
Jinhua Yin; Peiru Yang; Chen Yang; Huili Wang; Zhiyang Hu; Shangguang Wang; Yongfeng Huang; Tao Qi - [71%] Robust and Diverse Multi-Agent Learning via Rational Policy Gradient
Niklas Lauffer; Ameesh Shah; Micah Carroll; Sanjit A. Seshia; Stuart Russell; Michael Dennis - [71%] MOBA: A Material-Oriented Backdoor Attack against LiDAR-based 3D Object Detection Systems
Saket S. Chaturvedi; Gaurav Bagwe; Lan Zhang; Pan He; Xiaoyong Yuan - [70%] Provable Repair of Deep Neural Network Defects by Preimage Synthesis and Property Refinement
Jianan Ma; Jingyi Wang; Qi Xuan; Zhen Wang - [70%] STONE: Pioneering the One-to-N Universal Backdoor Threat in 3D Point Cloud
Dongmei Shan; Wei Lian; Chongxia Wang - [70%] SoK: The Last Line of Defense: On Backdoor Defense Evaluation
Gorka Abad; Marina Krček; Stefanos Koffas; Behrad Tajalli; Marco Arazzi; Roberto Riaño; Xiaoyun Xu; Zhuoran Liu; Antonino Nocera; Stjepan Picek - [69%] BlurGuard: A Simple Approach for Robustifying Image Protection Against AI-Powered Editing
Jinsu Kim; Yunhun Nam; Minseon Kim; Sangpil Kim; Jongheon Jeong - [69%] Potent but Stealthy: Rethink Profile Pollution against Sequential Recommendation via Bi-level Constrained Reinforcement Paradigm
Jiajie Su; Zihan Nan; Yunshan Ma; Xiaobo Xia; Xiaohua Feng; Weiming Liu; Xiang Chen; Xiaolin Zheng; Chaochao Chen - [69%] Tight Robustness Certification Through the Convex Hull of $\ell_0$ Attacks
Yuval Shapira; Dana Drachsler-Cohen - [69%] ExplainableGuard: Interpretable Adversarial Defense for Large Language Models Using Chain-of-Thought Reasoning
Shaowei Guan; Yu Zhai; Zhengyu Zhang; Yanze Wang; Hin Chi Kwok - [69%] AutoBackdoor: Automating Backdoor Attacks via LLM Agents
Yige Li; Zhe Li; Wei Zhao; Nay Myat Min; Hanxun Huang; Xingjun Ma; Jun Sun - [69%] Layer-wise Noise Guided Selective Wavelet Reconstruction for Robust Medical Image Segmentation
Yuting Lu; Ziliang Wang; Weixin Xu; Wei Zhang; Yongqiang Zhao; Yang Yu; Xiaohong Zhang - [69%] MMT-ARD: Multimodal Multi-Teacher Adversarial Distillation for Robust Vision-Language Models
Yuqi Li; Junhao Dong; Chuanguang Yang; Shiping Wen; Piotr Koniusz; Tingwen Huang; Yingli Tian; Yew-Soon Ong - [69%] Are Neuro-Inspired Multi-Modal Vision-Language Models Resilient to Membership Inference Privacy Leakage?
David Amebley; Sayanton Dibbo - [69%] V-Attack: Targeting Disentangled Value Features for Controllable Adversarial Attacks on LVLMs
Sen Nie; Jie Zhang; Jianxin Yan; Shiguang Shan; Xilin Chen - [69%] The Double-Edged Nature of the Rashomon Set for Trustworthy Machine Learning
Ethan Hsu; Harry Chen; Chudi Zhong; Lesia Semenova - [68%] Improving Sustainability of Adversarial Examples in Class-Incremental Learning
Taifeng Liu; Xinjing Liu; Liangqiu Dong; Yang Liu; Yilong Yang; Zhuo Ma - [68%] Questioning the Stability of Visual Question Answering
Amir Rosenfeld; Neta Glazer; Ethan Fetaya - [67%] AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models
Jiayu Li; Yunhan Zhao; Xiang Zheng; Zonghuan Xu; Yige Li; Xingjun Ma; Yu-Gang Jiang - [67%] LLM Reinforcement in Context
Thomas Rivasseau - [67%] FLARE: Adaptive Multi-Dimensional Reputation for Robust Client Reliability in Federated Learning
Abolfazl Younesi; Leon Kiss; Zahra Najafabadi Samani; Juan Aznar Poveda; Thomas Fahringer - [67%] Creating Blank Canvas Against AI-enabled Image Forgery
Qi Song; Ziyuan Luo; Renjie Wan - [65%] DRIP: Defending Prompt Injection via Token-wise Representation Editing and Residual Instruction Fusion
Ruofan Liu; Yun Lin; Zhiyong Huang; Jin Song Dong - [65%] Membership Inference Attacks Beyond Overfitting
Mona Khalil; Alberto Blanco-Justicia; Najeeb Jebreel; Josep Domingo-Ferrer - [65%] Extracting Robust Register Automata from Neural Networks over Data Sequences
Chih-Duo Hong; Hongjian Jiang; Anthony W. Lin; Oliver Markgraf; Julian Parsert; Tony Tan - [65%] Exposing Vulnerabilities in RL: A Novel Stealthy Backdoor Attack through Reward Poisoning
Bokang Zhang; Chaojun Lu; Jianhui Li; Junfeng Wu - [64%] Formal Reasoning About Confidence and Automated Verification of Neural Networks
Mohammad Afzal; S. Akshay; Blaise Genest; Ashutosh Gupta - [64%] GuardFed: A Trustworthy Federated Learning Framework Against Dual-Facet Attacks
Yanli Li; Yanan Zhou; Zhongliang Guo; Nan Yang; Yuning Zhang; Huaming Chen; Dong Yuan; Weiping Ding; Witold Pedrycz - [64%] Tuning for Two Adversaries: Enhancing the Robustness Against Transfer and Query-Based Attacks using Hyperparameter Tuning
Pascal Zimmer; Ghassan Karame - [64%] Effective Code Membership Inference for Code Completion Models via Adversarial Prompts
Yuan Jiang; Zehao Li; Shan Huang; Christoph Treude; Xiaohong Su; Tiantian Wang - [64%] BackdoorVLM: A Benchmark for Backdoor Attacks on Vision-Language Models
Juncheng Li; Yige Li; Hanxun Huang; Yunhao Chen; Xin Wang; Yixu Wang; Xingjun Ma; Yu-Gang Jiang - [63%] Securing AI Agents Against Prompt Injection Attacks
Badrinath Ramakrishnan; Akshaya Balaji - [62%] Graph Representation-based Model Poisoning on the Heterogeneous Internet of Agents
Hanlin Cai; Houtianfu Wang; Haofan Dong; Kai Li; Sai Zou; Ozgur B. Akan - [62%] Cost-Minimized Label-Flipping Poisoning Attack to LLM Alignment
Shigeki Kusaka; Keita Saito; Mikoto Kudo; Takumi Tanabe; Akifumi Wachi; Youhei Akimoto - [62%] Robustness of LLM-enabled vehicle trajectory prediction under data security threats
Feilong Wang; Fuqiang Liu - [62%] GraphToxin: Reconstructing Full Unlearned Graphs from Graph Unlearning
Ying Song; Balaji Palanisamy - [62%] Backdoor Attacks on Open Vocabulary Object Detectors via Multi-Modal Prompt Tuning
Ankita Raj; Chetan Arora - [62%] From Black-Box to White-Box: Control-Theoretic Neural Network Interpretability
Jihoon Moon - [61%] IndirectAD: Practical Data Poisoning Attacks against Recommender Systems for Item Promotion
Zihao Wang; Tianhao Mao; XiaoFeng Wang; Di Tang; Xiaozhong Liu - [61%] AdaptDel: Adaptable Deletion Rate Randomized Smoothing for Certified Robustness
Zhuoqun Huang; Neil G. Marchant; Olga Ohrimenko; Benjamin I. P. Rubinstein - [61%] Adversarial Pseudo-replay for Exemplar-free Class-incremental Learning
Hiroto Honda - [61%] EAGER: Edge-Aligned LLM Defense for Robust, Efficient, and Accurate Cybersecurity Question Answering
Onat Gungor; Roshan Sood; Jiasheng Zhou; Tajana Rosing - [60%] Watch Out for the Lifespan: Evaluating Backdoor Attacks Against Federated Model Adaptation
Bastien Vuillod; Pierre-Alain Moellic; Jean-Max Dutertre - [60%] Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM
Adarsh Kumarappan; Ayushi Mehrotra - [60%] Defending Large Language Models Against Jailbreak Exploits with Responsible AI Considerations
Ryan Wong; Hosea David Yu Fei Ng; Dhananjai Sharma; Glenn Jun Jie Ng; Kavishvaran Srinivasan - [59%] Robust Face Liveness Detection for Biometric Authentication using Single Image
Poulami Raha; Yeongnam Chae - [59%] Black-Box Guardrail Reverse-engineering Attack
Hongwei Yao; Yun Xia; Shuo Shao; Haoran Shi; Tong Qiao; Cong Wang - [59%] Thermally Activated Dual-Modal Adversarial Clothing against AI Surveillance Systems
Jiahuan Long; Tingsong Jiang; Hanqing Liu; Chao Ma; Weien Zhou; Yang Yang; Wen Yao - [59%] Invisible Hands: Gray-Box Bit Flip Attack for Steering LLMs Without Knowledge of Gradients, Data, and Weights
Abeer Matar A. Almalky; Ziyan Wang; Mohaiminul Al Nahian; Li Yang; Adnan Siraj Rakin - [59%] A Game-Theoretic Approach for Adversarial Information Fusion in Distributed Sensor Networks
Kassem Kallas - [58%] A Non-Adversarial Approach to Idempotent Generative Modelling
Mohammed Al-Jaff; Giovanni Luca Marchetti; Michael C Welle; Jens Lundell; Mats G. Gustafsson; Gustav Eje Henter; Hossein Azizpour; Danica Kragic - [57%] TAMAS: Benchmarking Adversarial Risks in Multi-Agent LLM Systems
Ishan Kavathekar; Hemang Jain; Ameya Rathod; Ponnurangam Kumaraguru; Tanuja Ganu - [57%] JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework
Yuxuan Zhou; Yang Bai; Kuofeng Gao; Tao Dai; Shu-Tao Xia - [57%] Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio
Guangke Chen; Yuhui Wang; Shouling Ji; Xiapu Luo; Ting Wang - [56%] Introducing Nylon Face Mask Attacks: A Dataset for Evaluating Generalised Face Presentation Attack Detection
Manasa; Sushrut Patwardhan; Narayan Vetrekar; Pavan Kumar; R. S. Gad; Raghavendra Ramachandra - [56%] How Worrying Are Privacy Attacks Against Machine Learning?
Josep Domingo-Ferrer - [56%] Beyond Pixels: Semantic-aware Typographic Attack for Geo-Privacy Protection
Jiayi Zhu; Yihao Huang; Yue Cao; Xiaojun Jia; Qing Guo; Felix Juefei-Xu; Geguang Pu; Bin Wang - [56%] Evaluating Adversarial Vulnerabilities in Modern Large Language Models
Tom Perel - [56%] Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation
Changyue Li; Jiaying Li; Youliang Yuan; Jiaming He; Zhicong Huang; Pinjia He - [55%] Learning Fourier shapes to probe the geometric world of deep neural networks
Jian Wang; Yixing Yong; Haixia Bi; Lijun He; Fan Li - [55%] On Stealing Graph Neural Network Models
Marcin Podhajski; Jan Dubiński; Franziska Boenisch; Adam Dziedzic; Agnieszka Pręgowska; Tomasz P. Michalak - [55%] DeepTracer: Tracing Stolen Model via Deep Coupled Watermarks
Yunfei Yang; Xiaojun Chen; Yuexin Xuan; Zhendong Zhao; Xin Zhao; He Li - [55%] Dynamic Parameter Optimization for Highly Transferable Transformation-Based Attacks
Jiaming Liang; Chi-Man Pun - [55%] Addressing A Posteriori Performance Degradation in Neural Network Subgrid Stress Models
Andy Wu; Sanjiva K. Lele - [55%] BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents
Kaiyuan Zhang; Mark Tenenholtz; Kyle Polley; Jerry Ma; Denis Yarats; Ninghui Li - [55%] Exploring Dynamic Properties of Backdoor Training Through Information Bottleneck
Xinyu Liu; Xu Zhang; Can Chen; Ren Wang - [54%] ShadowLogic: Backdoors in Any Whitebox LLM
Kasimir Schulz; Amelia Kawasaki; Leo Ring - [54%] Is nasty noise actually harder than malicious noise?
Guy Blanc; Yizhi Huang; Tal Malkin; Rocco A. Servedio - [54%] Self-Guided Defense: Adaptive Safety Alignment for Reasoning Models via Synthesized Guidelines
Yuhang Wang; Yanxu Zhu; Dongyuan Lu; Jitao Sang - [54%] CacheTrap: Unveiling a Stealthier Gray-Box Trojan against LLMs
Mohaiminul Al Nahian; Abeer Matar A. Almalky; Gamana Aragonda; Ranyang Zhou; Sabbir Ahmed; Dmitry Ponomarev; Li Yang; Shaahin Angizi; Adnan Siraj Rakin - [53%] AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models
Aashray Reddy; Andrew Zagula; Nicholas Saban - [53%] Adaptive Sample-Level Framework Motivated by Distributionally Robust Optimization with Variance-Based Radius Assignment for Enhanced Neural Network Generalization Under Distribution Shift
Aheer Sravon; Devdyuti Mazumder; Md. Ibrahim - [53%] Optimal Welfare in Noncooperative Network Formation under Attack
Natan Doubez; Pascal Lenzner; Marcus Wunderlich - [53%] Unified Defense for Large Language Models against Jailbreak and Fine-Tuning Attacks in Education
Xin Yi; Yue Li; Dongsheng Shi; Linlin Wang; Xiaoling Wang; Liang He - [52%] ToxicTextCLIP: Text-Based Poisoning and Backdoor Attacks on CLIP Pre-training
Xin Yao; Haiyang Zhao; Yimin Chen; Jiawei Guo; Kecheng Huang; Ming Zhao - [52%] Adversarial Node Placement in Decentralized Federated Learning: Maximum Spanning-Centrality Strategy and Performance Analysis
Adam Piaseczny; Eric Ruzomberka; Rohit Parasnis; Christopher G. Brinton - [52%] Model Inversion Attack Against Deep Hashing
Dongdong Zhao; Qiben Xu; Ranxin Fang; Baogang Song - [52%] Uncovering and Aligning Anomalous Attention Heads to Defend Against NLP Backdoor Attacks
Haotian Jin; Yang Li; Haihui Fan; Lin Shen; Xiangfang Li; Bo Li - [52%] RegionMarker: A Region-Triggered Semantic Watermarking Framework for Embedding-as-a-Service Copyright Protection
Shufan Yang; Zifeng Cheng; Zhiwei Jiang; Yafeng Yin; Cong Wang; Shiping Ge; Yuchen Fu; Qing Gu - [52%] Towards Effective, Stealthy, and Persistent Backdoor Attacks Targeting Graph Foundation Models
Jiayi Luo; Qingyun Sun; Lingjuan Lyu; Ziwei Zhang; Haonan Yuan; Xingcheng Fu; Jianxin Li - [51%] Associative Poisoning to Generative Machine Learning
Mathias Lundteigen Mohus; Jingyue Li; Zhirong Yang - [51%] CGCE: Classifier-Guided Concept Erasure in Generative Models
Viet Nguyen; Vishal M. Patel - [51%] A methodological analysis of prompt perturbations and their effect on attack success rates
Tiago Machado; Maysa Malfiza Garcia de Macedo; Rogerio Abreu de Paula; Marcelo Carpinette Grave; Aminat Adebiyi; Luan Soares de Souza; Enrico Santarelli; Claudio Pinhanez - [50%] MedFedPure: A Medical Federated Framework with MAE-based Detection and Diffusion Purification for Inference-Time Attacks
Mohammad Karami; Mohammad Reza Nemati; Aidin Kazemi; Ali Mikaeili Barzili; Hamid Azadegan; Behzad Moshiri - [50%] KG-DF: A Black-box Defense Framework against Jailbreak Attacks Based on Knowledge Graphs
Shuyuan Liu; Jiawei Chen; Xiao Yang; Hang Su; Zhaoxia Yin - [50%] MSCR: Exploring the Vulnerability of LLMs' Mathematical Reasoning Abilities Using Multi-Source Candidate Replacement
Zhishen Sun; Guang Dai; Haishan Ye - [49%] Bit-Flipping Attack Exploration and Countermeasure in 5G Network
Joon Kim; Chengwei Duan; Sandip Ray - [49%] Adversarially Robust Multitask Adaptive Control
Kasra Fallah; Leonardo F. Toso; James Anderson - [49%] Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
Zimo Ji; Xunguang Wang; Zongjie Li; Pingchuan Ma; Yudong Gao; Daoyuan Wu; Xincheng Yan; Tian Tian; Shuai Wang - [49%] Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models
Piercosma Bisconti; Matteo Prandi; Federico Pierucci; Francesco Giarrusso; Marcantonio Bracale Syrnikov; Marcello Galisai; Vincenzo Suriani; Olga Sorokoletova; Federico Sartore; Daniele Nardi - [48%] Byzantine-Robust Federated Learning with Learnable Aggregation Weights
Javad Parsa; Amir Hossein Daghestani; André M. H. Teixeira; Mikael Johansson - [48%] E2E-VGuard: Adversarial Prevention for Production LLM-based End-To-End Speech Synthesis
Zhisheng Zhang; Derui Wang; Yifan Mi; Zhiyong Wu; Jie Gao; Yuxin Cao; Kai Ye; Minhui Xue; Jie Hao - [48%] Privacy on the Fly: A Predictive Adversarial Transformation Network for Mobile Sensor Data
Tianle Song; Chenhao Lin; Yang Cao; Zhengyu Zhao; Jiahao Sun; Chong Zhang; Le Yang; Chao Shen - [48%] LANE: Lexical Adversarial Negative Examples for Word Sense Disambiguation
Jader Martins Camboim de Sá; Jooyoung Lee; Cédric Pruski; Marcos Da Silveira - [47%] Evaluating Control Protocols for Untrusted AI Agents
Jon Kutasov; Chloe Loughridge; Yuqi Sun; Henry Sleight; Buck Shlegeris; Tyler Tracy; Joe Benton - [47%] Consensus Sampling for Safer Generative AI
Adam Tauman Kalai; Yael Tauman Kalai; Or Zamir - [47%] Shortcut Invariance: Targeted Jacobian Regularization in Disentangled Latent Space
Shivam Pal; Sakshi Varshney; Piyush Rai - [46%] Towards Provably Unlearnable Examples via Bayes Error Optimisation
Ruihan Zhang; Jun Sun; Ee-Peng Lim; Peixin Zhang - [46%] Why does weak-OOD help? A Further Step Towards Understanding Jailbreaking VLMs
Yuxuan Zhou; Yuzhao Peng; Yang Bai; Kuofeng Gao; Yihao Zhang; Yechao Zhang; Xun Chen; Tao Yu; Tao Dai; Shu-Tao Xia - [46%] Enhanced Privacy Leakage from Noise-Perturbed Gradients via Gradient-Guided Conditional Diffusion Models
Jiayang Meng; Tao Huang; Hong Chen; Chen Hou; Guolong Zheng - [46%] Vision Language Models are Confused Tourists
Patrick Amadeus Irawan; Ikhlasul Akmal Hanif; Muhammad Dehan Al Kautsar; Genta Indra Winata; Fajri Koto; Alham Fikri Aji - [45%] Random Spiking Neural Networks are Stable and Spectrally Simple
Ernesto Araya; Massimiliano Datres; Gitta Kutyniok - [45%] Machine and Deep Learning for Indoor UWB Jammer Localization
Hamed Fard; Mahsa Kholghi; Benedikt Groß; Gerhard Wunder - [45%] Rebellion: Noise-Robust Reasoning Training for Audio Reasoning Models
Tiansheng Huang; Virat Shejwalkar; Oscar Chang; Milad Nasr; Ling Liu - [45%] The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks
Chunyang Li; Zifeng Kang; Junwei Zhang; Zhuo Ma; Anda Cheng; Xinghua Li; Jianfeng Ma - [45%] UniGame: Turning a Unified Multimodal Model Into Its Own Adversary
Zhaolong Su; Wang Lu; Hao Chen; Sharon Li; Jindong Wang - [44%] Analyzing and Mitigating Negation Artifacts using Data Augmentation for Improving ELECTRA-Small Model Accuracy
Mojtaba Noghabaei - [44%] Improving Perturbation-based Explanations by Understanding the Role of Uncertainty Calibration
Thomas Decker; Volker Tresp; Florian Buettner - [44%] PISanitizer: Preventing Prompt Injection to Long-Context LLMs via Prompt Sanitization
Runpeng Geng; Yanting Wang; Chenlong Yin; Minhao Cheng; Ying Chen; Jinyuan Jia - [44%] Learning Fair Representations with Kolmogorov-Arnold Networks
Amisha Priyadarshini; Sergio Gago-Masague - [43%] BadThink: Triggered Overthinking Attacks on Chain-of-Thought Reasoning in Large Language Models
Shuaitong Liu; Renjue Li; Lijia Yu; Lijun Zhang; Zhiming Liu; Gaojie Jin - [43%] Incentive Attacks in BTC: Short-Term Revenue Changes and Long-Term Efficiencies
Mustafa Doger; Sennur Ulukus - [43%] "To Survive, I Must Defect": Jailbreaking LLMs via the Game-Theory Scenarios
Zhen Sun; Zongmin Zhang; Deqi Liang; Han Sun; Yule Liu; Yun Shen; Xiangshan Gao; Yilong Yang; Shuai Liu; Yutao Yue; Xinlei He - [43%] Shadows in the Code: Exploring the Risks and Defenses of LLM-based Multi-Agent Software Development Systems
Xiaoqing Wang; Keman Huang; Bin Liang; Hongyu Li; Xiaoyong Du - [42%] PADBen: A Comprehensive Benchmark for Evaluating AI Text Detectors Against Paraphrase Attacks
Yiwei Zha; Rui Min; Shanu Sushmita - [42%] Red-teaming Activation Probes using Prompted LLMs
Phil Blandfort; Robert Graham - [42%] PhantomFetch: Obfuscating Loads against Prefetcher Side-Channel Attacks
Xingzhi Zhang; Buyi Lv; Yimin Lu; Kai Bu - [42%] Did Models Learn Sufficiently? Attribution-Guided Training via Subset-Selected Counterfactual Augmentation
Yannan Chen; Ruoyu Chen; Wei Wang; Bin Zeng; Jinke Li; Shiming Liu; Qunli Zhang; Yaowei Wang; Xiaochun Cao - [42%] ToxSearch: Evolving Prompts for Toxicity Search in Large Language Models
Onkar Shelar; Travis Desell - [42%] Trustworthy GenAI over 6G: Integrated Applications and Security Frameworks
Bui Duc Son; Trinh Van Chien; Dong In Kim - [42%] Large Language Model-Based Reward Design for Deep Reinforcement Learning-Driven Autonomous Cyber Defense
Sayak Mukherjee; Samrat Chatterjee; Emilie Purvine; Ted Fujimoto; Tegan Emerson - [42%] Pre-train to Gain: Robust Learning Without Clean Labels
David Szczecina; Nicholas Pellegrino; Paul Fieguth - [41%] The Curvature Rate λ: A Scalar Measure of Input-Space Sharpness in Neural Networks
Jacob Poschl - [41%] RobustFSM: Submodular Maximization in Federated Setting with Malicious Clients
Duc A. Tran; Dung Truong; Duy Le - [41%] LoopLLM: Transferable Energy-Latency Attacks in LLMs via Repetitive Generation
Xingyu Li; Xiaolei Liu; Cheng Liu; Yixiao Xu; Kangyi Ding; Bangzhou Xin; Jia-Li Yin - [41%] On the Detectability of Active Gradient Inversion Attacks in Federated Learning
Vincenzo Carletti; Pasquale Foggia; Carlo Mazzocca; Giuseppe Parrella; Mario Vento - [41%] Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs
Yunhao Chen; Xin Wang; Juncheng Li; Yixu Wang; Jie Li; Yan Teng; Yingchun Wang; Xingjun Ma - [41%] Evaluating perturbation robustness of generative systems that use COBOL code inputs
Samuel Ackerman; Wesam Ibraheem; Orna Raz; Marcel Zalmanovici - [41%] PaTAS: A Framework for Trust Propagation in Neural Networks Using Subjective Logic
Koffi Ismael Ouattara; Ioannis Krontiris; Theo Dimitrakos; Dennis Eisermann; Houda Labiod; Frank Kargl - [41%] G-Net: A Provably Easy Construction of High-Accuracy Random Binary Neural Networks
Alireza Aghasi; Nicholas Marshall; Saeid Pourmand; Wyatt Whiting - [41%] HarmonicAttack: An Adaptive Cross-Domain Audio Watermark Removal
Kexin Li; Xiao Hu; Ilya Grishchenko; David Lie - [41%] Adversarial Flow Models
Shanchuan Lin; Ceyuan Yang; Zhijie Lin; Hao Chen; Haoqi Fan - [40%] Calibration improves detection of mislabeled examples
Ilies Chibane; Thomas George; Pierre Nodet; Vincent Lemaire - [40%] Power Homotopy for Zeroth-Order Non-Convex Optimizations
Chen Xu - [40%] Fault-Tolerant MARL for CAVs under Observation Perturbations for Highway On-Ramp Merging
Yuchen Shi; Huaxin Pei; Yi Zhang; Danya Yao
2025-10 (289 papers)
- [100%] ZQBA: Zero Query Black-box Adversarial Attack
Joana C. Costa; Tiago Roxo; Hugo Proença; Pedro R. M. Inácio - [100%] MemLoss: Enhancing Adversarial Training with Recycling Adversarial Examples
Soroush Mahdi; Maryam Amirmazlaghani; Saeed Saravani; Zahra Dehghanian - [100%] Bridging Symmetry and Robustness: On the Role of Equivariance in Enhancing Adversarial Robustness
Longwei Wang; Ifrat Ikhtear Uddin; KC Santosh; Chaowei Zhang; Xiao Qin; Yang Zhou - [100%] Investigating Adversarial Robustness against Preprocessing used in Blackbox Face Recognition
Roland Croft; Brian Du; Darcy Joseph; Sharath Kumar - [100%] Exploring the Effect of DNN Depth on Adversarial Attacks in Network Intrusion Detection Systems
Mohamed ElShehaby; Ashraf Matrawy - [100%] C-LEAD: Contrastive Learning for Enhanced Adversarial Defense
Suklav Ghosh; Sonal Kumar; Arijit Sur - [99%] Evaluating the Robustness of a Production Malware Detection System to Transferable Adversarial Attacks
Milad Nasr; Yanick Fratantonio; Luca Invernizzi; Ange Albertini; Loua Farah; Alex Petit-Bianco; Andreas Terzis; Kurt Thomas; Elie Bursztein; Nicholas Carlini - [99%] Improving Adversarial Robustness of Zero-Shot CLIP with Confidence-Aware Weighting
Nikoo Naghavian; Mostafa Tavassolipour - [99%] RegMix: Adversarial Mutual and Generalization Regularization for Enhancing DNN Robustness
Zhenyu Liu; Varun Ojha - [99%] SegTrans: Transferable Adversarial Examples for Segmentation Models
Yufei Song; Ziqi Zhou; Qi Lu; Hangtao Zhang; Yifan Hu; Lulu Xue; Shengshan Hu; Minghui Li; Leo Yu Zhang - [99%] DeepTrust: Multi-Step Classification through Dissimilar Adversarial Representations for Robust Android Malware Detection
Daniel Pulido-Cortázar; Daniel Gibert; Felip Manyà - [99%] MS-GAGA: Metric-Selective Guided Adversarial Generation Attack
Dion J. X. Ho; Gabriel Lee Jun Rong; Niharika Shrivastava; Harshavardhan Abichandani; Pai Chet Ng; Xiaoxiao Miao - [99%] Constrained Adversarial Perturbation
Virendra Nishad; Bhaskar Mukhoty; Hilal AlQuabeh; Sandeep K. Shukla; Sayak Ray Chowdhury - [99%] A Versatile Framework for Designing Group-Sparse Adversarial Attacks
Alireza Heshmati; Saman Soleimani Roudi; Sajjad Amini; Shahrokh Ghaemmaghami; Farokh Marvasti - [99%] A Single Set of Adversarial Clothes Breaks Multiple Defense Methods in the Physical World
Wei Zhang; Zhanhao Hu; Xiao Li; Xiaopei Zhu; Xiaolin Hu - [99%] A New Type of Adversarial Examples
Xingyang Nie; Guojie Xiao; Su Pan; Biao Wang; Huilin Ge; Tao Fang - [99%] Enhancing Security in Deep Reinforcement Learning: A Comprehensive Survey on Adversarial Attacks and Defenses
Wu Yichao; Wang Yirui; Ding Panpan; Wang Hailong; Zhu Bingqian; Liu Chun - [99%] Trans-defense: Transformer-based Denoiser for Adversarial Defense with Spatial-Frequency Domain Representation
Alik Pramanick; Mayank Bansal; Utkarsh Srivastava; Suklav Ghosh; Arijit Sur - [98%] Revisiting Adversarial Training under Hyperspectral Image
Weihua Zhang; Chengze Jiang; Minjing Dong; Jie Gui; Lu Dong; Zhipeng Gui; Yuan Yan Tang; James Tin-Yau Kwok - [98%] Test-Time Defense Against Adversarial Attacks via Stochastic Resonance of Latent Ensembles
Dong Lao; Yuxiang Zhang; Haniyeh Ehsani Oskouie; Yangchao Wu; Alex Wong; Stefano Soatto - [98%] Concept-Based Masking: A Patch-Agnostic Defense Against Adversarial Patch Attacks
Ayushi Mehrotra; Derek Peng; Dipkamal Bhusal; Nidhi Rastogi - [98%] A unifying Bayesian framework for adversarial robustness
Pablo G. Arce; Roi Naveiro; David Ríos Insua - [98%] Adversarial Attacks Leverage Interference Between Features in Superposition
Edward Stevinson; Lucas Prieto; Melih Barsbey; Tolga Birdal - [98%] Provably Invincible Adversarial Attacks on Reinforcement Learning Systems: A Rate-Distortion Information-Theoretic Approach
Ziqing Lu; Lifeng Lai; Weiyu Xu - [98%] NAPPure: Adversarial Purification for Robust Image Classification under Non-Additive Perturbations
Junjie Nan; Jianing Li; Wei Chen; Mingkun Zhang; Xueqi Cheng - [98%] Structured Universal Adversarial Attacks on Object Detection for Video Sequences
Sven Jacob; Weijia Shao; Gjergji Kasneci - [98%] SecureLearn — An Attack-agnostic Defense for Multiclass Machine Learning Against Data Poisoning Attacks
Anum Paracha; Junaid Arshad; Mohamed Ben Farah; Khalid Ismail - [98%] If You Want to Be Robust, Be Wary of Initialization
Sofiane Ennadir; Johannes F. Lutzeyer; Michalis Vazirgiannis; El Houcine Bergou - [97%] On the Adversarial Robustness of Learning-based Conformal Novelty Detection
Daofu Zhang; Mehrdad Pournaderi; Hanne M. Clifford; Yu Xiang; Pramod K. Varshney - [97%] Attack logics, not outputs: Towards efficient robustification of deep neural networks by falsifying concept-based properties
Raik Dankworth; Gesina Schwalbe - [97%] A Statistical Method for Attack-Agnostic Adversarial Attack Detection with Compressive Sensing Comparison
Chinthana Wimalasuriya; Spyros Tragoudas - [97%] SAFER-AiD: Saccade-Assisted Foveal-peripheral vision Enhanced Reconstruction for Adversarial Defense
Jiayang Liu; Daniel Tso; Yiming Bu; Qinru Qiu - [97%] Robust Driving Control for Autonomous Vehicles: An Intelligent General-sum Constrained Adversarial Reinforcement Learning Approach
Junchao Fan; Qi Wei; Ruichen Zhang; Yang Lu; Jianhua Wang; Xiaolin Chang; Bo Ai - [97%] Adversarial Attacks on Downstream Weather Forecasting Models: Application to Tropical Cyclone Trajectory Prediction
Yue Deng; Francisco Santos; Pang-Ning Tan; Lifeng Luo - [97%] Adversarial Robustness in One-Stage Learning-to-Defer
Yannis Montreuil; Letian Yu; Axel Carlier; Lai Xing Ng; Wei Tsang Ooi - [97%] KoALA: KL-L0 Adversarial Detector via Label Agreement
Siqi Li; Yasser Shoukry - [97%] SAJA: A State-Action Joint Attack Framework on Multi-Agent Deep Reinforcement Learning
Weiqi Guo; Guanjun Liu; Ziyuan Zhou - [97%] A Hard-Label Black-Box Evasion Attack against ML-based Malicious Traffic Detection Systems
Zixuan Liu; Yi Zhao; Zhuotao Liu; Qi Li; Chuanpu Fu; Guangmeng Zhou; Ke Xu - [97%] Backdoor or Manipulation? Graph Mixture of Experts Can Defend Against Various Graph Adversarial Attacks
Yuyuan Feng; Bin Ma; Enyan Dai - [97%] ANCHOR: Integrating Adversarial Training with Hard-mined Supervised Contrastive Learning for Robust Representation Learning
Samarup Bhattacharya; Anubhab Bhattacharya; Abir Chakraborty - [96%] Explainable but Vulnerable: Adversarial Attacks on XAI Explanation in Cybersecurity Applications
Maraz Mia; Mir Mehedi A. Pritom - [96%] Imperceptible Jailbreaking against Large Language Models
Kuofeng Gao; Yiming Li; Chao Du; Xin Wang; Xingjun Ma; Shu-Tao Xia; Tianyu Pang - [96%] Proactive defense against LLM Jailbreak
Weiliang Zhao; Jinjun Peng; Daniel Ben-Levi; Zhou Yu; Junfeng Yang - [96%] Injection, Attack and Erasure: Revocable Backdoor Attacks via Machine Unlearning
Baogang Song; Dongdong Zhao; Jianwen Xiang; Qiben Xu; Zizhuo Yu - [96%] When Flatness Does (Not) Guarantee Adversarial Robustness
Nils Philipp Walter; Linara Adilova; Jilles Vreeken; Michael Kamp - [96%] Black-box Optimization of LLM Outputs by Asking for Directions
Jie Zhang; Meng Ding; Yang Liu; Jue Hong; Florian Tramèr - [96%] UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks
Mansi Phute; Matthew Hull; Haoran Wang; Alec Helbling; ShengYun Peng; Willian Lunardi; Martin Andreoni; Wenke Lee; Duen Horng Chau - [96%] Robustness Verification of Graph Neural Networks Via Lightweight Satisfiability Testing
Chia-Hsuan Lu; Tony Tan; Michael Benedikt - [96%] Solver-Integrated Adversarial Attacking and Training of Neural Operators
Yifei Sun - [96%] Can You Trust What You See? Alpha Channel No-Box Attacks on Video Object Detection
Ariana Yi; Ce Zhou; Liyang Xiao; Qiben Yan - [96%] Towards Strong Certified Defense with Universal Asymmetric Randomization
Hanbin Hong; Ashish Kundu; Ali Payani; Binghui Wang; Yuan Hong - [96%] Adversarial Déjà Vu: Jailbreak Dictionary Learning for Stronger Generalization to Unseen Attacks
Mahavir Dabas; Tran Huynh; Nikhil Reddy Billa; Jiachen T. Wang; Peng Gao; Charith Peris; Yao Ma; Rahul Gupta; Ming Jin; Prateek Mittal; Ruoxi Jia - [96%] Bilevel Models for Adversarial Learning and A Case Study
Yutong Zheng; Qingna Li - [96%] VISAT: Benchmarking Adversarial and Distribution Shift Robustness in Traffic Sign Recognition with Visual Attributes
Simon Yu; Peilin Yu; Hongbo Zheng; Huajie Shao; Han Zhao; Lui Sha - [95%] Understanding Adversarial Transfer: Why Representation-Space Attacks Fail Where Data-Space Attacks Succeed
Isha Gupta; Rylan Schaeffer; Joshua Kazdan; Ken Ziyu Liu; Sanmi Koyejo - [95%] NatGVD: Natural Adversarial Example Attack towards Graph-based Vulnerability Detection
Avilash Rath; Weiliang Qi; Youpeng Li; Xinda Wang - [95%] The Attacker Moves Second: Stronger Adaptive Attacks Bypass Defenses Against Llm Jailbreaks and Prompt Injections
Milad Nasr; Nicholas Carlini; Chawin Sitawarin; Sander V. Schulhoff; Jamie Hayes; Michael Ilie; Juliette Pluto; Shuang Song; Harsh Chaudhari; Ilia Shumailov; Abhradeep Thakurta; Kai Yuanqing Xiao; Andreas Terzis; Florian Tramèr - [95%] FeatureFool: Zero-Query Fooling of Video Models via Feature Map
Duoxun Tang; Xi Xiao; Guangwu Hu; Kangkang Sun; Xiao Yang; Dongyang Chen; Qing Li; Yongjie Yin; Jiyao Wang - [95%] FPT-Noise: Dynamic Scene-Aware Counterattack for Test-Time Adversarial Defense in Vision-Language Models
Jia Deng; Jin Li; Zhenhua Zhao; Shaowei Wang - [95%] Adversarially-Aware Architecture Design for Robust Medical AI Systems
Alyssa Gerhart; Balaji Iyangar - [94%] Dynamic Target Attack
Kedong Xiu; Churui Zeng; Tianhang Zheng; Xinzhe Huang; Xiaojun Jia; Di Wang; Puning Zhao; Zhan Qin; Kui Ren - [94%] The Easy Path to Robustness: Coreset Selection using Sample Hardness
Pranav Ramesh; Arjun Roy; Deepak Ravikumar; Kaushik Roy; Gopalakrishnan Srinivasan - [94%] Towards Adversarial Robustness and Uncertainty Quantification in DINOv2-based Few-Shot Anomaly Detection
Akib Mohammed Khan; Bartosz Krawczyk - [94%] When Compression Becomes an Attack Surface: Black-Box Attacks on Prompt-Compressed LLM Agents
Zesen Liu; Zhixiang Zhang; Yuchong Xie; Dongdong She - [93%] Generalist++: A Meta-learning Framework for Mitigating Trade-off in Adversarial Training
Yisen Wang; Yichuan Mo; Hongjun Wang; Junyi Li; Zhouchen Lin - [93%] Selective Adversarial Attacks on LLM Benchmarks
Ivan Dubrovsky; Anastasia Orlova; Illarion Iov; Nina Gubina; Irena Gureeva; Alexey Zaytsev - [93%] Universal and Transferable Attacks on Pathology Foundation Models
Yuntian Wang; Xilin Yang; Che-Yung Shen; Nir Pillar; Aydogan Ozcan - [92%] Mirage Fools the Ear, Mute Hides the Truth: Precise Targeted Adversarial Attacks on Polyphonic Sound Event Detection Systems
Junjie Su; Weifei Jin; Yuxin Cao; Derui Wang; Kai Ye; Jie Hao - [92%] Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models
Haochuan Xu; Yun Sing Koh; Shuhuai Huang; Zirun Zhou; Di Wang; Jun Sakuma; Jingfeng Zhang - [92%] Colliding with Adversaries at ECML-PKDD 2025 Adversarial Attack Competition 1st Prize Solution
Dimitris Stefanopoulos; Andreas Voskou - [92%] FrameShield: Adversarially Robust Video Anomaly Detection
Mojtaba Nafez; Mobina Poulaei; Nikan Vasei; Bardia Soltani Moakhar; Mohammad Sabokrou; MohammadHossein Rohban - [92%] SmoothGuard: Defending Multimodal Large Language Models with Noise Perturbation and Clustering Aggregation
Guangzhi Su; Shuchang Huang; Yutong Ke; Zhuohang Liu; Long Qian; Kaizhu Huang - [91%] Modeling the Attack: Detecting AI-Generated Text by Quantifying Adversarial Perturbations
Lekkala Sai Teja; Annepaka Yadagiri; Sangam Sai Anish; Siva Gopala Krishna Nuthakki; Partha Pakray - [91%] Neutral Agent-based Adversarial Policy Learning against Deep Reinforcement Learning in Multi-party Open Systems
Qizhou Peng; Yang Zheng; Yu Wen; Yanna Wu; Yingying Du - [91%] Black-Box Evasion Attacks on Data-Driven Open RAN Apps: Tailored Design and Experimental Evaluation
Pranshav Gajjar; Molham Khoja; Abiodun Ganiyu; Marc Juarez; Mahesh K. Marina; Andrew Lehane; Vijay K. Shah - [91%] Self-Calibrated Consistency can Fight Back for Adversarial Robustness in Vision-Language Models
Jiaxiang Liu; Jiawei Du; Xiao Liu; Prayag Tiwari; Mingkun Xu - [91%] Vanish into Thin Air: Cross-prompt Universal Adversarial Attacks for SAM2
Ziqi Zhou; Yifan Hu; Yufei Song; Zijing Li; Shengshan Hu; Leo Yu Zhang; Dezhong Yao; Long Zheng; Hai Jin - [91%] Robust Graph Condensation via Classification Complexity Mitigation
Jiayi Luo; Qingyun Sun; Beining Yang; Haonan Yuan; Xingcheng Fu; Yanbiao Ma; Jianxin Li; Philip S. Yu - [90%] LatentBreak: Jailbreaking Large Language Models through Latent Space Feedback
Raffaele Mura; Giorgio Piras; Kamilė Lukošiūtė; Maura Pintor; Amin Karbasi; Battista Biggio - [90%] Tight Robustness Certificates and Wasserstein Distributional Attacks for Deep Neural Networks
Bach C. Le; Tung V. Dao; Binh T. Nguyen; Hong T. M. Chu - [90%] The Black Tuesday Attack: how to crash the stock market with adversarial examples to financial forecasting models
Thomas Hofweber; Jefrey Bergl; Ian Reyes; Amir Sadovnik - [90%] Enhancing Graph Classification Robustness with Singular Pooling
Sofiane Ennadir; Oleg Smirnov; Yassine Abbahaddou; Lele Cao; Johannes F. Lutzeyer - [89%] Backdoor Vectors: a Task Arithmetic View on Backdoor Attacks and Defenses
Stanisław Pawlak; Jan Dubiński; Daniel Marczak; Bartłomiej Twardowski - [89%] CoDefend: Cross-Modal Collaborative Defense via Diffusion Purification and Prompt Optimization
Fengling Zhu; Boshi Liu; Jingyu Hua; Sheng Zhong - [89%] Signature in Code Backdoor Detection, how far are we?
Quoc Hung Le; Thanh Le-Cong; Bach Le; Bowen Xu - [89%] HAMLOCK: HArdware-Model LOgically Combined attacK
Sanskar Amgain; Daniel Lobo; Atri Chatterjee; Swarup Bhunia; Fnu Suya - [88%] Understanding Sensitivity of Differential Attention through the Lens of Adversarial Robustness
Tsubasa Takahashi; Shojiro Yamabe; Futa Waseda; Kento Sasaki - [88%] Backdoor-Powered Prompt Injection Attacks Nullify Defense Methods
Yulin Chen; Haoran Li; Yuan Sui; Yangqiu Song; Bryan Hooi - [88%] Safeguarding Efficacy in Large Language Models: Evaluating Resistance to Human-Written and Algorithmic Adversarial Prompts
Tiarnaigh Downey-Webb; Olamide Jogunola; Oluwaseun Ajao - [88%] The Trojan Example: Jailbreaking LLMs through Template Filling and Unsafety Reasoning
Mingrui Liu; Sixiao Zhang; Cheng Long; Kwok Yan Lam - [87%] Fine-Tuning Jailbreaks under Highly Constrained Black-Box Settings: A Three-Pronged Approach
Xiangfang Li; Yu Wang; Bo Li - [87%] From Theory to Practice: Evaluating Data Poisoning Attacks and Defenses in In-Context Learning on Social Media Health Discourse
Rabeya Amin Jhuma; Mostafa Mohaimen Akand Faisal - [87%] Get RICH or Die Scaling: Profitably Trading Inference Compute for Robustness
Tavish McDonald; Bo Lei; Stanislav Fort; Bhavya Kailkhura; Brian Bartoldson - [87%] Kernel Learning with Adversarial Features: Numerical Efficiency and Adaptive Regularization
Antônio H. Ribeiro; David Vävinggren; Dave Zachariah; Thomas B. Schön; Francis Bach - [87%] Cross-Paradigm Graph Backdoor Attacks with Promptable Subgraph Triggers
Dongyi Liu; Jiangtong Li - [87%] On the Stability of Neural Networks in Deep Learning
Blaise Delattre - [86%] DarkHash: A Data-Free Backdoor Attack Against Deep Hashing
Ziqi Zhou; Menghao Deng; Yufei Song; Hangtao Zhang; Wei Wan; Shengshan Hu; Minghui Li; Leo Yu Zhang; Dezhong Yao - [86%] Provably Robust Adaptation for Language-Empowered Foundation Models
Yuni Lai; Xiaoyu Xue; Linghui Shen; Yulun Wu; Gaolei Li; Song Guo; Kai Zhou; Bin Xiao - [86%] Backdoor Unlearning by Linear Task Decomposition
Amel Abdelraheem; Alessandro Favero; Gerome Bovet; Pascal Frossard - [85%] NonTextual Target Attack
Xinzhe Huang; Wenjing Hu; Tianhang Zheng; Kedong Xiu; Hongsheng Hu; Xiaojun Jia; Di Wang; Zhan Qin; Kui Ren - [85%] SafeGuider: Robust and Practical Content Safety Control for Text-to-Image Models
Peigui Qi; Kunsheng Tang; Wenbo Zhou; Weiming Zhang; Nenghai Yu; Tianwei Zhang; Qing Guo; Jie Zhang - [85%] P2P: A Poison-to-Poison Remedy for Reliable Backdoor Defense in LLMs
Shuai Zhao; Xinyi Wu; Shiqian Zhao; Xiaobao Wu; Zhongliang Guo; Yanhao Jia; Anh Tuan Luu - [85%] OBJVanish: Physically Realizable Text-to-3D Adv. Generation of LiDAR-Invisible Objects
Bing Li; Wuqi Wang; Yanan Zhang; Jingzheng Li; Haigen Min; Wei Feng; Xingyu Zhao; Jie Zhang; Qing Guo - [85%] Group-Adaptive Adversarial Learning for Robust Fake News Detection Against Malicious Comments
Zhao Tong; Chunlin Gong; Yimeng Gu; Haichao Shi; Qiang Liu; Shu Wu; Xiao-Yu Zhang - [85%] Pruning Cannot Hurt Robustness: Certified Trade-offs in Reinforcement Learning
James Pedley; Benjamin Etheridge; Stephen J. Roberts; Francesco Quinzan - [85%] S2AP: Score-space Sharpness Minimization for Adversarial Pruning
Giorgio Piras; Qi Zhao; Fabio Brau; Maura Pintor; Christian Wressnegger; Battista Biggio - [85%] Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses
Xingwei Zhong; Kar Wai Fok; Vrizlynn L. L. Thing - [85%] ALMGuard: Safety Shortcuts and Where to Find Them as Guardrails for Audio-Language Models
Weifei Jin; Yuxin Cao; Junjie Su; Minhui Xue; Jie Hao; Ke Xu; Jin Song Dong; Derui Wang - [84%] RIPRAG: Hack a Black-box Retrieval-Augmented Generation Question-Answering System with Reinforcement Learning
Meng Xi; Sihan Lv; Yechen Jin; Guanjie Cheng; Naibo Wang; Ying Li; Jianwei Yin - [84%] PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs
Xinkai Wang; Beibei Li; Zerui Shao; Ao Liu; Guangquan Xu; Shouling Ji - [84%] Fine-Grained Iterative Adversarial Attacks with Limited Computation Budget
Zhichao Hou; Weizhi Gao; Xiaorui Liu - [84%] Rethinking Robust Adversarial Concept Erasure in Diffusion Models
Qinghong Yin; Yu Tian; Heming Yang; Xiang Chen; Xianlin Zhang; Yue Ming; Xueming Li; Yue Zhang - [83%] Adversarial training with restricted data manipulation
David Benfield; Stefano Coniglio; Phan Tu Vuong; Alain Zemkoho - [83%] SECA: Semantically Equivalent and Coherent Attacks for Eliciting LLM Hallucinations
Buyun Liang; Liangzu Peng; Jinqi Luo; Darshan Thaker; Kwan Ho Ryan Chan; René Vidal - [82%] Towards Imperceptible Adversarial Defense: A Gradient-Driven Shield against Facial Manipulations
Yue Li; Linying Xue; Dongdong Lin; Qiushi Li; Hui Tian; Hongxia Wang - [82%] Adversarial Reinforcement Learning for Large Language Model Agent Safety
Zizhao Wang; Dingcheng Li; Vaishakh Keshava; Phillip Wallis; Ananth Balashankar; Peter Stone; Lukas Rutishauser - [82%] Unsupervised Backdoor Detection and Mitigation for Spiking Neural Networks
Jiachen Li; Bang Wu; Xiaoyu Xia; Xiaoning Liu; Xun Yi; Xiuzhen Zhang - [82%] Beyond Text: Multimodal Jailbreaking of Vision-Language and Audio Models through Perceptually Simple Transformations
Divyanshu Kumar; Shreyas Jena; Nitin Aravind Birur; Tanay Baswa; Sahil Agarwal; Prashanth Harshangi - [82%] Lipschitz-aware Linearity Grafting for Certified Robustness
Yongjin Han; Suhyun Kim - [81%] Eyes-on-Me: Scalable RAG Poisoning through Transferable Attention-Steering Attractors
Yen-Shan Chen; Sian-Yao Huang; Cheng-Lin Yang; Yun-Nung Chen - [81%] LoRA Patching: Exposing the Fragility of Proactive Defenses against Deepfakes
Zuomin Qu; Yimao Guo; Qianyue Hu; Wei Lu - [81%] Rounding-Guided Backdoor Injection in Deep Learning Model Quantization
Xiangxiang Chen; Peixin Zhang; Jun Sun; Wenhai Wang; Jingyi Wang - [81%] Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models
Anindya Sundar Das; Kangjie Chen; Monowar Bhuyan - [80%] Enhancing Certifiable Semantic Robustness via Robust Pruning of Deep Neural Networks
Hanjiang Hu; Bowei Li; Ziwei Wang; Tianhao Wei; Casidhe Hutchison; Eric Sample; Changliu Liu - [80%] Uncolorable Examples: Preventing Unauthorized AI Colorization via Perception-Aware Chroma-Restrictive Perturbation
Yuki Nii; Futa Waseda; Ching-Chun Chang; Isao Echizen - [80%] ImpMIA: Leveraging Implicit Bias for Membership Inference Attack
Yuval Golbari; Navve Wasserman; Gal Vardi; Michal Irani - [79%] Lower Bounds on Adversarial Robustness for Multiclass Classification with General Loss Functions
Camilo Andrés García Trillos; Nicolás García Trillos - [78%] HarmNet: A Framework for Adaptive Multi-Turn Jailbreak Attacks on Large Language Models
Sidhant Narula; Javad Rafiei Asl; Mohammad Ghasemigol; Eduardo Blanco; Daniel Takabi - [78%] Enhancing CLIP Robustness via Cross-Modality Alignment
Xingyu Zhu; Beier Zhu; Shuo Wang; Kesen Zhao; Hanwang Zhang - [77%] DropVLA: An Action-Level Backdoor Attack on Vision-Language-Action Models
Zonghuan Xu; Jiayu Li; Yunhan Zhao; Xiang Zheng; Xingjun Ma; Yu-Gang Jiang - [77%] TED++: Submanifold-Aware Backdoor Detection via Layerwise Tubular-Neighbourhood Screening
Nam Le; Leo Yu Zhang; Kewen Liao; Shirui Pan; Wei Luo - [77%] BadGraph: A Backdoor Attack Against Latent Diffusion Model for Text-Guided Graph Generation
Liang Ye; Shengqin Chen; Jiazhu Dai - [77%] Stable neural networks and connections to continuous dynamical systems
Matthias J. Ehrhardt; Davide Murari; Ferdia Sherry - [76%] Sequence-Preserving Dual-FoV Defense for Traffic Sign and Light Recognition in Autonomous Vehicles
Abhishek Joshi; Jahnavi Krishna Koda; Abhishek Phadke - [76%] Goal-oriented Backdoor Attack against Vision-Language-Action Models via Physical Objects
Zirun Zhou; Zhengyang Xiao; Haochuan Xu; Jing Sun; Di Wang; Jingfeng Zhang - [74%] AgentTypo: Adaptive Typographic Prompt Injection Attacks against Black-box Multimodal Agents
Yanjie Li; Yiming Cao; Dong Wang; Bin Xiao - [74%] Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models
Liang Lin; Miao Yu; Moayad Aloqaily; Zhenhong Zhou; Kun Wang; Linsey Pang; Prakhar Mehrotra; Qingsong Wen - [74%] POLAR: Policy-based Layerwise Reinforcement Learning Method for Stealthy Backdoor Attacks in Federated Learning
Kuai Yu; Xiaoyu Wu; Peishen Yan; Qingqian Yang; Linshan Jiang; Hao Wang; Yang Hua; Tao Song; Haibing Guan - [72%] Indirect Prompt Injections: Are Firewalls All You Need, or Stronger Benchmarks?
Rishika Bhagwatkar; Kevin Kasa; Abhay Puri; Gabriel Huang; Irina Rish; Graham W. Taylor; Krishnamurthy Dj Dvijotham; Alexandre Lacoste - [72%] ADMIT: Few-shot Knowledge Poisoning Attacks on RAG-based Fact Checking
Yutao Wu; Xiao Liu; Yinghui Li; Yifeng Gao; Yifan Ding; Jiale Ding; Xiang Zheng; Xingjun Ma - [72%] DSSmoothing: Toward Certified Dataset Ownership Verification for Pre-trained Language Models via Dual-Space Smoothing
Ting Qiao; Xing Liu; Wenke Huang; Jianbin Li; Zhaoxin Fan; Yiming Li - [72%] SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses
Hanbin Hong; Shuang Wu; Shuya Feng; Nima Naderloui; Shenao Yan; Jingyu Zhang; Ali Arastehfard; Heqing Huang; Yuan Hong - [71%] RobustVLA: On Robustness of Vision-Language-Action Model against Multi-Modal Perturbations
Jianing Guo; Zhenhong Wu; Chang Tu; Yiyao Ma; Xiangqi Kong; Zhiqian Liu; Jiaming Ji; Shuning Zhang; Yuanpei Chen; Kai Chen; Qi Dou; Yaodong Yang; Xianglong Liu; Huijie Zhao; Weifeng Lv; Simin Li - [71%] Uncertainty Quantification In Surface Landmines and UXO Classification Using MC Dropout
Sagar Lekhak; Emmett J. Ientilucci; Dimah Dera; Susmita Ghosh - [71%] Adversarial Reinforcement Learning for Offensive and Defensive Agents in a Simulated Zero-Sum Network Environment
Abrar Shahid; Ibteeker Mahir Ishum; AKM Tahmidul Haque; M Sohel Rahman; A. B. M. Alim Al Islam - [71%] When "Correct" Is Not Safe: Can We Trust Functionally Correct Patches Generated by Code Agents?
Yibo Peng; James Song; Lei Li; Xinyu Yang; Mihai Christodorescu; Ravi Mangal; Corina Pasareanu; Haizhong Zheng; Beidi Chen - [71%] Robustness in Text-Attributed Graph Learning: Insights, Trade-offs, and New Defenses
Runlin Lei; Lu Yi; Mingguo He; Pengyu Qiu; Zhewei Wei; Yongchao Liu; Chuntao Hong - [70%] RL Is a Hammer and LLMs Are Nails: A Simple Reinforcement Learning Recipe for Strong Prompt Injection
Yuxin Wen; Arman Zharmagambetov; Ivan Evtimov; Narine Kokhlikyan; Tom Goldstein; Kamalika Chaudhuri; Chuan Guo - [70%] VisualDAN: Exposing Vulnerabilities in VLMs with Visual-Driven DAN Commands
Aofan Liu; Lulu Tang - [70%] Attacks by Content: Automated Fact-checking is an AI Security Issue
Michael Schlichtkrull - [70%] Adversarial Pre-Padding: Generating Evasive Network Traffic Against Transformer-Based Classifiers
Quanliang Jing; Xinxin Fan; Yanyan Liu; Jingping Bi - [69%] Revisiting the Relation Between Robustness and Universality
M. Klabunde; L. Caspari; F. Lemmerich - [69%] Exploring Semantic-constrained Adversarial Example with Instruction Uncertainty Reduction
Jin Hu; Jiakai Wang; Linna Jing; Haolin Li; Haodong Liu; Haotong Qin; Aishan Liu; Ke Xu; Xianglong Liu - [69%] Security Risk of Misalignment between Text and Image in Multi-modal Model
Xiaosen Wang; Zhijin Ge; Shaokang Wang - [68%] WAInjectBench: Benchmarking Prompt Injection Detections for Web Agents
Yinuo Liu; Ruohan Xu; Xilong Wang; Yuqi Jia; Neil Zhenqiang Gong - [68%] Gradient-based Model Shortcut Detection for Time Series Classification
Salomon Ibarra; Frida Cantu; Kaixiong Zhou; Li Zhang - [68%] Unveiling the Vulnerability of Graph-LLMs: An Interpretable Multi-Dimensional Adversarial Attack on TAGs
Bowen Fan; Zhilin Guo; Xunkai Li; Yihan Zhou; Bing Zhou; Zhenjun Li; Rong-Hua Li; Guoren Wang - [68%] Personal Attribute Leakage in Federated Speech Models
Hamdan Al-Ali; Ali Reza Ghavamipour; Tommaso Caselli; Fatih Turkmen; Zeerak Talat; Hanan Aldarmaki - [68%] Sentra-Guard: A Real-Time Multilingual Defense Against Adversarial LLM Prompts
Md. Mehedi Hasan; Sk Tanzir Mehedi; Ziaur Rahman; Rafid Mostafiz; Md. Abir Hossain - [67%] Tree-based Dialogue Reinforced Policy Optimization for Red-Teaming Attacks
Ruohao Guo; Afshin Oroojlooy; Roshan Sridhar; Miguel Ballesteros; Alan Ritter; Dan Roth - [67%] Geometry-Aware Backdoor Attacks: Leveraging Curvature in Hyperbolic Embeddings
Ali Baheri - [66%] Inverse Language Modeling towards Robust and Grounded LLMs
Davide Gabrielli; Simone Sestito; Iacopo Masi - [66%] Robustness and Regularization in Hierarchical Re-Basin
Benedikt Franke; Florian Heinrich; Markus Lange; Arne Raulf - [66%] Scalable Energy-Based Models via Adversarial Training: Unifying Discrimination and Generation
Xuwang Yin; Claire Zhang; Julie Steele; Nir Shavit; Tony T. Wang - [66%] Towards Proactive Defense Against Cyber Cognitive Attacks
Bonnie Rushing; Mac-Rufus Umeokolo; Shouhuai Xu - [65%] RAG-Pull: Turning Retrieval into a Code-Injection Channel via Invisible Unicode Perturbations
Aritra Dhar; Vasilije Stambolic; Lukas Cavigelli - [65%] Targeted Attacks and Defenses for Distributed Federated Learning in Vehicular Networks
Utku Demir; Tugba Erpek; Yalin E. Sagduyu; Sastry Kompella; Mengran Xue - [65%] AdaDoS: Adaptive DoS Attack via Deep Adversarial Reinforcement Learning in SDN
Wei Shao; Yuhao Wang; Rongguang He; Muhammad Ejaz Ahmed; Seyit Camtepe - [64%] CHAI: Command Hijacking against embodied AI
Luis Burbano; Diego Ortiz; Qi Sun; Siwei Yang; Haoqin Tu; Cihang Xie; Yinzhi Cao; Alvaro A Cardenas - [64%] A Survey on Agentic Security: Applications, Threats and Defenses
Asif Shahriar; Md Nafiu Rahman; Sadif Ahmed; Farig Sadeque; Md Rizwan Parvez - [64%] Bits Leaked per Query: Information-Theoretic Bounds on Adversarial Attacks against LLMs
Masahiro Kaneko; Timothy Baldwin - [64%] CourtGuard: A Local, Multiagent Prompt Injection Classifier
Isaac Wu; Michael Maslowski - [64%] SSCL-BW: Sample-Specific Clean-Label Backdoor Watermarking for Dataset Ownership Verification
Yingjia Wang; Ting Qiao; Xing Liu; Chongzuo Li; Sixing Wu; Jianbin Li - [63%] NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks
Javad Rafiei Asl; Sidhant Narula; Mohammad Ghasemigol; Eduardo Blanco; Daniel Takabi - [63%] Collaborative Shadows: Distributed Backdoor Attacks in LLM-Based Multi-Agent Systems
Pengyu Zhu; Lijun Li; Yaxing Lyu; Li Sun; Sen Su; Jing Shao - [63%] Bag of Tricks for Subverting Reasoning-based Safety Guardrails
Shuo Chen; Zhen Han; Haokun Chen; Bailan He; Shengyun Si; Jingpei Wu; Philip Torr; Volker Tresp; Jindong Gu - [63%] A Comprehensive Survey of Website Fingerprinting Attacks and Defenses in Tor: Advances and Open Challenges
Yuwen Cui; Guangjing Wang; Khanh Vu; Kai Wei; Kehan Shen; Zhengyuan Jiang; Xiao Han; Ning Wang; Zhuo Lu; Yao Liu - [63%] Robust Adversarial Reinforcement Learning in Stochastic Games via Sequence Modeling
Xiaohang Tang; Zhuowen Cheng; Satyabrat Kumar - [63%] Distractor Injection Attacks on Large Reasoning Models: Characterization and Defense
Zhehao Zhang; Weijie Xu; Shixian Cui; Chandan K. Reddy - [63%] Explainable Face Presentation Attack Detection via Ensemble-CAM
Rashik Shadman; M G Sarwar Murshed; Faraz Hussain - [62%] Latent Diffusion Unlearning: Protecting Against Unauthorized Personalization Through Trajectory Shifted Perturbations
Naresh Kumar Devulapally; Shruti Agarwal; Tejas Gokhale; Vishnu Suresh Lokhande - [62%] Cross-Modal Content Optimization for Steering Web Agent Preferences
Tanqiu Jiang; Min Bai; Nikolaos Pappas; Yanjun Qi; Sandesh Swamy - [62%] Colliding with Adversaries at ECML-PKDD 2025 Model Robustness Competition 1st Prize Solution
Dimitris Stefanopoulos; Andreas Voskou - [62%] An Experimental Study of Trojan Vulnerabilities in UAV Autonomous Landing
Reza Ahmari; Ahmad Mohammadi; Vahid Hemmati; Mohammed Mynuddin; Mahmoud Nabil Mahmoud; Parham Kebria; Abdollah Homaifar; Mehrdad Saif - [62%] AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts
Yufan Liu; Wanqian Zhang; Huashan Chen; Lin Wang; Xiaojun Jia; Zheng Lin; Weiping Wang - [62%] SPARTA: Evaluating Reasoning Segmentation Robustness through Black-Box Adversarial Paraphrasing in Text Autoencoder Latent Space
Viktoriia Zinkovich; Anton Antonov; Andrei Spiridonov; Denis Shepelev; Andrey Moskalenko; Daria Pugacheva; Elena Tutubalina; Andrey Kuznetsov; Vlad Shakhuro - [62%] Hammering the Diagnosis: Rowhammer-Induced Stealthy Trojan Attacks on ViT-Based Medical Imaging
Banafsheh Saber Latibari; Najmeh Nazari; Hossein Sayadi; Houman Homayoun; Abhijit Mahalanobis - [61%] Towards Robust Artificial Intelligence: Self-Supervised Learning Approach for Out-of-Distribution Detection
Wissam Salhab; Darine Ameyed; Hamid Mcheick; Fehmi Jaafar - [61%] Any-Depth Alignment: Unlocking Innate Safety Alignment of LLMs to Any-Depth
Jiawei Zhang; Andrew Estornell; David D. Baek; Bo Li; Xiaojun Xu - [61%] Defending Against Prompt Injection with DataFilter
Yizhu Wang; Sizhe Chen; Raghad Alkhudair; Basel Alomair; David Wagner - [61%] SPEAR++: Scaling Gradient Inversion via Sparsely-Used Dictionary Learning
Alexander Bakarsky; Dimitar I. Dimitrov; Maximilian Baader; Martin Vechev - [60%] Robust Federated Inference
Akash Dhasade; Sadegh Farhadkhani; Rachid Guerraoui; Nirupam Gupta; Maxime Jacovella; Anne-Marie Kermarrec; Rafael Pinot - [60%] Poisoning Attacks on LLMs Require a Near-constant Number of Poison Samples
Alexandra Souly; Javier Rando; Ed Chapman; Xander Davies; Burak Hasircioglu; Ezzeldin Shereen; Carlos Mougan; Vasilios Mavroudis; Erik Jones; Chris Hicks; Nicholas Carlini; Yarin Gal; Robert Kirk - [60%] Robust ML-based Detection of Conventional, LLM-Generated, and Adversarial Phishing Emails Using Advanced Text Preprocessing
Deeksha Hareesha Kulal; Chidozie Princewill Arannonu; Afsah Anwar; Nidhi Rastogi; Quamar Niyaz - [60%] BEAT: Visual Backdoor Attacks on VLM-based Embodied Agents via Contrastive Trigger Learning
Qiusi Zhan; Hyeonjeong Ha; Rui Yang; Sirui Xu; Hanyang Chen; Liang-Yan Gui; Yu-Xiong Wang; Huan Zhang; Heng Ji; Daniel Kang - [59%] Machine Unlearning Meets Adversarial Robustness via Constrained Interventions on LLMs
Fatmazohra Rezkellah; Ramzi Dakhmouche - [59%] Training Feature Attribution for Vision Models
Aziz Bacha; Thomas George - [59%] One Token Embedding Is Enough to Deadlock Your Large Reasoning Model
Mohan Zhang; Yihua Zhang; Jinghan Jia; Zhangyang Wang; Sijia Liu; Tianlong Chen - [59%] SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models
Yulong Chen; Qi Zhang; Jiawen Zhang; Yadong Liu; Mu Li; Jie Wen; Yong Xu - [58%] AdvEvo-MARL: Shaping Internalized Safety through Adversarial Co-Evolution in Multi-Agent Reinforcement Learning
Zhenyu Pan; Yiting Zhang; Zhuo Liu; Yolo Yunlong Tang; Zeliang Zhang; Haozheng Luo; Yuwei Han; Jianshu Zhang; Dennis Wu; Hong-Yu Chen; Haoran Lu; Haoyang Fang; Manling Li; Chenliang Xu; Philip S. Yu; Han Liu - [58%] RAID: Refusal-Aware and Integrated Decoding for Jailbreaking LLMs
Tuan T. Nguyen; John Le; Thai T. Vu; Willy Susilo; Heath Cooper - [58%] Patronus: Safeguarding Text-to-Image Models against White-Box Adversaries
Xinfeng Li; Shengyuan Pang; Jialin Wu; Jiangyi Deng; Huanlong Zhong; Yanjiao Chen; Jie Zhang; Wenyuan Xu - [58%] Online Learning Defense against Iterative Jailbreak Attacks via Prompt Optimization
Masahiro Kaneko; Zeerak Talat; Timothy Baldwin - [57%] RedTWIZ: Diverse LLM Red Teaming via Adaptive Attack Planning
Artur Horal; Daniel Pina; Henrique Paz; Iago Paulo; João Soares; Rafael Ferreira; Diogo Tavares; Diogo Glória-Silva; João Magalhães; David Semedo - [57%] Chain-of-Trigger: An Agentic Backdoor that Paradoxically Enhances Agentic Robustness
Jiyang Qiu; Xinbei Ma; Yunqing Xu; Zhuosheng Zhang; Hai Zhao - [57%] Adversarial Fine-tuning in Offline-to-Online Reinforcement Learning for Robust Robot Control
Shingo Ayabe; Hiroshi Kera; Kazuhiko Kawamoto - [57%] Detecting Adversarial Fine-tuning with Auditing Agents
Sarah Egler; John Schulman; Nicholas Carlini - [57%] Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models
Sarah Ball; Niki Hasrati; Alexander Robey; Avi Schwarzschild; Frauke Kreuter; Zico Kolter; Andrej Risteski - [56%] CommandSans: Securing AI Agents with Surgical Precision Prompt Sanitization
Debeshee Das; Luca Beurer-Kellner; Marc Fischer; Maximilian Baader - [56%] Fairness-Constrained Optimization Attack in Federated Learning
Harsh Kasyap; Minghong Fang; Zhuqing Liu; Carsten Maple; Somanath Tripathy - [55%] Locket: Robust Feature-Locking Technique for Language Models
Lipeng He; Vasisht Duddu; N. Asokan - [55%] AegisRF: Adversarial Perturbations Guided with Sensitivity for Protecting Intellectual Property of Neural Radiance Fields
Woo Jae Kim; Kyu Beom Han; Yoonki Cho; Youngju Na; Junsik Jung; Sooel Son; Sung-eui Yoon - [54%] Attack via Overfitting: 10-shot Benign Fine-tuning to Jailbreak LLMs
Zhixin Xie; Xurui Song; Jun Luo - [54%] Provable Watermarking for Data Poisoning Attacks
Yifan Zhu; Lijia Yu; Xiao-Shan Gao - [54%] Are My Optimized Prompts Compromised? Exploring Vulnerabilities of LLM-based Optimizers
Andrew Zhao; Reshmi Ghosh; Vitor Carvalho; Emily Lawton; Keegan Hines; Gao Huang; Jack W. Stokes - [54%] Can Current Detectors Catch Face-to-Voice Deepfake Attacks?
Nguyen Linh Bao Nguyen; Alsharif Abuadbba; Kristen Moore; Tingmin Wu - [54%] Attack on a PUF-based Secure Binary Neural Network
Bijeet Basak; Nupur Patil; Kurian Polachan; Srinivas Vivek - [53%] On Integer Programming for the Binarized Neural Network Verification Problem
Woojin Kim; James R. Luedtke - [53%] Adaptive Attacks on Trusted Monitors Subvert AI Control Protocols
Mikhail Terekhov; Alexander Panfilov; Daniil Dzenhaliou; Caglar Gulcehre; Maksym Andriushchenko; Ameya Prabhu; Jonas Geiping - [53%] CrossGuard: Safeguarding MLLMs against Joint-Modal Implicit Malicious Attacks
Xu Zhang; Hao Li; Zhichao Lu - [53%] NeuroGenPoisoning: Neuron-Guided Attacks on Retrieval-Augmented Generation of LLM via Genetic Optimization of External Knowledge
Hanyu Zhu; Lance Fiondella; Jiawei Yuan; Kai Zeng; Long Jiao - [52%] Optimizing DINOv2 with Registers for Face Anti-Spoofing
Mika Feng; Pierre Gallin-Martel; Koichi Ito; Takafumi Aoki - [52%] A Hybrid Deep Learning and Forensic Approach for Robust Deepfake Detection
Sales Aribe - [51%] On the Implicit Adversariality of Catastrophic Forgetting in Deep Continual Learning
Ze Peng; Jian Zhang; Jintao Guo; Lei Qi; Yang Gao; Yinghuan Shi - [50%] Reading Between the Lines: Towards Reliable Black-box LLM Fingerprinting via Zeroth-order Gradient Estimation
Shuo Shao; Yiming Li; Hongwei Yao; Yifei Chen; Yuchen Yang; Zhan Qin - [50%] ArtPerception: ASCII Art-based Jailbreak on LLMs with Recognition Pre-test
Guan-Yan Yang; Tzu-Yu Cheng; Ya-Wen Teng; Farn Wanga; Kuo-Hui Yeh - [50%] BreakFun: Jailbreaking LLMs via Schema Exploitation
Amirkia Rafiei Oskooei; Mehmet S. Aktas - [50%] PP3D: An In-Browser Vision-Based Defense Against Web Behavior Manipulation Attacks
Spencer King; Irfan Ozen; Karthika Subramani; Saranyan Senthivel; Phani Vadrevu; Roberto Perdisci - [50%] Style Attack Disguise: When Fonts Become a Camouflage for Adversarial Intent
Yangshijie Zhang; Xinda Wang; Jialin Liu; Wenqiang Wang; Zhicong Ma; Xingxing Jia - [50%] Uncovering the Persuasive Fingerprint of LLMs in Jailbreaking Attacks
Havva Alizadeh Noughabi; Julien Serbanescu; Fattane Zarrinkalam; Ali Dehghantanha - [50%] Model Inversion meets Cryptographic Fuzzy Extractors
Mallika Prabhakar; Louise Xu; Prateek Saxena - [49%] MOLM: Mixture of LoRA Markers
Samar Fares; Nurbek Tastan; Noor Hussein; Karthik Nandakumar - [49%] SVDefense: Effective Defense against Gradient Inversion Attacks via Singular Value Decomposition
Chenxiang Luo; David K. Y. Yau; Qun Song - [49%] Adversarial-Resilient RF Fingerprinting: A CNN-GAN Framework for Rogue Transmitter Detection
Raju Dhakal; Prashant Shekhar; Laxima Niure Kandel - [49%] SHIELD: Classifier-Guided Prompting for Robust and Safer LVLMs
Juan Ren; Mark Dras; Usman Naseem - [49%] $δ$-STEAL: LLM Stealing Attack with Local Differential Privacy
Kieu Dang; Phung Lai; NhatHai Phan; Yelong Shen; Ruoming Jin; Abdallah Khreishah - [48%] MetaDefense: Defending Finetuning-based Jailbreak Attack Before and During Generation
Weisen Jiang; Sinno Jialin Pan - [48%] On the Optimality of the Median-of-Means Estimator under Adversarial Contamination
Xabier de Juan; Santiago Mazuelas - [47%] Bypassing Prompt Guards in Production with Controlled-Release Prompting
Jaiden Fairoze; Sanjam Garg; Keewoo Lee; Mingyuan Wang - [47%] SpecGuard: Spectral Projection-based Advanced Invisible Watermarking
Inzamamul Alam; Md Tanvir Islam; Khan Muhammad; Simon S. Woo - [47%] Invisible to Humans, Triggered by Agents: Stealthy Jailbreak Attacks on Mobile Vision-Language Agents
Renhua Ding; Xiao Yang; Zhengwei Fang; Jun Luo; Kun He; Jun Zhu - [47%] GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis
Subrat Kishore Dutta; Yuelin Xu; Piyush Pant; Xiao Zhang - [47%] Privacy-Aware Framework of Robust Malware Detection in Indoor Robots: Hybrid Quantum Computing and Deep Neural Networks
Tan Le; Van Le; Sachin Shetty - [47%] AWARE: Audio Watermarking with Adversarial Resistance to Edits
Kosta Pavlović; Lazar Stanarević; Petar Nedić; Elena Nešović Slavko Kovačević; Igor Djurović - [47%] NeuPerm: Disrupting Malware Hidden in Neural Network Parameters by Leveraging Permutation Symmetry
Daniel Gilkarov; Ran Dubin - [47%] Caption-Driven Explainability: Probing CNNs for Bias via CLIP
Patrick Koller; Amil V. Dravid; Guido M. Schuster; Aggelos K. Katsaggelos - [46%] Activation-Deactivation: A General Framework for Robust Post-hoc Explainable AI
Akchunya Chanchal; David A. Kelly; Hana Chockler - [46%] Provenance Networks: End-to-End Exemplar-Based Explainability
Ali Kayyam; Anusha Madan Gopal; M. Anthony Lewis - [46%] From Poisoned to Aware: Fostering Backdoor Self-Awareness in LLMs
Guangyu Shen; Siyuan Cheng; Xiangzhe Xu; Yuan Zhou; Hanxi Guo; Zhuo Zhang; Xiangyu Zhang - [46%] Is the Hard-Label Cryptanalytic Model Extraction Really Polynomial?
Akira Ito; Takayuki Miura; Yosuke Todo - [46%] PEAR: Planner-Executor Agent Robustness Benchmark
Shen Dong; Mingxuan Zhang; Pengfei He; Li Ma; Bhavani Thuraisingham; Hui Liu; Yue Xing - [46%] Robust and Efficient Collaborative Learning
Abdellah El Mrini; Sadegh Farhadkhan; Rachid Guerraoui - [46%] Cross-Receiver Generalization for RF Fingerprint Identification via Feature Disentanglement and Adversarial Training
Yuhao Pan; Xiucheng Wang; Fushuo Huo; Nan Cheng; Wenchao Xu - [46%] Sequential Comics for Jailbreaking Multimodal Large Language Models via Structured Visual Storytelling
Deyue Zhang; Dongdong Yang; Junjie Mu; Quancheng Zou; Zonghao Ying; Wenzhuo Xu; Zhao Liu; Xuan Wang; Xiangzheng Zhang - [46%] PoTS: Proof-of-Training-Steps for Backdoor Detection in Large Language Models
Issam Seddik; Sami Souihi; Mohamed Tamaazousti; Sara Tucci Piergiovanni - [45%] Exploiting Web Search Tools of AI Agents for Data Exfiltration
Dennis Rall; Bernhard Bauer; Mohit Mittal; Thomas Fraunholz - [45%] Stealthy Dual-Trigger Backdoors: Attacking Prompt Tuning in LM-Empowered Graph Foundation Models
Xiaoyu Xue; Yuni Lai; Chenxi Huang; Yulin Zhu; Gaolei Li; Xiaoge Zhang; Kai Zhou - [45%] Learning to Detect Unknown Jailbreak Attacks in Large Vision-Language Models
Shuang Liang; Zhihao Xu; Jialing Tao; Hui Xue; Xiting Wang - [45%] Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming
Zheng Zhang; Jiarui He; Yuchen Cai; Deheng Ye; Peilin Zhao; Ruili Feng; Hao Wang - [45%] DRsam: Detection of Fault-Based Microarchitectural Side-Channel Attacks in RISC-V Using Statistical Preprocessing and Association Rule Mining
Muhammad Hassan; Maria Mushtaq; Jaan Raik; Tara Ghasempouri - [45%] Seeing is Believing? Evaluating Vision-Language Model Susceptibility in Agent-to-Agent Multimodal Persuasion
Haoyi Qiu; Yilun Zhou; Pranav Narayanan Venkit; Kung-Hsiang Huang; Jiaxin Zhang; Nanyun Peng; Chien-Sheng Wu - [44%] ARMs: Adaptive Red-Teaming Agent against Multimodal Models with Plug-and-Play Attacks
Zhaorun Chen; Xun Liu; Mintong Kang; Jiawei Zhang; Minzhou Pan; Shuang Yang; Bo Li - [44%] Exploring the Hierarchical Reasoning Model for Small Natural-Image Classification Without Augmentation
Alexander V. Mantzaris - [44%] AutoDAN-Reasoning: Enhancing Strategies Exploration based Jailbreak Attacks with Test-Time Scaling
Xiaogeng Liu; Chaowei Xiao - [44%] Local Background Features Matter in Out-of-Distribution Detection
Jinlun Ye; Zhuohao Sun; Yiqiao Qiu; Qiu Li; Zhijun Tan; Ruixuan Wang - [44%] Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection
Francesco Giarrusso; Olga E. Sorokoletova; Vincenzo Suriani; Daniele Nardi - [44%] An Information Asymmetry Game for Trigger-based DNN Model Watermarking
Chaoyue Huang; Gejian Zhao; Hanzhou Wu; Zhihua Xia; Asad Malik - [44%] ResNet: Enabling Deep Convolutional Neural Networks through Residual Learning
Xingyu Liu; Kun Ming Goh - [43%] Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks
Shoumik Saha; Jifan Chen; Sam Mayers; Sanjay Krishna Gouda; Zijian Wang; Varun Kumar - [43%] Membership Inference Attacks on Tokenizers of Large Language Models
Meng Tong; Yuntao Du; Kejiang Chen; Weiming Zhang; Ninghui Li - [43%] Catch-Only-One: Non-Transferable Examples for Model-Specific Authorization
Zihan Wang; Zhiyong Ma; Zhongkui Ma; Shuofeng Liu; Akide Liu; Derui Wang; Minhui Xue; Guangdong Bai - [43%] RoBCtrl: Attacking GNN-Based Social Bot Detectors via Reinforced Manipulation of Bots Control Interaction
Yingguang Yang; Xianghua Zeng; Qi Wu; Hao Peng; Yutong Xia; Hao Liu; Bin Chong; Philip S. Yu - [43%] AEX-NStep: Probabilistic Interrupt Counting Attacks on Intel SGX
Nicolas Dutly; Friederike Groschupp; Ivan Puddu; Kari Kostiainen; Srdjan Capkun - [43%] GUIDE: Enhancing Gradient Inversion Attacks in Federated Learning with Denoising Models
Vincenzo Carletti; Pasquale Foggia; Carlo Mazzocca; Giuseppe Parrella; Mario Vento - [43%] Provable Generalization Bounds for Deep Neural Networks with Momentum-Adaptive Gradient Dropout
Adeel Safder - [42%] Jailbreaking LLMs via Semantically Relevant Nested Scenarios with Targeted Toxic Knowledge
Ning Xu; Bo Gao; Hui Dou - [42%] A Bilevel Optimization Framework for Adversarial Control of Gas Pipeline Operations
Tejaswini Sanjay Katale; Lu Gao; Yunpeng Zhang; Alaa Senouci - [42%] LLMAtKGE: Large Language Models as Explainable Attackers against Knowledge Graph Embeddings
Ting Li; Yang Yang; Yipeng Yu; Liang Yao; Guoqing Chao; Ruifeng Xu - [42%] Transferable Black-Box One-Shot Forging of Watermarks via Image Preference Models
Tomáš Souček; Sylvestre-Alvise Rebuffi; Pierre Fernandez; Nikola Jovanović; Hady Elsahar; Valeriu Lacatusu; Tuan Tran; Alexandre Mourachko - [41%] UCD: Unconditional Discriminator Promotes Nash Equilibrium in GANs
Mengfei Xia; Nan Xue; Jiapeng Zhu; Yujun Shen - [41%] DIA: The Adversarial Exposure of Deterministic Inversion in Diffusion Models
Seunghoo Hong; Geonho Son; Juhun Lee; Simon S. Woo - [41%] ECLipsE-Gen-Local: Efficient Compositional Local Lipschitz Estimates for Deep Neural Networks
Yuezhu Xu; S. Sivaranjani - [41%] System Password Security: Attack and Defense Mechanisms
Chaofang Shi; Zhongwen Li; Xiaoqi Li - [41%] MEASER: Malware embedding attacks on open-source LLMs
Ming Tan; Wei Li; Hu Tao; Hailong Ma; Aodi Liu; Qian Chen; Zilong Wang - [41%] Living Off the LLM: How LLMs Will Change Adversary Tactics
Sean Oesch; Jack Hutchins; Luke Koch; Kevin Kurian - [41%] Active Honeypot Guardrail System: Probing and Confirming Multi-Turn LLM Jailbreaks
ChenYu Wu; Yi Wang; Yang Liao - [41%] Floating-Point Neural Network Verification at the Software Level
Edoardo Manino; Bruno Farias; Rafael Sá Menezes; Fedor Shmarov; Lucas C. Cordeiro - [40%] Global-focal Adaptation with Information Separation for Noise-robust Transfer Fault Diagnosis
Junyu Ren; Wensheng Gan; Guangyu Zhang; Wei Zhong; Philip S. Yu - [40%] On Thin Ice: Towards Explainable Conservation Monitoring via Attribution and Perturbations
Jiayi Zhou; Günel Aghakishiyeva; Saagar Arya; Julian Dale; James David Poling; Holly R. Houliston; Jamie N. Womble; Gregory D. Larsen; David W. Johnston; Brinnae Bent
2025-09 (39 papers)
- [97%] The Impact of Scaling Training Data on Adversarial Robustness
Marco Zimmerli; Andreas Plesner; Till Aczel; Roger Wattenhofer - [94%] Are Robust LLM Fingerprints Adversarially Robust?
Anshul Nasery; Edoardo Contente; Alkin Kaz; Pramod Viswanath; Sewoong Oh - [86%] SoK: Systematic analysis of adversarial threats against deep learning approaches for autonomous anomaly detection systems in SDN-IoT networks
Tharindu Lakshan Yasarathna; Nhien-An Le-Khac - [82%] Stealthy Yet Effective: Distribution-Preserving Backdoor Attacks on Graph Classification
Xiaobao Wang; Ruoxiao Sun; Yujun Zhang; Bingdao Feng; Dongxiao He; Luzhi Wang; Di Jin - [81%] Influence-Guided Concolic Testing of Transformer Robustness
Chih-Duo Hong; Chih-Cheng Yang; Yu Wang; Fang Yu - [79%] Leveraging Vulnerabilities in Temporal Graph Neural Networks via Strategic High-Impact Assaults
Dong Hyun Jeon; Lijing Zhu; Haifang Li; Pengze Li; Jingna Feng; Tiehang Duan; Houbing Herbert Song; Cui Tao; Shuteng Niu - [73%] DeepProv: Behavioral Characterization and Repair of Neural Networks via Inference Provenance Graph Analysis
Firas Ben Hmida; Abderrahmen Amich; Ata Kaboudi; Birhanu Eshete - [71%] Reconcile Certified Robustness and Accuracy for DNN-based Smoothed Majority Vote Classifier
Gaojie Jin; Xinping Yi; Xiaowei Huang - [68%] Observation-Free Attacks on Online Learning to Rank
Sameep Chattopadhyay; Nikhil Karamchandani; Sharayu Moharir - [66%] PUREVQ-GAN: Defending Data Poisoning Attacks through Vector-Quantized Bottlenecks
Alexander Branch; Omead Pooladzandi; Radin Khosraviani; Sunay Gajanan Bhat; Jeffrey Jiang; Gregory Pottie - [64%] [Re] Improving Interpretation Faithfulness for Vision Transformers
Izabela Kurek; Wojciech Trejter; Stipe Frkovic; Andro Erdelez - [63%] Temporal Logic-Based Multi-Vehicle Backdoor Attacks against Offline RL Agents in End-to-end Autonomous Driving
Xuan Chen; Shiwei Feng; Zikang Xiong; Shengwei An; Yunshu Mao; Lu Yan; Guanhong Tao; Wenbo Guo; Xiangyu Zhang - [59%] Deceptive Beauty: Evaluating the Impact of Beauty Filters on Deepfake and Morphing Attack Detection
Sara Concas; Simone Maurizio La Cava; Andrea Panzino; Ester Masala; Giulia Orrù; Gian Luca Marcialis - [57%] Reliability Crisis of Reference-free Metrics for Grammatical Error Correction
Takumi Goto; Yusuke Sakai; Taro Watanabe - [56%] Learning Dynamics of Deep Learning — Force Analysis of Deep Neural Networks
Yi Ren - [56%] Generalizable Speech Deepfake Detection via Information Bottleneck Enhanced Adversarial Alignment
Pu Huang; Shouguang Wang; Siya Yao; Mengchu Zhou - [54%] Smaller is Better: Enhancing Transparency in Vehicle AI Systems via Pruning
Sanish Suwal; Shaurya Garg; Dipkamal Bhusal; Michael Clifford; Nidhi Rastogi - [52%] A Multi-Agent LLM Defense Pipeline Against Prompt Injection Attacks
S M Asif Hossain; Ruksat Khan Shayoni; Mohd Ruhul Ameen; Akif Islam; M. F. Mridha; Jungpil Shin - [50%] Off-Path TCP Exploits: PMTUD Breaks TCP Connection Isolation in IP Address Sharing Scenarios
Xuewei Feng; Zhaoxi Li; Qi Li; Ziqiang Wang; Kun Sun; Ke Xu - [50%] Generative Adversarial Networks Applied for Privacy Preservation in Biometric-Based Authentication and Identification
Lubos Mjachky; Ivan Homoliak - [50%] The Use of the Simplex Architecture to Enhance Safety in Deep-Learning-Powered Autonomous Systems
Federico Nesti; Niko Salamini; Mauro Marinoni; Giorgio Maria Cicero; Gabriele Serra; Alessandro Biondi; Giorgio Buttazzo - [49%] Revealing Adversarial Smart Contracts through Semantic Interpretation and Uncertainty Estimation
Yating Liu; Xing Su; Hao Wu; Sijin Li; Yuxi Cheng; Fengyuan Xu; Sheng Zhong - [48%] Delving into Cryptanalytic Extraction of PReLU Neural Networks
Yi Chen; Xiaoyang Dong; Ruijie Ma; Yantian Shen; Anyu Wang; Hongbo Yu; Xiaoyun Wang - [48%] Your RAG is Unfair: Exposing Fairness Vulnerabilities in Retrieval-Augmented Generation via Backdoor Attacks
Gaurav Bagwe; Saket S. Chaturvedi; Xiaolong Ma; Xiaoyong Yuan; Kuang-Ching Wang; Lan Zhang - [45%] Inverting Trojans in LLMs
Zhengxing Li; Guangmingmei Yang; Jayaram Raghuram; David J. Miller; George Kesidis - [45%] Nonlinear Optimization with GPU-Accelerated Neural Network Constraints
Robert Parker; Oscar Dowson; Nicole LoGiudice; Manuel Garcia; Russell Bent - [45%] SafeBehavior: Simulating Human-Like Multistage Reasoning to Mitigate Jailbreak Attacks in Large Language Models
Qinjian Zhao; Jiaqi Wang; Zhiqiang Gao; Zhihao Dou; Belal Abuhaija; Kaizhu Huang - [44%] Time-Constrained Intelligent Adversaries for Automation Vulnerability Testing: A Multi-Robot Patrol Case Study
James C. Ward; Alex Bott; Connor York; Edmund R. Hunt - [43%] Seeing is Deceiving: Mirror-Based LiDAR Spoofing for Autonomous Vehicle Deception
Selma Yahia; Ildi Alla; Girija Bangalore Mohan; Daniel Rau; Mridula Singh; Valeria Loscri - [43%] No Prior, No Leakage: Revisiting Reconstruction Attacks in Trained Neural Networks
Yehonatan Refael; Guy Smorodinsky; Ofir Lindenbaum; Itay Safran - [43%] Secret Leader Election in Ethereum PoS: An Empirical Security Analysis of Whisk and Homomorphic Sortition under DoS on the Leader and Censorship Attacks
Tereza Burianová; Martin Perešíni; Ivan Homoliak - [43%] SPATA: Systematic Pattern Analysis for Detailed and Transparent Data Cards
João Vitorino; Eva Maia; Isabel Praça; Carlos Soares - [42%] "Your AI, My Shell": Demystifying Prompt Injection Attacks on Agentic AI Coding Editors
Yue Liu; Yanjie Zhao; Yunbo Lyu; Ting Zhang; Haoyu Wang; David Lo - [42%] Explainable and Resilient ML-Based Physical-Layer Attack Detectors
Aleksandra Knapińska; Marija Furdek - [41%] Detecting and Rectifying Noisy Labels: A Similarity-based Approach
Dang Huu-Tien; Minh-Phuong Nguyen; Naoya Inoue - [41%] Less is More: Towards Simple Graph Contrastive Learning
Yanan Zhao; Feng Ji; Jingyang Dai; Jiaze Ma; Wee Peng Tay - [41%] Preventing Prompt Injection with Type-Directed Privilege Separation
Dennis Jacob; Emad Alghamdi; Zhanhao Hu; Basel Alomair; David Wagner - [41%] STaR-Attack: A Spatio-Temporal and Narrative Reasoning Attack Framework for Unified Multimodal Understanding and Generation Models
Shaoxiong Guo; Tianyi Du; Lijun Li; Yuyao Wu; Jie Li; Jing Shao - [40%] FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction
Runqi Lin; Alasdair Paren; Suqin Yuan; Muyang Li; Philip Torr; Adel Bibi; Tongliang Liu