Continuation of Nicholas Carlini's list, covering arXiv submissions since 2025-09-15.
TF-IDF + logistic regression trained on the original 13,697-entry list (held-out AUC 0.998); papers scoring ≥40% shown, grouped by arXiv ID month.
Total: 2839 papers.
Last update: 2026-09-07.


Full list (2839 papers, all months): https://nsl.cs.waseda.ac.jp/papers/advex_papers.html
Download: CSV
Download: CSV
Most recent month
2026-09 (33 papers)
- [96%] MROP: Mask-Region Optimized Purification Against Backdoor Attack in Deep JSCC
Seongkyu Yang; Hyeonho Noh; Hyun Jong Yang; Jonggyu Jang - [96%] Johnny Still Receives Spam SMS: Assessing the Robustness of SMS Spam Detection
Muhammad Salman; Muhammad Islam; Muhammad Ikram; Mohamed Ali Kaafar - [96%] Adversarial Vulnerabilities of Neural Biomarker Identification Systems
Polina Tapal; Bryce-Allen Bagley - [94%] Beyond Small Patches: Black-Box Detection and Purification of Diverse Backdoor Triggers
Ahmed Abdelnaby; Mohamed Elmahallawy - [94%] Preprocessing Failure and Adversarial Detection in Depthwise-Separable Edge Vision Systems
Jannatul Masruk Mukta; Rifa Sanjida; Adrita Rahman Tory; Md. Saifur Rahman; Khondokar Fida Hasan - [93%] InfraPatch: Cross-Task Targeted Grayscale Patch Attacks on Infrared-Adapted Vision-Language Models
Chengyin Hu; Dingyi Lu; Jiaju Han; Xiang Chen; Weiwen Shi; Jiahuan Long; Yiwei Wei; Jiujiang Guo - [88%] Does Reasoning Mitigate Backdoor Attacks? A Neuro-Symbolic Perspective
Marco Antonio Corallo; Andrea Agiollo; Mauro Conti; Alberto Giaretta - [85%] Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain
Daizong Liu; Junhao Dong; Zhiyuan Ma; Xiaoye Qu; Xiang Fang; Runwei Guan; Keke Tang; Jianfeng Dong; Yew-Soon Ong - [84%] PhantomCall: Evading ML Malware Detectors via Function Call Graph Perturbation
Md Ajwad Akil; Adrian Shuai Li; Imtiaz Karim; Arun Iyengar; Ashish Kundu; Elisa Bertino - [84%] Poisoning Attacks on the PGM-index
Atsuki Sato; Martin Aumüller; Yusuke Matsui - [84%] AlcaTRAz – Anchored Tree-Rule Defense Against Jailbreaks
Jakub Reš; Petr Kaška; Martin Perešíni; Martin Ukrop; Kamil Malinka - [82%] Breadth Beats Depth: Improving GCG-Based Jailbreak Optimization with Breadth-Oriented Suffix Search
Shiliang Xiao; Jingsong Wei; Yuzhi Liang; Yufan Zheng; Xia Li; Qiliang Lin - [78%] VerTox: Verifiable Reward-Guided Corpus Poisoning Against Neural Ranking Models
Zhiqi Huang; Vivek Datla; Zhichao Xu; Puxuan Yu; Vivek Srikumar; Alfy Samuel - [78%] SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment
Qingyu Meng; Yiwei Zha; Jiahuan Pei; Koen Hindriks; Herbert Bos; Min Chen - [77%] CodePoisonRAG: Knowledge Poisoning Attacks on Retrieval-Augmented Code Generation
Varun Gadey; Ziad Marey; Alexandra Dmitrienko - [74%] Repeat-After-Me: Black-Box Adaptive Visual Prompt Injection
Sizhe Chen; Yu-Lin Tsai; Ivan Evtimov; Kamalika Chaudhuri; Raluca Ada Popa; David Wagner; Arman Zharmagambetov - [70%] TRIS: A Tri-Layer Retrieval Integrity Sieve Against Knowledge Poisoning
Muhaimin Bin Munir; Akib Jawad Ononto; Nazia Shehnaz Joynab; Bhavani Thuraisingham; Latifur Khan - [69%] MUGEN: Generating Unlearnable Graph Examples for Multiple Learning Tasks
Ziyan Liu; Chengshuai Zhao; Huan Liu - [67%] AKRASIA: Stealthy Backdoor Attack on Reasoning-based Code LLMs
Chua Jin Chou; Sarang Nambiar; Murali Srinivasan; Ezekiel Soremekun - [61%] Towards One-for-All Robustness Across a Continuum of Threat Levels
Zhichao Hou; Xiaorui Liu - [55%] Leveraging Imperfect Restoration for Data Availability Attack
Yi Huang; Jeremy Styborski; Mingzhi Lyu; Fan Wang; Adams Kong - [54%] Jailbreaking Text-to-Image Models Through Cracks: Navigating Heterogeneous Safety Filters via Multi-Agent Debate
Kaiyan Wen; Shijie Zhang; Lu Yu; Guangdong Bai - [53%] Privacy, Robustness, and Fairness Trade-offs in Federated Intrusion Detection: Geometric Indistinguishability at the Aggregation Interface
Adrita Rahman Tory; ABM Shawkat Ali; Md Abu Layek; Khondokar Fida Hasan - [52%] Context Inference Attacks Without Jailbreaks
Prince Jha; Samuele Poppi; Nils Lukas - [51%] When Optimization Becomes Manipulation: Defending Generative Search against Malicious Generative Engine Optimization
Haozhang Li; Yangguang Shao; Xinjie Lin; Zhong Guan; Mi Zhou; Junzheng Shi - [51%] A Robust Watermark-based Fingerprint Framework for GNNs Ownership Verification
Han Zhang; Yan Wang; Guanfeng Liu; Pengfei Ding; Huaxiong Wang; Kwok-Yan Lam - [50%] Privacy Leakage in Federated Learning: Gradient-Based Client Identity Inference and Defenses for Inertial Sensing in Vehicular Edge Networks
Ali Akarma; Toqeer Ali Syed; Muhammad Khan; Qurat-ul-ain Mastoi; Adeel Ahmad - [50%] Extracting Forgotten Prompts from Targeted Unlearned Models
Au Ashley Hoi-Ting; Meghdad Kurmanji; William F. Shen; Nicholas D. Lane; Ligang He - [47%] SISER: Speaker-Invariant Speech Emotion Recognition with Entropy-Based Adversarial Training
Eunseo Choi; Hyunku Kang; Chanwoo Kim - [46%] Inferring Hidden User Models from the Behavior of Personalized LLM Agents
Haoyang Li; Yaxin Xiao; Qingqing Ye; Huadi Zheng; Haibo Hu - [46%] Rethinking Indirect Prompt Injection as a Test-Time Search Problem
Duong M. Nguyen; Joon Sik Kim; Blazej Manczak; Vaikkunth Mugunthan - [45%] From Detection to Refusal: Safer LLMs via Circuit-Guided Weight Scaling
Kuan-Lin Chu; Chung-En Sun; Tsui-Wei Weng - [42%] Optimizing Byzantine Node Placement in Decentralized Federated Learning
Edoardo Gabrielli; Gabriele Tolomei