1HallusionBench
A diagnostic benchmark for language hallucination and visual illusion.
control groupsvisual illusionlanguage hallucination
Image QA
vision-language
CVPR 2024
First posted Oct 23, 2023
52 tasks
Authors: Tianrui Guan, Fuxiao Liu, Xiyang Wu·Corresponding: not specified·Affiliation: University of Maryland, College Park
2POPE
Object perception benchmark for probing object hallucination.
object existenceyes/no probingadversarial negatives
Object Hallucination
vision-language
EMNLP 2023
First posted May 17, 2023
3 splits
Authors: Yifan Li, Yifan Du, Kun Zhou·Corresponding: Wayne Xin Zhao·Affiliation: Renmin University of China; Meituan Group
3MME
A comprehensive multimodal evaluation suite with perception tasks used for hallucination analysis.
perceptioncognitionmulti-task evaluation
Evaluation Suite
vision-language
NeurIPS 2025
First posted Jun 23, 2023
28 models
Authors: Chaoyou Fu, Peixian Chen, Yunhang Shen·Corresponding: Ke Li·Affiliation: Nanjing University; Tencent Youtu Lab; Xiamen University; CASIA
4CHAIR
Classic object hallucination metric and benchmark setup.
captioningobject labelshallucination rate
Captioning
vision-language
CVPR 2018
First posted Sep 6, 2018
2 metrics
Authors: Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns·Corresponding: not specified·Affiliation: UC Berkeley; Boston University
5AMBER
A benchmark for multimodal hallucination evaluation across tasks.
existenceattributesrelations
Multitask
vision-language
arXiv 2023
First posted Nov 13, 2023
11 settings
Authors: Junyang Wang, Yuhang Wang, Guohai Xu·Corresponding: not specified·Affiliation: Beijing Jiaotong University; Alibaba Group
6Visually Dehallucinative Instruction Generation: Know What You Don't Know
Evaluates idk (ik) with Dis tasks using Acc metrics.
discriminationidk (ik)
Image QA
vision-language
ICASSP 2024
First posted Feb 15, 2024
6,624 / Acc
Authors: Sungguk Cha, Jusung Lee, Younghyun Lee·Corresponding: Sungguk Cha, Cheoljong Yang·Affiliation: Multimodal AI Lab., NC Research, NCSOFT Corporation
7HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal Reasoning
Evaluates synthetic images / vqa with Gen tasks using Acc metrics.
object-levelgenerationsynthetic images vqa
Image QA
vision-language
ECCV 2024
First posted Jul 22, 2024
7,748 / Acc
Authors: Zhecan Wang, Garrett Bingham, Adams Yu·Corresponding: not specified·Affiliation: Columbia University, New York, NY 10027; Google DeepMind, Mountain View, CA 94043
8HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models
Evaluates speech/sound/music with Dis & Gen tasks using Acc / Hallucination Rate metrics.
discriminationgenerationspeechsoundmusic
Image QA
vision-language
5,000+ / Acc / Hallucination Rate
Authors: Feiyu Zhao, Yiming Chen, Wenhuan Lu·Corresponding: Xianghu Yue·Affiliation: College of Intelligence and Computing, Tianjin University, China; ASUS Intelligent Cloud Services, Singapore
9Detecting and Evaluating Medical Hallucinations in Large Vision Language Models
Evaluates medical context with Dis & Gen tasks using MediHall Score metrics.
object-levelattribute-leveldiscriminationgeneration
Image QA
vision-language
arXiv 2024
First posted Jun 14, 2024
889,125 / MediHall Score
Authors: Jiawei Chen, Dingkang Yang, Tong Wu·Corresponding: not specified·Affiliation: Academy for Engineering and Technology, Fudan University, Shanghai, China; Tencent Youtu Lab, Shanghai, China; Cognition and Intelligent Technology Laboratory, Shanghai, China; Engineering Research Center of AI and Robotics, Ministry of Education, Shanghai, China; AI and Unmanned Systems Engineering Research Center of Jilin Province, Changchun, China
10VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
Evaluates temporal/extrinsic with Dis & Gen tasks using Acc metrics.
object-levelrelation-leveldiscriminationgeneration
Image QA
vision-language
arXiv 2024
First posted Jun 24, 2024
1,800 / Acc
Authors: Yuxuan Wang, Yueqian Wang, Dongyan Zhao·Corresponding: not specified·Affiliation: Beijing Institute for General Artificial Intelligence, Beijing China; State Key Laboratory of General Artificial Intelligence, Beijing, China; Wangxuan Institute of Computer Technology, Peking University, Beijing, China; Computer Science and Engineering, University of California, Santa Cruz
11MedVH: Towards Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context
Evaluates medical context with Dis & Gen tasks using Characterization Score metrics.
object-levelattribute-leveldiscriminationgeneration
Image QA
vision-language
arXiv 2024
First posted Jul 3, 2024
2,000 / Characterization Score
Authors: Zishan Gu, Changchang Yin, Fenglin Liu·Corresponding: not specified·Affiliation: The Ohio State University; University of Oxford
12EventHallusion: Diagnosing Event Hallucinations in Video LLMs
Evaluates video event with Dis & Gen tasks using Accuracy metrics.
discriminationgenerationvideo event
Image QA
vision-language
arXiv 2024
First posted Sep 25, 2024
711 / Accuracy
Authors: Jiacheng Zhang, Yang Jiao, Shaoxiang Chen·Corresponding: not specified·Affiliation: Shanghai Key Lab of Intelligent Information Processing, School of CS, Fudan University; Shanghai Collaborative Innovation Center on Intelligent Visual Computing; Singapore University of Technology and Design; Shanghai Academy of Artificial Intelligence for Science; Meituan
13Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning
Evaluates dialogue hallucination with Dis & Gen tasks using Acc metrics.
object-levelattribute-leveldiscriminationgeneration
Image QA
vision-language
arXiv 2024
First posted Mar 15, 2024
N/A / Acc
Authors: Dongmin Park, Zhaofang Qian, Guangxing Han·Corresponding: not specified·Affiliation: KRAFTON; UC San Diego; University of Central Florida
14Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs
Evaluates grounded medical with Gen tasks using Acc / Loc metrics.
object-levelgenerationgrounded medical
Image QA
vision-language
arXiv 2025
First posted Apr 30, 2025
67,000 / Acc / Loc
Authors: Dung Nguyen, Minh Khoi Ho, Huy Ta·Corresponding: not specified·Affiliation: Hanoi University of Science and Technology; University of Wollongong; Australian Institute for Machine Learning, The University of Adelaide; Griffith University; College of Medicine and Public Health, Flinders University
15MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models
Evaluates multi-image reasoning with Dis & Gen tasks using Acc metrics.
object-leveldiscriminationgenerationmulti-image reasoning
Image QA
vision-language
arXiv 2025
First posted Aug 1, 2025
3,000 / Acc
Authors: Jiale Li, Mingrui Wu, Zixiang Jin·Corresponding: not specified·Affiliation: Xiamen University; Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China; Zhongguancun Academy
16The Instinctive Bias: Spurious Images lead to Illusion in MLLMs
Evaluates spurious images with Dis tasks using Acc metrics.
object-leveldiscriminationspurious images
Image QA
vision-language
arXiv 2024
First posted Feb 6, 2024
7,308 / Acc
Authors: Tianyang Han, Qing Lian, Rui Pan·Corresponding: not specified·Affiliation: The Hong Kong University of Science and Technology; University of Illinois at Urbana-Champaign; The Hong Kong Polytechnic University
17Explore the Hallucination on Low-level Perception for MLLMs
Evaluates low-level perception with Gen tasks using Acc metrics.
attribute-levelgenerationlow-level perception
Image QA
vision-language
arXiv 2024
First posted Sep 15, 2024
4,989 / Acc
Authors: Yinan Sun, Zicheng Zhang, Haoning Wu·Corresponding: not specified·Affiliation: Shanghai Jiao Tong University; Nanyang Technological University
18JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images
Evaluates imaginary vqa with Dis & Gen tasks using Acc metrics.
object-levelattribute-leveldiscriminationgeneration
Image QA
vision-language
arXiv 2024
First posted Sep 19, 2024
13,500 / Acc
Authors: Zhecan Wang, Junzhang Liu, Chia-Wei Tang·Corresponding: not specified·Affiliation: Columbia University; UCLA; Virginia Tech
19Detecting and Preventing Hallucinations in Large Vision Language Models
Evaluates fine-grained with Dis tasks using Reward Score metrics.
object-levelattribute-levelrelation-leveldiscrimination
Object Hallucination
vision-language
AAAI 2024
First posted Aug 11, 2023
16,000 / Reward Score
Authors: Anisha Gunjal, Jihan Yin, Erhan Bas·Corresponding: not specified·Affiliation:
20Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models
Evaluates negative pronoun with Dis tasks using Acc/METEOR metrics.
object-leveldiscriminationnegative pronoun
Object Hallucination
vision-language
ACL-W 2024
First posted Oct 9, 2023
29,500 / Acc/METEOR
Authors: Holy Lovenia, Wenliang Dai, Samuel Cahyawijaya·Corresponding: not specified·Affiliation: The Hong Kong University of Science and Technology
21THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language Models
Evaluates free-form generations with Gen tasks using P/R/F metrics.
object-levelgenerationfree-form generations
Object Hallucination
vision-language
CVPR 2024
First posted May 8, 2024
5,000 / P/R/F
Authors: Prannay Kaul, Zhizhong Li, Hao Yang·Corresponding: not specified·Affiliation: VGG, University of Oxford; AWS AI Labs
22Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models
Evaluates object counting with Dis tasks using Acc / Consistency metrics.
object-levelattribute-leveldiscriminationobject counting
Object Hallucination
vision-language
arXiv 2024
First posted Mar 3, 2024
20,000 / Acc / Consistency
Authors: Huixuan Zhang, Junzhe Zhang, Xiaojun Wan·Corresponding: not specified·Affiliation: School of Electronics Engineering and Computer Science, Peking University; Wangxuan Institute of Computer Technology, Peking University
23CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning
Evaluates multimodal hallucination with Dis tasks using Acc/P/R/F1/Specificity metrics.
object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language
NeurIPS-W 2023
First posted Sep 5, 2023
40,367 / Acc/P/R/F1/Specificity
Authors: Hongyu Hu, Jiyuan Zhang, Minyi Zhao·Corresponding: not specified·Affiliation: ByteDance Inc, Shanghai
24Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models
Evaluates visual grounding with Dis tasks using Accuracy metrics.
object-levelrelation-leveldiscriminationvisual grounding
Evaluation Suite
vision-language
CVPR 2025
First posted Dec 3, 2023
31,373 / Accuracy
Authors: Andrés Villa, Juan Carlos León Alcázar, Alvaro Soto·Corresponding: not specified·Affiliation: King Abdullah University of Science and Technology (KAUST); Pontificia Universidad Católica de Chile
25Unified Hallucination Detection for Multimodal Large Language Models
Evaluates t2i with Gen tasks using Acc/P/R/F metrics.
object-levelattribute-levelgenerationt2i
Evaluation Suite
vision-language
ACL 2024
First posted Feb 5, 2024
1,860 / Acc/P/R/F
Authors: Xiang Chen, Chenxi Wang, Yida Xue·Corresponding: Huajun Chen·Affiliation: College of Computer Science and Technology, Zhejiang University; School of Software Technology, Zhejiang University; Zhejiang University-Ant Group Joint Laboratory of Knowledge Graph; Ant Group
26Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models
Evaluates event hallucination with Dis & Gen tasks using Acc/Score metrics.
object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language
ACMMM 2024
First posted Feb 24, 2024
10,000 / Acc/Score
Authors: Chaoya Jiang, Hongrui Jia, Wei Ye·Corresponding: not specified·Affiliation: National Engineering Research Center for Software Engineering, Peking University; DAMO Academy, Alibaba Group
27VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models
Evaluates multimodal hallucination with Gen tasks using Faithfulness & Coverage metrics.
object-levelattribute-levelrelation-levelgeneration
Evaluation Suite
vision-language
ACL 2024
First posted Apr 22, 2024
211 / Faithfulness & Coverage
Authors: Haoyi Qiu, Wenbo Hu, Zi-Yi Dou·Corresponding: not specified·Affiliation: University of California, Los Angeles
28AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models
Evaluates multimodal hallucination with Dis tasks using ASR/MASR/CASR metrics.
object-leveldiscrimination
Evaluation Suite
vision-language
EMNLP 2024
First posted Jun 16, 2024
5,000 / ASR/MASR/CASR
Authors: Xiyang Wu, Tianrui Guan, Dianqi Li·Corresponding: not specified·Affiliation: University of Maryland, College Park
29ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models
Evaluates open-set with Dis & Gen tasks using AMBER/Acc metrics.
object-levelattribute-leveldiscriminationgeneration
Evaluation Suite
vision-language
CVPR 2025
First posted Sep 14, 2024
8,786 / AMBER/Acc
Authors: Yahan Tu, Rui Hu, Jitao Sang·Corresponding: not specified·Affiliation: Beijing Key Lab of Traffic Data Analysis and Mining; Beijing Jiaotong University, China
30Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
Evaluates ocr/action/counting with Dis & Gen tasks using Hallucination Rate metrics.
object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language
arXiv 2024
First posted Jun 24, 2024
4,000 / Hallucination Rate
Authors: Bei Yan, Jie Zhang, Zheng Yuan·Corresponding: not specified·Affiliation: Institute of Computing Technology, Chinese Academy of Sciences; University of Chinese Academy of Sciences; Key Laboratory of Al Safety, Chinese Academy of Sciences
31FIHA: Autonomous Hallucination Evaluation in Vision-Language Models with Davidson Scene Graphs
Evaluates eval method with Dis & Gen tasks using Acc/P/R/F1 metrics.
object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language
arXiv 2024
First posted Sep 20, 2024
N/A / Acc/P/R/F1
Authors: Bowen Yan, Zhengsong Zhang, Liqiang Jing·Corresponding: not specified·Affiliation: University of Texas at Dallas, Richardson, United States
32TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions
Evaluates unanswerable qs with Dis tasks using Acc metrics.
object-levelrelation-leveldiscriminationunanswerable qs
Evaluation Suite
vision-language
arXiv 2024
First posted Oct 5, 2024
2,354 / Acc
Authors: Xingwei He, Qianru Zhang, A-Long Jin·Corresponding: not specified·Affiliation: The University of Hong Kong; Xi’an Jiaotong-Liverpool University; School of Computer Science and Engineering, Beihang University, Beijing, China; State Key Laboratory of Software, Development Environment; Zhongguancun Laboratory
33MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models
Evaluates manipulation/ooc/veracity with Dis & Gen tasks using Acc/F1 metrics.
discriminationgenerationmanipulationoocveracity
Evaluation Suite
vision-language
arXiv 2024
First posted Jun 17, 2024
35,000 / Acc/F1
Authors: Shengkang Wang, Hongzhan Lin, Ziyang Luo·Corresponding: not specified·Affiliation: Beijing University of Posts and Telecommunications; Hong Kong Baptist University; Hong Kong University of Science and Technology
34Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs
Evaluates perturbed inputs with Dis tasks using Acc metrics.
object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language
arXiv 2024
First posted Aug 2, 2024
1,260 / Acc
Authors: Peng Ding, Jingyu Wu, Jun Kuang·Corresponding: not specified·Affiliation: National Key Laboratory for Novel Software Technology, Nanjing University; College of Computer Science and Technology, Zhejiang University; Zhejiang-Singapore Innovation and AI Joint Research Lab, Zhejiang University
35CAST: Cross-modal Alignment Similarity Test for Vision Language Models
Evaluates self-consistency with Dis & Gen tasks using Similarity metrics.
object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language
arXiv 2024
First posted Sep 17, 2024
15,000 / Similarity
Authors: Gautier Dagan, Olga Loginova, Anil Batra·Corresponding: not specified·Affiliation: University of Edinburgh; University of Trento
36FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models
Evaluates obj. counting with Gen tasks using FaithScore metrics.
object-levelattribute-levelrelation-levelgeneration
Captioning
vision-language
EMNLP 2024
First posted Nov 2, 2023
2,000 / FaithScore
Authors: Liqiang Jing, Ruosen Li, Yunmo Chen·Corresponding: not specified·Affiliation: University of Texas at Dallas; Johns Hopkins University; University of Notre Dame
37Mitigating Open-Vocabulary Caption Hallucinations
Evaluates open-vocabulary with Gen tasks using OpenCHAIR metrics.
object-levelattribute-levelgenerationopen-vocabulary
Captioning
vision-language
EMNLP 2024
First posted Dec 6, 2023
2,000 / OpenCHAIR
Authors: Assaf Ben-Kish, Moran Yanuka, Morris Alper·Corresponding: not specified·Affiliation: Tel-Aviv University
38HallE-Control: Controlling Object Hallucination in Large Multimodal Models
Evaluates multimodal hallucination with Gen tasks using CHAIR/Coverage metrics.
object-levelgeneration
Captioning
vision-language
arXiv 2023
First posted Oct 3, 2023
100 / CHAIR/Coverage
Authors: Bohan Zhai, Shijia Yang, Chenfeng Xu·Corresponding: not specified·Affiliation: ByteDance Inc.; Stanford University; UC Berkeley; UIUC
39ALOHa: A New Measure for Hallucination in Captioning Models
Evaluates captioning metric with Gen tasks using ALOHa metrics.
object-levelgenerationcaptioning metric
Captioning
vision-language
arXiv 2024
First posted Apr 3, 2024
N/A / ALOHa
Authors: Suzanne Petryk, David M. Chan, Anish Kachinthaya·Corresponding: not specified·Affiliation: University of California, Berkeley
40Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?
Evaluates metric method with Gen tasks using CHAIR-MEN / FaithScore metrics.
object-levelgenerationmetric method
Captioning
vision-language
arXiv 2024
First posted Jun 20, 2024
N/A / CHAIR-MEN / FaithScore
Authors: Gregor Geigle, Radu Timofte, Goran Glavaš·Corresponding: not specified·Affiliation: WüNLP; Computer Vision Lab, CAIDAS, University of Würzburg
41Aligning Large Multimodal Models with Factually Augmented RLHF
Evaluates model bias with Gen tasks using LLM Rating metrics.
object-levelgenerationmodel bias
Multitask
vision-language
ACL 2024
First posted Sep 25, 2023
96 / LLM Rating
Authors: Zhiqing Sun, Sheng Shen, Shengcao Cao·Corresponding: not specified·Affiliation: UC Berkeley; CMU; UIUC; UW–Madison; UMass Amherst; Microsoft Research; MIT-IBM Watson AI Lab
42Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
Evaluates env/action/comp with Gen tasks using LLM Rating metrics.
object-levelattribute-levelrelation-levelgeneration
Multitask
vision-language
ICLR 2024
First posted Jun 26, 2023
1,000 / LLM Rating
Authors: Fuxiao Liu, Kevin Lin, Linjie Li·Corresponding: not specified·Affiliation: University of Maryland, College Park; Microsoft Corporation
43Mitigating Fine-Grained Hallucination by Fine-Tuning Large Vision-Language Models with Caption Rewrites
Evaluates behaviour with Dis tasks using Acc/P/R/F metrics.
object-levelattribute-levelrelation-leveldiscrimination
Multitask
vision-language
MMM 2024
First posted Dec 4, 2023
200 / Acc/P/R/F
Authors: Lei Wang, Jiabang He, Shenshen Li·Corresponding: not specified·Affiliation: Singapore Management University, Beijing Forestry University; University of Electronic Science and Technology of China
44Visual Hallucinations of Multi-modal Large Language Models
Evaluates visual hallucination with Dis & Gen tasks using Acc metrics.
object-levelattribute-leveldiscriminationgeneration
Multitask
vision-language
ACL 2024
First posted Feb 22, 2024
1,200 / Acc
Authors: Wen Huang, Hongbin Liu, Minxin Guo·Corresponding: not specified·Affiliation: University of Science & Technology of China; Duke University; The University of Hong Kong
45PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset
Evaluates sentiment with Dis tasks using PhD Index metrics.
object-levelattribute-levelrelation-leveldiscrimination
Multitask
vision-language
CVPR 2025
First posted Mar 17, 2024
102,564 / PhD Index
Authors: Jiazhen Liu, Yuhan Fu, Ruobing Xie·Corresponding: not specified·Affiliation: Key Lab of DEKE, Renmin University of China; Machine Learning Platform Department, Tencent
46Automated Multi-level Preference for MLLMs
Evaluates multi-round conv with Gen tasks using Preference Score metrics.
object-levelattribute-levelgenerationmulti-round conv
Multitask
vision-language
NeurIPS 2024
First posted May 18, 2024
N/A / Preference Score
Authors: Mengxi Zhang, Wenhao Wu, Yu Lu·Corresponding: not specified·Affiliation: Baidu Inc.; Tianjin University; The University of Sydney; University of Technology Sydney; Tsinghua University; Chinese Academy of Science
47Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models
Evaluates multimodal hallucination with Dis tasks using Acc/P/R/F1 metrics.
object-levelrelation-leveldiscrimination
Multitask
vision-language
ICML 2024
First posted Jun 24, 2024
8,030 / Acc/P/R/F1
Authors: Mingrui Wu, Jiayi Ji, Oucheng Huang·Corresponding: Jiayi Ji·Affiliation: Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China
48Multi-Object Hallucination in Vision-Language Models
Evaluates multi-object with Gen tasks using Accuracy metrics.
object-levelattribute-levelrelation-levelgeneration
Multitask
vision-language
NeurIPS 2024
First posted Jul 8, 2024
5,000 / Accuracy
Authors: Xuweiyi Chen, Ziqiao Ma, Xuejun Zhang·Corresponding: not specified·Affiliation: University of Michigan; University of Virginia; New York University
49BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-language Models
Evaluates before-after changes with Dis tasks using TU/IG/SB/ID metrics.
object-leveldiscriminationbefore-after changes
Multitask
vision-language
ECCV 2024
First posted Jul 18, 2024
26,064 / TU/IG/SB/ID
Authors: Moon Ye-Bin, Nam Hyeon-Woo, Wonseok Choi·Corresponding: not specified·Affiliation: Dept. of EE, POSTECH, Korea; Grad. School of AI, POSTECH, Korea; Institute for Convergence Research and Education in Advanced Technology, Yonsei University, Korea
50Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models
Evaluates perceptive / cognitive with Dis & Gen tasks using R-score metrics.
relation-leveldiscriminationgenerationperceptive cognitive
Multitask
vision-language
ACL 2025
First posted Aug 18, 2024
21,880 / R-score
Authors: Kening Zheng, Junkai Chen, Yibo Yan·Corresponding: Xuming Hu·Affiliation: Hong Kong University of Science and Technology (Guangzhou); Guangxi Zhuang Autonomous Region Big Data Research Institute; Hong Kong University of Science and Technology
51Antidote: A Unified Framework for Mitigating LVLM Hallucinations in Counterfactual Presupposition and Object Perception
Evaluates cp-bench mitigation with Gen tasks using Acc metrics.
object-levelgenerationcp-bench mitigation
Multitask
vision-language
CVPR 2025
First posted Apr 29, 2025
N/A / Acc
Authors: Yuanchen Wu, Lu Zhang, Hang Yao·Corresponding: not specified·Affiliation: School of Computer Engineering & Science, Shanghai University; Tencent YouTu Lab
52EH-Benchmark: Ophthalmic hallucination benchmark and agent-driven top-down traceable reasoning workflow
Evaluates ophthalmology with Dis & Gen tasks using N/A metrics.
discriminationgenerationophthalmology
Multitask
vision-language
Information Fusion 2026
First posted Jul 24, 2025
N/A / N/A
Authors: Xiaoyu Pan, Yang Bai, Ke Zou·Corresponding: not specified·Affiliation: Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR), 1 Fusionopolis Way, Singapore, 138632; Centre for Innovation and Precision Eye Health; and Department of Ophthalmology, NUHS Tower Block, Level 7, 1E Kent Ridge Road, Singapore, 119228; Singapore Eye Research Institute, Singapore National Eye Centre, 20 College Road, Singapore, 169856
53Evaluation and Analysis of Hallucination in Large Vision-Language Models
Evaluates multimodal hallucination with Gen tasks using LLM Rating metrics.
object-levelgeneration
Multitask
vision-language
arXiv 2023
First posted Aug 29, 2023
25,000 / LLM Rating
Authors: Junyang Wang, Yiyang Zhou, Guohai Xu·Corresponding: not specified·Affiliation: School of Computer and Information Technology, Beijing Jiaotong University, Beijing, China; School of Software Engineering, Xi'an Jiaotong University, Xi'an, China; School of Software, Shandong University, Jinan, China; MAIS, Institute of Automation, Chinese Academy of Sciences (CASIA), Beijing, China; DAMO Academy, Alibaba Group
54Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges
Evaluates model bias with Gen tasks using Human Assessment metrics.
generationmodel bias
Multitask
vision-language
arXiv 2023
First posted Nov 6, 2023
370 / Human Assessment
Authors: Chenhang Cui, Yiyang Zhou, Xinyu Yang·Corresponding: not specified·Affiliation: UNC-Chapel Hill; Carnegie Mellon University; Stanford University; Rutgers University
55MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity
Evaluates instruction tuning with Gen tasks using Acc metrics.
object-levelattribute-levelrelation-levelgeneration
Multitask
vision-language
arXiv 2024
First posted Jul 22, 2024
973,000 / Acc
Authors: Yangzhou Liu, Yue Cao, Zhangwei Gao·Corresponding: not specified·Affiliation: Shanghai AI Laboratory, Shanghai 200232, China; SenseTime Research, Shanghai 200233, China; Tsinghua University, Beijing 100084, China; Nanjing University, Nanjing 210023, China; Fudan University, Shanghai 200433, China; The Chinese University of Hong Kong, Hong Kong 999077, China; Shanghai Jiao Tong University, Shanghai 200240, China
56MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation
Evaluates decoding method with Gen tasks using Acc metrics.
object-levelgenerationdecoding method
Multitask
vision-language
arXiv 2024
First posted Oct 15, 2024
N/A / Acc
Authors: Chenxi Wang, Xiang Chen, Ningyu Zhang·Corresponding: not specified·Affiliation: Zhejiang University; National University of Singapore, NUS-NCS Joint Lab, Singapore
57Mitigating Hallucination in Visual Language Models with Visual Supervision
Evaluates multimodal hallucination with Dis tasks using False Positive Rate metrics.
object-levelattribute-levelrelation-leveldiscrimination
Multitask
vision-language
arXiv 2023
First posted Nov 27, 2023
3,000 / False Positive Rate
Authors: Zhiyang Chen, Yousong Zhu, Yufei Zhan·Corresponding: not specified·Affiliation: Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences; School of Artificial Intelligence, University of Chinese Academy of Sciences; Peng Cheng Laboratory; Wuhan AI Research
58ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling
Evaluates grounding with Gen tasks using Fine-Grained Reward metrics.
object-levelattribute-levelrelation-levelgeneration
Multitask
vision-language
arXiv 2024
First posted Feb 9, 2024
16,000 / Fine-Grained Reward
Authors: Siming Yan, Min Bai, Weifeng Chen·Corresponding: not specified·Affiliation: The University of Texas at Austin; AWS AI
59Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models
Evaluates unsolvable (upd) with Dis tasks using Acc metrics.
discriminationunsolvable (upd)
Multitask
vision-language
arXiv 2024
First posted Mar 29, 2024
2,095 / Acc
Authors: Atsuyuki Miyai, Jingkang Yang, Jingyang Zhang·Corresponding: not specified·Affiliation: The University of Tokyo; S-Lab, Nanyang Technological University; Duke University; University of Wisconsin-Madison; LY Corporation; Tokyo University of Science
60Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models
Evaluates generated distractions with Dis tasks using Acc metrics.
object-levelattribute-leveldiscriminationgenerated distractions
Multitask
vision-language
arXiv 2024
First posted Jun 30, 2024
4,973 / Acc
Authors: Weihong Zhong, Xiaocheng Feng, Liang Zhao·Corresponding: not specified·Affiliation: Harbin Institute of Technology; Peng Cheng Laboratory
61LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences
Evaluates societal bias/pref with Dis tasks using Alignment/Bias metrics.
discriminationsocietal biaspref
Multitask
vision-language
arXiv 2025
First posted Jul 25, 2025
N/A / Alignment/Bias
Authors: Yusuke Hirota, Boyi Li, Ryo Hachiuma·Corresponding: not specified·Affiliation: NVIDIA Research; Osaka University; Stanford University
62How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts
Evaluates deceptive prompts with Gen tasks using Acc metrics.
object-levelattribute-levelgenerationdeceptive prompts
Multitask
vision-language
arXiv 2024
First posted Feb 20, 2024
1,000 / Acc
Authors: Yusu Qian, Haotian Zhang, Yinfei Yang·Corresponding: not specified·Affiliation: Apple
63VLind-Bench: Measuring Language Priors in Large Vision-Language Models
Evaluates language priors with Dis tasks using Acc (Y/N) metrics.
object-leveldiscriminationlanguage priors
Multitask
vision-language
arXiv 2024
First posted Jun 13, 2024
2,576 / Acc (Y/N)
Authors: Kang-il Lee, Minbeom Kim, Seunghyun Yoon·Corresponding: not specified·Affiliation: ECE, SNU; IPAI, SNU
64MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models
Evaluates relation understanding with Dis & Gen tasks using Acc metrics.
object-levelrelation-leveldiscriminationgeneration
Multitask
vision-language
arXiv 2024
First posted Jun 13, 2024
22,500 / Acc
Authors: Jiahao Nie, Gongjie Zhang, Wenbin An·Corresponding: not specified·Affiliation: IGP, Nanyang Technological University; Nanyang Technological University; Alibaba DAMO Academy; Xi’an Jiaotong University
65Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
Evaluates alignment method with Dis tasks using Pfram metrics.
object-leveldiscriminationalignment method
Multitask
vision-language
arXiv 2024
First posted Sep 2, 2024
N/A / Pfram
Authors: Yueqian Wang, Jianxin Liang, Yuxuan Wang·Corresponding: not specified·Affiliation: Wangxuan Institute of Computer Technology, Peking University; Beijing Institute for General Artificial Intelligence; National Key Laboratory of General Artificial Intelligence