Skip to content
Home›Datasets & Benchmarks›Overview
🗂️

Datasets & Benchmarks

Datasets and benchmark suites for multimodal hallucination research.

65Curated entries
5Categories
98Verified links
64Dated papers

Tasks, settings, and benchmark notes.

65 curated entries

Dataset Categories

Curated Benchmarks

1

HallusionBench

A diagnostic benchmark for language hallucination and visual illusion.

control groupsvisual illusionlanguage hallucination
Image QA
vision-language

CVPR 2024

First posted Oct 23, 2023

52 tasks
Authors: Tianrui Guan, Fuxiao Liu, Xiyang WuCorresponding: not specifiedAffiliation: University of Maryland, College Park
2

POPE

Object perception benchmark for probing object hallucination.

object existenceyes/no probingadversarial negatives
Object Hallucination
vision-language

EMNLP 2023

First posted May 17, 2023

3 splits
Authors: Yifan Li, Yifan Du, Kun ZhouCorresponding: Wayne Xin ZhaoAffiliation: Renmin University of China; Meituan Group
3

MME

A comprehensive multimodal evaluation suite with perception tasks used for hallucination analysis.

perceptioncognitionmulti-task evaluation
Evaluation Suite
vision-language

NeurIPS 2025

First posted Jun 23, 2023

28 models
Authors: Chaoyou Fu, Peixian Chen, Yunhang ShenCorresponding: Ke LiAffiliation: Nanjing University; Tencent Youtu Lab; Xiamen University; CASIA
4

CHAIR

Classic object hallucination metric and benchmark setup.

captioningobject labelshallucination rate
Captioning
vision-language

CVPR 2018

First posted Sep 6, 2018

2 metrics
Authors: Anna Rohrbach, Lisa Anne Hendricks, Kaylee BurnsCorresponding: not specifiedAffiliation: UC Berkeley; Boston University
5

AMBER

A benchmark for multimodal hallucination evaluation across tasks.

existenceattributesrelations
Multitask
vision-language

arXiv 2023

First posted Nov 13, 2023

11 settings
Authors: Junyang Wang, Yuhang Wang, Guohai XuCorresponding: not specifiedAffiliation: Beijing Jiaotong University; Alibaba Group
6

Visually Dehallucinative Instruction Generation: Know What You Don't Know

Evaluates idk (ik) with Dis tasks using Acc metrics.

discriminationidk (ik)
Image QA
vision-language

ICASSP 2024

First posted Feb 15, 2024

6,624 / Acc
Authors: Sungguk Cha, Jusung Lee, Younghyun LeeCorresponding: Sungguk Cha, Cheoljong YangAffiliation: Multimodal AI Lab., NC Research, NCSOFT Corporation
7

HaloQuest: A Visual Hallucination Dataset for Advancing Multimodal Reasoning

Evaluates synthetic images / vqa with Gen tasks using Acc metrics.

object-levelgenerationsynthetic images vqa
Image QA
vision-language

ECCV 2024

First posted Jul 22, 2024

7,748 / Acc
Authors: Zhecan Wang, Garrett Bingham, Adams YuCorresponding: not specifiedAffiliation: Columbia University, New York, NY 10027; Google DeepMind, Mountain View, CA 94043
8

HalluAudio: A Comprehensive Benchmark for Hallucination Detection in Large Audio-Language Models

Evaluates speech/sound/music with Dis & Gen tasks using Acc / Hallucination Rate metrics.

discriminationgenerationspeechsoundmusic
Image QA
vision-language

ACL 2026

5,000+ / Acc / Hallucination Rate
Authors: Feiyu Zhao, Yiming Chen, Wenhuan LuCorresponding: Xianghu YueAffiliation: College of Intelligence and Computing, Tianjin University, China; ASUS Intelligent Cloud Services, Singapore
9

Detecting and Evaluating Medical Hallucinations in Large Vision Language Models

Evaluates medical context with Dis & Gen tasks using MediHall Score metrics.

object-levelattribute-leveldiscriminationgeneration
Image QA
vision-language

arXiv 2024

First posted Jun 14, 2024

889,125 / MediHall Score
Authors: Jiawei Chen, Dingkang Yang, Tong WuCorresponding: not specifiedAffiliation: Academy for Engineering and Technology, Fudan University, Shanghai, China; Tencent Youtu Lab, Shanghai, China; Cognition and Intelligent Technology Laboratory, Shanghai, China; Engineering Research Center of AI and Robotics, Ministry of Education, Shanghai, China; AI and Unmanned Systems Engineering Research Center of Jilin Province, Changchun, China
10

VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models

Evaluates temporal/extrinsic with Dis & Gen tasks using Acc metrics.

object-levelrelation-leveldiscriminationgeneration
Image QA
vision-language

arXiv 2024

First posted Jun 24, 2024

1,800 / Acc
Authors: Yuxuan Wang, Yueqian Wang, Dongyan ZhaoCorresponding: not specifiedAffiliation: Beijing Institute for General Artificial Intelligence, Beijing China; State Key Laboratory of General Artificial Intelligence, Beijing, China; Wangxuan Institute of Computer Technology, Peking University, Beijing, China; Computer Science and Engineering, University of California, Santa Cruz
11

MedVH: Towards Systematic Evaluation of Hallucination for Large Vision Language Models in the Medical Context

Evaluates medical context with Dis & Gen tasks using Characterization Score metrics.

object-levelattribute-leveldiscriminationgeneration
Image QA
vision-language

arXiv 2024

First posted Jul 3, 2024

2,000 / Characterization Score
Authors: Zishan Gu, Changchang Yin, Fenglin LiuCorresponding: not specifiedAffiliation: The Ohio State University; University of Oxford
12

EventHallusion: Diagnosing Event Hallucinations in Video LLMs

Evaluates video event with Dis & Gen tasks using Accuracy metrics.

discriminationgenerationvideo event
Image QA
vision-language

arXiv 2024

First posted Sep 25, 2024

711 / Accuracy
Authors: Jiacheng Zhang, Yang Jiao, Shaoxiang ChenCorresponding: not specifiedAffiliation: Shanghai Key Lab of Intelligent Information Processing, School of CS, Fudan University; Shanghai Collaborative Innovation Center on Intelligent Visual Computing; Singapore University of Technology and Design; Shanghai Academy of Artificial Intelligence for Science; Meituan
13

Mitigating Dialogue Hallucination for Large Vision Language Models via Adversarial Instruction Tuning

Evaluates dialogue hallucination with Dis & Gen tasks using Acc metrics.

object-levelattribute-leveldiscriminationgeneration
Image QA
vision-language

arXiv 2024

First posted Mar 15, 2024

N/A / Acc
Authors: Dongmin Park, Zhaofang Qian, Guangxing HanCorresponding: not specifiedAffiliation: KRAFTON; UC San Diego; University of Central Florida
14

Localizing Before Answering: A Hallucination Evaluation Benchmark for Grounded Medical Multimodal LLMs

Evaluates grounded medical with Gen tasks using Acc / Loc metrics.

object-levelgenerationgrounded medical
Image QA
vision-language

arXiv 2025

First posted Apr 30, 2025

67,000 / Acc / Loc
Authors: Dung Nguyen, Minh Khoi Ho, Huy TaCorresponding: not specifiedAffiliation: Hanoi University of Science and Technology; University of Wollongong; Australian Institute for Machine Learning, The University of Adelaide; Griffith University; College of Medicine and Public Health, Flinders University
15

MIHBench: Benchmarking and Mitigating Multi-Image Hallucinations in Multimodal Large Language Models

Evaluates multi-image reasoning with Dis & Gen tasks using Acc metrics.

object-leveldiscriminationgenerationmulti-image reasoning
Image QA
vision-language

arXiv 2025

First posted Aug 1, 2025

3,000 / Acc
Authors: Jiale Li, Mingrui Wu, Zixiang JinCorresponding: not specifiedAffiliation: Xiamen University; Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China; Zhongguancun Academy
16

The Instinctive Bias: Spurious Images lead to Illusion in MLLMs

Evaluates spurious images with Dis tasks using Acc metrics.

object-leveldiscriminationspurious images
Image QA
vision-language

arXiv 2024

First posted Feb 6, 2024

7,308 / Acc
Authors: Tianyang Han, Qing Lian, Rui PanCorresponding: not specifiedAffiliation: The Hong Kong University of Science and Technology; University of Illinois at Urbana-Champaign; The Hong Kong Polytechnic University
17

Explore the Hallucination on Low-level Perception for MLLMs

Evaluates low-level perception with Gen tasks using Acc metrics.

attribute-levelgenerationlow-level perception
Image QA
vision-language

arXiv 2024

First posted Sep 15, 2024

4,989 / Acc
Authors: Yinan Sun, Zicheng Zhang, Haoning WuCorresponding: not specifiedAffiliation: Shanghai Jiao Tong University; Nanyang Technological University
18

JourneyBench: A Challenging One-Stop Vision-Language Understanding Benchmark of Generated Images

Evaluates imaginary vqa with Dis & Gen tasks using Acc metrics.

object-levelattribute-leveldiscriminationgeneration
Image QA
vision-language

arXiv 2024

First posted Sep 19, 2024

13,500 / Acc
Authors: Zhecan Wang, Junzhang Liu, Chia-Wei TangCorresponding: not specifiedAffiliation: Columbia University; UCLA; Virginia Tech
19

Detecting and Preventing Hallucinations in Large Vision Language Models

Evaluates fine-grained with Dis tasks using Reward Score metrics.

object-levelattribute-levelrelation-leveldiscrimination
Object Hallucination
vision-language

AAAI 2024

First posted Aug 11, 2023

16,000 / Reward Score
Authors: Anisha Gunjal, Jihan Yin, Erhan BasCorresponding: not specifiedAffiliation:
20

Negative Object Presence Evaluation (NOPE) to Measure Object Hallucination in Vision-Language Models

Evaluates negative pronoun with Dis tasks using Acc/METEOR metrics.

object-leveldiscriminationnegative pronoun
Object Hallucination
vision-language

ACL-W 2024

First posted Oct 9, 2023

29,500 / Acc/METEOR
Authors: Holy Lovenia, Wenliang Dai, Samuel CahyawijayaCorresponding: not specifiedAffiliation: The Hong Kong University of Science and Technology
21

THRONE: An Object-based Hallucination Benchmark for the Free-form Generations of Large Vision-Language Models

Evaluates free-form generations with Gen tasks using P/R/F metrics.

object-levelgenerationfree-form generations
Object Hallucination
vision-language

CVPR 2024

First posted May 8, 2024

5,000 / P/R/F
Authors: Prannay Kaul, Zhizhong Li, Hao YangCorresponding: not specifiedAffiliation: VGG, University of Oxford; AWS AI Labs
22

Quantity Matters: Towards Assessing and Mitigating Number Hallucination in Large Vision-Language Models

Evaluates object counting with Dis tasks using Acc / Consistency metrics.

object-levelattribute-leveldiscriminationobject counting
Object Hallucination
vision-language

arXiv 2024

First posted Mar 3, 2024

20,000 / Acc / Consistency
Authors: Huixuan Zhang, Junzhe Zhang, Xiaojun WanCorresponding: not specifiedAffiliation: School of Electronics Engineering and Computer Science, Peking University; Wangxuan Institute of Computer Technology, Peking University
23

CIEM: Contrastive Instruction Evaluation Method for Better Instruction Tuning

Evaluates multimodal hallucination with Dis tasks using Acc/P/R/F1/Specificity metrics.

object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language

NeurIPS-W 2023

First posted Sep 5, 2023

40,367 / Acc/P/R/F1/Specificity
Authors: Hongyu Hu, Jiyuan Zhang, Minyi ZhaoCorresponding: not specifiedAffiliation: ByteDance Inc, Shanghai
24

Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models

Evaluates visual grounding with Dis tasks using Accuracy metrics.

object-levelrelation-leveldiscriminationvisual grounding
Evaluation Suite
vision-language

CVPR 2025

First posted Dec 3, 2023

31,373 / Accuracy
Authors: Andrés Villa, Juan Carlos León Alcázar, Alvaro SotoCorresponding: not specifiedAffiliation: King Abdullah University of Science and Technology (KAUST); Pontificia Universidad Católica de Chile
25

Unified Hallucination Detection for Multimodal Large Language Models

Evaluates t2i with Gen tasks using Acc/P/R/F metrics.

object-levelattribute-levelgenerationt2i
Evaluation Suite
vision-language

ACL 2024

First posted Feb 5, 2024

1,860 / Acc/P/R/F
Authors: Xiang Chen, Chenxi Wang, Yida XueCorresponding: Huajun ChenAffiliation: College of Computer Science and Technology, Zhejiang University; School of Software Technology, Zhejiang University; Zhejiang University-Ant Group Joint Laboratory of Knowledge Graph; Ant Group
26

Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models

Evaluates event hallucination with Dis & Gen tasks using Acc/Score metrics.

object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language

ACMMM 2024

First posted Feb 24, 2024

10,000 / Acc/Score
Authors: Chaoya Jiang, Hongrui Jia, Wei YeCorresponding: not specifiedAffiliation: National Engineering Research Center for Software Engineering, Peking University; DAMO Academy, Alibaba Group
27

VALOR-EVAL: Holistic Coverage and Faithfulness Evaluation of Large Vision-Language Models

Evaluates multimodal hallucination with Gen tasks using Faithfulness & Coverage metrics.

object-levelattribute-levelrelation-levelgeneration
Evaluation Suite
vision-language

ACL 2024

First posted Apr 22, 2024

211 / Faithfulness & Coverage
Authors: Haoyi Qiu, Wenbo Hu, Zi-Yi DouCorresponding: not specifiedAffiliation: University of California, Los Angeles
28

AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models

Evaluates multimodal hallucination with Dis tasks using ASR/MASR/CASR metrics.

object-leveldiscrimination
Evaluation Suite
vision-language

EMNLP 2024

First posted Jun 16, 2024

5,000 / ASR/MASR/CASR
Authors: Xiyang Wu, Tianrui Guan, Dianqi LiCorresponding: not specifiedAffiliation: University of Maryland, College Park
29

ODE: Open-Set Evaluation of Hallucinations in Multimodal Large Language Models

Evaluates open-set with Dis & Gen tasks using AMBER/Acc metrics.

object-levelattribute-leveldiscriminationgeneration
Evaluation Suite
vision-language

CVPR 2025

First posted Sep 14, 2024

8,786 / AMBER/Acc
Authors: Yahan Tu, Rui Hu, Jitao SangCorresponding: not specifiedAffiliation: Beijing Key Lab of Traffic Data Analysis and Mining; Beijing Jiaotong University, China
30

Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models

Evaluates ocr/action/counting with Dis & Gen tasks using Hallucination Rate metrics.

object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language

arXiv 2024

First posted Jun 24, 2024

4,000 / Hallucination Rate
Authors: Bei Yan, Jie Zhang, Zheng YuanCorresponding: not specifiedAffiliation: Institute of Computing Technology, Chinese Academy of Sciences; University of Chinese Academy of Sciences; Key Laboratory of Al Safety, Chinese Academy of Sciences
31

FIHA: Autonomous Hallucination Evaluation in Vision-Language Models with Davidson Scene Graphs

Evaluates eval method with Dis & Gen tasks using Acc/P/R/F1 metrics.

object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language

arXiv 2024

First posted Sep 20, 2024

N/A / Acc/P/R/F1
Authors: Bowen Yan, Zhengsong Zhang, Liqiang JingCorresponding: not specifiedAffiliation: University of Texas at Dallas, Richardson, United States
32

TUBench: Benchmarking Large Vision-Language Models on Trustworthiness with Unanswerable Questions

Evaluates unanswerable qs with Dis tasks using Acc metrics.

object-levelrelation-leveldiscriminationunanswerable qs
Evaluation Suite
vision-language

arXiv 2024

First posted Oct 5, 2024

2,354 / Acc
Authors: Xingwei He, Qianru Zhang, A-Long JinCorresponding: not specifiedAffiliation: The University of Hong Kong; Xi’an Jiaotong-Liverpool University; School of Computer Science and Engineering, Beihang University, Beijing, China; State Key Laboratory of Software, Development Environment; Zhongguancun Laboratory
33

MFC-Bench: Benchmarking Multimodal Fact-Checking with Large Vision-Language Models

Evaluates manipulation/ooc/veracity with Dis & Gen tasks using Acc/F1 metrics.

discriminationgenerationmanipulationoocveracity
Evaluation Suite
vision-language

arXiv 2024

First posted Jun 17, 2024

35,000 / Acc/F1
Authors: Shengkang Wang, Hongzhan Lin, Ziyang LuoCorresponding: not specifiedAffiliation: Beijing University of Posts and Telecommunications; Hong Kong Baptist University; Hong Kong University of Science and Technology
34

Hallu-PI: Evaluating Hallucination in Multi-modal Large Language Models within Perturbed Inputs

Evaluates perturbed inputs with Dis tasks using Acc metrics.

object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language

arXiv 2024

First posted Aug 2, 2024

1,260 / Acc
Authors: Peng Ding, Jingyu Wu, Jun KuangCorresponding: not specifiedAffiliation: National Key Laboratory for Novel Software Technology, Nanjing University; College of Computer Science and Technology, Zhejiang University; Zhejiang-Singapore Innovation and AI Joint Research Lab, Zhejiang University
35

CAST: Cross-modal Alignment Similarity Test for Vision Language Models

Evaluates self-consistency with Dis & Gen tasks using Similarity metrics.

object-levelattribute-levelrelation-leveldiscrimination
Evaluation Suite
vision-language

arXiv 2024

First posted Sep 17, 2024

15,000 / Similarity
Authors: Gautier Dagan, Olga Loginova, Anil BatraCorresponding: not specifiedAffiliation: University of Edinburgh; University of Trento
36

FaithScore: Fine-grained Evaluations of Hallucinations in Large Vision-Language Models

Evaluates obj. counting with Gen tasks using FaithScore metrics.

object-levelattribute-levelrelation-levelgeneration
Captioning
vision-language

EMNLP 2024

First posted Nov 2, 2023

2,000 / FaithScore
Authors: Liqiang Jing, Ruosen Li, Yunmo ChenCorresponding: not specifiedAffiliation: University of Texas at Dallas; Johns Hopkins University; University of Notre Dame
37

Mitigating Open-Vocabulary Caption Hallucinations

Evaluates open-vocabulary with Gen tasks using OpenCHAIR metrics.

object-levelattribute-levelgenerationopen-vocabulary
Captioning
vision-language

EMNLP 2024

First posted Dec 6, 2023

2,000 / OpenCHAIR
Authors: Assaf Ben-Kish, Moran Yanuka, Morris AlperCorresponding: not specifiedAffiliation: Tel-Aviv University
38

HallE-Control: Controlling Object Hallucination in Large Multimodal Models

Evaluates multimodal hallucination with Gen tasks using CHAIR/Coverage metrics.

object-levelgeneration
Captioning
vision-language

arXiv 2023

First posted Oct 3, 2023

100 / CHAIR/Coverage
Authors: Bohan Zhai, Shijia Yang, Chenfeng XuCorresponding: not specifiedAffiliation: ByteDance Inc.; Stanford University; UC Berkeley; UIUC
39

ALOHa: A New Measure for Hallucination in Captioning Models

Evaluates captioning metric with Gen tasks using ALOHa metrics.

object-levelgenerationcaptioning metric
Captioning
vision-language

arXiv 2024

First posted Apr 3, 2024

N/A / ALOHa
Authors: Suzanne Petryk, David M. Chan, Anish KachinthayaCorresponding: not specifiedAffiliation: University of California, Berkeley
40

Does Object Grounding Really Reduce Hallucination of Large Vision-Language Models?

Evaluates metric method with Gen tasks using CHAIR-MEN / FaithScore metrics.

object-levelgenerationmetric method
Captioning
vision-language

arXiv 2024

First posted Jun 20, 2024

N/A / CHAIR-MEN / FaithScore
Authors: Gregor Geigle, Radu Timofte, Goran GlavašCorresponding: not specifiedAffiliation: WüNLP; Computer Vision Lab, CAIDAS, University of Würzburg
41

Aligning Large Multimodal Models with Factually Augmented RLHF

Evaluates model bias with Gen tasks using LLM Rating metrics.

object-levelgenerationmodel bias
Multitask
vision-language

ACL 2024

First posted Sep 25, 2023

96 / LLM Rating
Authors: Zhiqing Sun, Sheng Shen, Shengcao CaoCorresponding: not specifiedAffiliation: UC Berkeley; CMU; UIUC; UW–Madison; UMass Amherst; Microsoft Research; MIT-IBM Watson AI Lab
42

Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning

Evaluates env/action/comp with Gen tasks using LLM Rating metrics.

object-levelattribute-levelrelation-levelgeneration
Multitask
vision-language

ICLR 2024

First posted Jun 26, 2023

1,000 / LLM Rating
Authors: Fuxiao Liu, Kevin Lin, Linjie LiCorresponding: not specifiedAffiliation: University of Maryland, College Park; Microsoft Corporation
43

Mitigating Fine-Grained Hallucination by Fine-Tuning Large Vision-Language Models with Caption Rewrites

Evaluates behaviour with Dis tasks using Acc/P/R/F metrics.

object-levelattribute-levelrelation-leveldiscrimination
Multitask
vision-language

MMM 2024

First posted Dec 4, 2023

200 / Acc/P/R/F
Authors: Lei Wang, Jiabang He, Shenshen LiCorresponding: not specifiedAffiliation: Singapore Management University, Beijing Forestry University; University of Electronic Science and Technology of China
44

Visual Hallucinations of Multi-modal Large Language Models

Evaluates visual hallucination with Dis & Gen tasks using Acc metrics.

object-levelattribute-leveldiscriminationgeneration
Multitask
vision-language

ACL 2024

First posted Feb 22, 2024

1,200 / Acc
Authors: Wen Huang, Hongbin Liu, Minxin GuoCorresponding: not specifiedAffiliation: University of Science & Technology of China; Duke University; The University of Hong Kong
45

PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset

Evaluates sentiment with Dis tasks using PhD Index metrics.

object-levelattribute-levelrelation-leveldiscrimination
Multitask
vision-language

CVPR 2025

First posted Mar 17, 2024

102,564 / PhD Index
Authors: Jiazhen Liu, Yuhan Fu, Ruobing XieCorresponding: not specifiedAffiliation: Key Lab of DEKE, Renmin University of China; Machine Learning Platform Department, Tencent
46

Automated Multi-level Preference for MLLMs

Evaluates multi-round conv with Gen tasks using Preference Score metrics.

object-levelattribute-levelgenerationmulti-round conv
Multitask
vision-language

NeurIPS 2024

First posted May 18, 2024

N/A / Preference Score
Authors: Mengxi Zhang, Wenhao Wu, Yu LuCorresponding: not specifiedAffiliation: Baidu Inc.; Tianjin University; The University of Sydney; University of Technology Sydney; Tsinghua University; Chinese Academy of Science
47

Evaluating and Analyzing Relationship Hallucinations in Large Vision-Language Models

Evaluates multimodal hallucination with Dis tasks using Acc/P/R/F1 metrics.

object-levelrelation-leveldiscrimination
Multitask
vision-language

ICML 2024

First posted Jun 24, 2024

8,030 / Acc/P/R/F1
Authors: Mingrui Wu, Jiayi Ji, Oucheng HuangCorresponding: Jiayi JiAffiliation: Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, 361005, P.R. China
48

Multi-Object Hallucination in Vision-Language Models

Evaluates multi-object with Gen tasks using Accuracy metrics.

object-levelattribute-levelrelation-levelgeneration
Multitask
vision-language

NeurIPS 2024

First posted Jul 8, 2024

5,000 / Accuracy
Authors: Xuweiyi Chen, Ziqiao Ma, Xuejun ZhangCorresponding: not specifiedAffiliation: University of Michigan; University of Virginia; New York University
49

BEAF: Observing BEfore-AFter Changes to Evaluate Hallucination in Vision-language Models

Evaluates before-after changes with Dis tasks using TU/IG/SB/ID metrics.

object-leveldiscriminationbefore-after changes
Multitask
vision-language

ECCV 2024

First posted Jul 18, 2024

26,064 / TU/IG/SB/ID
Authors: Moon Ye-Bin, Nam Hyeon-Woo, Wonseok ChoiCorresponding: not specifiedAffiliation: Dept. of EE, POSTECH, Korea; Grad. School of AI, POSTECH, Korea; Institute for Convergence Research and Education in Advanced Technology, Yonsei University, Korea
50

Reefknot: A Comprehensive Benchmark for Relation Hallucination Evaluation, Analysis and Mitigation in Multimodal Large Language Models

Evaluates perceptive / cognitive with Dis & Gen tasks using R-score metrics.

relation-leveldiscriminationgenerationperceptive cognitive
Multitask
vision-language

ACL 2025

First posted Aug 18, 2024

21,880 / R-score
Authors: Kening Zheng, Junkai Chen, Yibo YanCorresponding: Xuming HuAffiliation: Hong Kong University of Science and Technology (Guangzhou); Guangxi Zhuang Autonomous Region Big Data Research Institute; Hong Kong University of Science and Technology
51

Antidote: A Unified Framework for Mitigating LVLM Hallucinations in Counterfactual Presupposition and Object Perception

Evaluates cp-bench mitigation with Gen tasks using Acc metrics.

object-levelgenerationcp-bench mitigation
Multitask
vision-language

CVPR 2025

First posted Apr 29, 2025

N/A / Acc
Authors: Yuanchen Wu, Lu Zhang, Hang YaoCorresponding: not specifiedAffiliation: School of Computer Engineering & Science, Shanghai University; Tencent YouTu Lab
52

EH-Benchmark: Ophthalmic hallucination benchmark and agent-driven top-down traceable reasoning workflow

Evaluates ophthalmology with Dis & Gen tasks using N/A metrics.

discriminationgenerationophthalmology
Multitask
vision-language

Information Fusion 2026

First posted Jul 24, 2025

N/A / N/A
Authors: Xiaoyu Pan, Yang Bai, Ke ZouCorresponding: not specifiedAffiliation: Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR), 1 Fusionopolis Way, Singapore, 138632; Centre for Innovation and Precision Eye Health; and Department of Ophthalmology, NUHS Tower Block, Level 7, 1E Kent Ridge Road, Singapore, 119228; Singapore Eye Research Institute, Singapore National Eye Centre, 20 College Road, Singapore, 169856
53

Evaluation and Analysis of Hallucination in Large Vision-Language Models

Evaluates multimodal hallucination with Gen tasks using LLM Rating metrics.

object-levelgeneration
Multitask
vision-language

arXiv 2023

First posted Aug 29, 2023

25,000 / LLM Rating
Authors: Junyang Wang, Yiyang Zhou, Guohai XuCorresponding: not specifiedAffiliation: School of Computer and Information Technology, Beijing Jiaotong University, Beijing, China; School of Software Engineering, Xi'an Jiaotong University, Xi'an, China; School of Software, Shandong University, Jinan, China; MAIS, Institute of Automation, Chinese Academy of Sciences (CASIA), Beijing, China; DAMO Academy, Alibaba Group
54

Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges

Evaluates model bias with Gen tasks using Human Assessment metrics.

generationmodel bias
Multitask
vision-language

arXiv 2023

First posted Nov 6, 2023

370 / Human Assessment
Authors: Chenhang Cui, Yiyang Zhou, Xinyu YangCorresponding: not specifiedAffiliation: UNC-Chapel Hill; Carnegie Mellon University; Stanford University; Rutgers University
55

MMInstruct: A High-Quality Multi-Modal Instruction Tuning Dataset with Extensive Diversity

Evaluates instruction tuning with Gen tasks using Acc metrics.

object-levelattribute-levelrelation-levelgeneration
Multitask
vision-language

arXiv 2024

First posted Jul 22, 2024

973,000 / Acc
Authors: Yangzhou Liu, Yue Cao, Zhangwei GaoCorresponding: not specifiedAffiliation: Shanghai AI Laboratory, Shanghai 200232, China; SenseTime Research, Shanghai 200233, China; Tsinghua University, Beijing 100084, China; Nanjing University, Nanjing 210023, China; Fudan University, Shanghai 200433, China; The Chinese University of Hong Kong, Hong Kong 999077, China; Shanghai Jiao Tong University, Shanghai 200240, China
56

MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation

Evaluates decoding method with Gen tasks using Acc metrics.

object-levelgenerationdecoding method
Multitask
vision-language

arXiv 2024

First posted Oct 15, 2024

N/A / Acc
Authors: Chenxi Wang, Xiang Chen, Ningyu ZhangCorresponding: not specifiedAffiliation: Zhejiang University; National University of Singapore, NUS-NCS Joint Lab, Singapore
57

Mitigating Hallucination in Visual Language Models with Visual Supervision

Evaluates multimodal hallucination with Dis tasks using False Positive Rate metrics.

object-levelattribute-levelrelation-leveldiscrimination
Multitask
vision-language

arXiv 2023

First posted Nov 27, 2023

3,000 / False Positive Rate
Authors: Zhiyang Chen, Yousong Zhu, Yufei ZhanCorresponding: not specifiedAffiliation: Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences; School of Artificial Intelligence, University of Chinese Academy of Sciences; Peng Cheng Laboratory; Wuhan AI Research
58

ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling

Evaluates grounding with Gen tasks using Fine-Grained Reward metrics.

object-levelattribute-levelrelation-levelgeneration
Multitask
vision-language

arXiv 2024

First posted Feb 9, 2024

16,000 / Fine-Grained Reward
Authors: Siming Yan, Min Bai, Weifeng ChenCorresponding: not specifiedAffiliation: The University of Texas at Austin; AWS AI
59

Unsolvable Problem Detection: Robust Understanding Evaluation for Large Multimodal Models

Evaluates unsolvable (upd) with Dis tasks using Acc metrics.

discriminationunsolvable (upd)
Multitask
vision-language

arXiv 2024

First posted Mar 29, 2024

2,095 / Acc
Authors: Atsuyuki Miyai, Jingkang Yang, Jingyang ZhangCorresponding: not specifiedAffiliation: The University of Tokyo; S-Lab, Nanyang Technological University; Duke University; University of Wisconsin-Madison; LY Corporation; Tokyo University of Science
60

Investigating and Mitigating the Multimodal Hallucination Snowballing in Large Vision-Language Models

Evaluates generated distractions with Dis tasks using Acc metrics.

object-levelattribute-leveldiscriminationgenerated distractions
Multitask
vision-language

arXiv 2024

First posted Jun 30, 2024

4,973 / Acc
Authors: Weihong Zhong, Xiaocheng Feng, Liang ZhaoCorresponding: not specifiedAffiliation: Harbin Institute of Technology; Peng Cheng Laboratory
61

LOTUS: A Leaderboard for Detailed Image Captioning from Quality to Societal Bias and User Preferences

Evaluates societal bias/pref with Dis tasks using Alignment/Bias metrics.

discriminationsocietal biaspref
Multitask
vision-language

arXiv 2025

First posted Jul 25, 2025

N/A / Alignment/Bias
Authors: Yusuke Hirota, Boyi Li, Ryo HachiumaCorresponding: not specifiedAffiliation: NVIDIA Research; Osaka University; Stanford University
62

How Easy is It to Fool Your Multimodal LLMs? An Empirical Analysis on Deceptive Prompts

Evaluates deceptive prompts with Gen tasks using Acc metrics.

object-levelattribute-levelgenerationdeceptive prompts
Multitask
vision-language

arXiv 2024

First posted Feb 20, 2024

1,000 / Acc
Authors: Yusu Qian, Haotian Zhang, Yinfei YangCorresponding: not specifiedAffiliation: Apple
63

VLind-Bench: Measuring Language Priors in Large Vision-Language Models

Evaluates language priors with Dis tasks using Acc (Y/N) metrics.

object-leveldiscriminationlanguage priors
Multitask
vision-language

arXiv 2024

First posted Jun 13, 2024

2,576 / Acc (Y/N)
Authors: Kang-il Lee, Minbeom Kim, Seunghyun YoonCorresponding: not specifiedAffiliation: ECE, SNU; IPAI, SNU
64

MMRel: Benchmarking Relation Understanding in Multi-Modal Large Language Models

Evaluates relation understanding with Dis & Gen tasks using Acc metrics.

object-levelrelation-leveldiscriminationgeneration
Multitask
vision-language

arXiv 2024

First posted Jun 13, 2024

22,500 / Acc
Authors: Jiahao Nie, Gongjie Zhang, Wenbin AnCorresponding: not specifiedAffiliation: IGP, Nanyang Technological University; Nanyang Technological University; Alibaba DAMO Academy; Xi’an Jiaotong University
65

Understanding Multimodal Hallucination with Parameter-Free Representation Alignment

Evaluates alignment method with Dis tasks using Pfram metrics.

object-leveldiscriminationalignment method
Multitask
vision-language

arXiv 2024

First posted Sep 2, 2024

N/A / Pfram
Authors: Yueqian Wang, Jianxin Liang, Yuxuan WangCorresponding: not specifiedAffiliation: Wangxuan Institute of Computer Technology, Peking University; Beijing Institute for General Artificial Intelligence; National Key Laboratory of General Artificial Intelligence