arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 287 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 70 篇

2603.23146 2026-04-23 cs.CL cs.AI 73%

Why AI-Generated Text Detection Fails: Evidence from Explainable AI Beyond Benchmark Accuracy

为何AI生成文本检测失败:来自可解释AI的证据超越基准准确度

Shushanta Pudasaini, Luis Miralles-Pechuán, David Lillis, Marisa Llorens Salvador

机构 * Technological University Dublin(都柏林技术大学) University College Dublin(都柏林大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了当前检测系统是否能真正识别机器生成文本,发现其在跨领域和跨生成器评估中存在显著泛化失败,揭示了基于语言特征的AI文本检测中的根本矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20413 2026-04-23 cs.AI 70%

Self-Awareness before Action: Mitigating Logical Inertia via Proactive Cognitive Awareness

行动前的自我意识:通过主动认知意识缓解逻辑惯性

Fulong Fan, Peilin Liu, Fengzhe Liu, Shuyan Yang, Gang Yan

机构 * School of Software, Jilin University(吉林大学软件学院) School of Computer Science, Jilin University(吉林大学计算机科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SABA框架,通过在最终决策前引入对缺失前提的自我意识,解决大语言模型在非交互谜题中因早期假设传播导致的结论不稳定问题,实现了在多个基准测试中的最佳性能。

Comments Accepted to ACL 2026. 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20216 2026-04-23 cs.CL 70%

Text-to-Distribution Prediction with Quantile Tokens and Neighbor Context

基于分位数标记和邻近上下文的文本到分布预测

Yilun Zhu, Yuan Zhuang, Nikhita Vedula, Dushyanta Dhyani, Shaoyuan Xu, Moyan Li, Mohsen Bayati, Bryan Wang, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出分位数标记回归,通过插入专用分位数标记并结合邻近实例,提升分布预测精度,实验显示在多个数据集上效果显著,MAPE更低且预测区间更窄。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20190 2026-04-23 cs.CV cs.LG 70%

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19799 2026-04-23 cs.HC cs.AI cs.CY q-bio.NC 70%

Measuring Creativity in the Age of Generative AI: Distinguishing Human and AI-Generated Creative Performance in Hiring and Talent Systems

在生成式AI时代测量创造力:区分人类与AI生成的创造力表现于招聘与人才系统

Yigal Rosen, Ilia Rushkin

机构 * Massachusetts Institute of Technology(麻省理工学院) Ignis AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过嵌入空间中的创意生成与转换来量化创造力,揭示AI环境下创意输出的双峰分布特征,强调在生成式AI时代,独特性而非流畅性成为衡量人类创造力的关键指标。

Comments Research Paper Presented at the BIG.AI@MIT Conference, April 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19795 2026-04-23 cs.AI 70%

Prism: An Evolutionary Memory Substrate for Multi-Agent Open-Ended Discovery

Prism:一种多智能体开放发现的进化记忆基质

Suyash Mishra

机构 * AI Researcher(人工智能研究员) Basel, Switzerland(瑞士巴塞尔)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Prism通过整合四种独立发展范式,提出一种基于决策理论框架的记忆基质,实现记忆分层、因果记忆图、信息价值检索、心跳驱动整合和复制衰减动态,提升多智能体开放发现性能。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19752 2026-04-23 cs.MA cs.AI cs.CY 70%

Soft-Label Governance for Distributional Safety in Multi-Agent Systems

多智能体系统中的分布安全软标签治理

Aizierjiang Aiersilan, Raeli Savitt

机构 * The George Washington University(乔治·华盛顿大学) SWARM AI Safety(SWARM AI安全)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SWARM框架,通过连续概率标签提升多智能体系统安全性和治理效果,展示软指标在检测代理游戏中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19502 2026-04-23 cs.CL 70%

Beyond Rating: A Comprehensive Evaluation and Benchmark for AI Reviews

超越评分:AI评论的全面评估与基准

Bowen Li, Haochen Ma, Yuxin Wang, Jie Yang, Yining Zheng, Xinchi Chen, Xuanjing Huang, Xipeng Qiu

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Beyond Rating框架,通过五个维度评估AI评论,引入Max-Recall策略和高质量数据集,证明文本中心指标与评分准确性的强相关性。

Comments 38 pages,8 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13232 2026-04-23 cs.AI cs.SE 70%

PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading

PlotChain: 多模态大语言模型在工程图表阅读中的确定性检查点评估

Mayank Ravishankara

机构 * Independent Researcher, San Francisco, CA, USA(独立研究者,美国加州旧金山)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PlotChain提出了一种确定性的基于生成器的评估基准,用于评估多模态大语言模型在工程图表阅读中的性能,通过检查点实现子技能诊断和故障定位,展示了不同模型在图表阅读任务中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08923 2026-04-23 cs.AI 70%

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

相同内容,不同答案:多模态大语言模型中的跨模态不一致

Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

机构 * University of Amsterdam(阿姆斯特丹大学) City of Amsterdam(阿姆斯特丹市) University of Technology Nuremberg(努尔堡技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出REST和REST+基准测试,评估多模态大语言模型的跨模态不一致性。研究发现,即使在相同语义信息下,不同模态的推理结果也不一致,且OCR错误和视觉特征影响模型性能。

Comments Accepted at CVPR 2026. Angela van Sprang and Laurens Samson contributed equally as first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20738 2026-04-23 cs.CL 70%

RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering

RespondeoQA:一种双语拉丁-英语问答基准

Marisa Hudspeth, Patrick J. Burns, Brendan O'Connor

机构 * Manning College of Information & Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校信息与计算机科学学院) Institute for the Study of the Ancient World, New York University(纽约大学古代世界研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个包含7800个问答对的双语拉丁-英语问答翻译基准,涵盖拉丁语教学资料中的多种问题类型,评估了三种大语言模型在技能类问题上的表现。

Comments Published in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20719 2026-04-23 cs.SD cs.AI cs.MM eess.AS 70%

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

ONOTE:面向专家级音乐智能的多模态记谱处理基准测试

Menghe Ma, Siqing Wei, Yuecheng Xing, Yaheng Wang, Fanhong Meng, Peijun Han, Luu Anh Tuan, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ONOTE基准测试,通过确定性流程消除记谱系统偏差,揭示多模态模型在感知准确性和音乐理论理解间的根本分歧。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20704 2026-04-23 cs.CR cs.LG 70%

Auto-ART: Structured Literature Synthesis and Automated Adversarial Robustness Testing

Auto-ART:结构化文献综合与自动化对抗鲁棒性测试

Abhijit Talluri

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出Auto-ART框架,通过结构化文献综合和自动化对抗鲁棒性测试,填补了领域内的知识空白,实现了多规范评估和合规性映射。

Comments NeurIPS 2026 Evaluations and Datasets Track Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14785 2026-04-23 cs.AI 70%

MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror

MirrorBench: 通过引入镜像评估多模态大语言模型中的自中心智能

Shengyu Guo, Tongrui Ye, Jianbo Zhang, Zicheng Zhang, Chunyi Li, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MirrorBench通过引入镜像测试,系统评估多模态大语言模型的自中心智能,揭示其在基础视觉感知到高级自我表征方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20350 2026-04-23 cs.CV 67%

X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis

X-PCR:眼科诊断中跨模态渐进临床推理的基准测试

Gui Wang, Zehao Zhong, YongSong Zhou, Yudong Li, Ende Wu, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua University(清华大学) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Wenzhou Medical University(温州医科大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出X-PCR基准测试,通过完整眼科诊断流程评估多模态大语言模型的渐进推理和跨模态整合能力,包含26,415张图像和177,868个专家验证的VQA对,评估21个模型揭示其在渐进推理和跨模态整合方面的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19949 2026-04-23 eess.AS 67%

Indic-CodecFake meets SATYAM: Towards Detecting Neural Audio Codec Synthesized Speech Deepfakes in Indic Languages

Indic-CodecFake meets SATYAM:迈向检测印度语言神经音频编解码器合成语音深度伪造

Girish, Mohd Mujtaba Akhtar, Orchid Chetia Phukan, Arun Balaji Buduru

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Indic-CodecFake数据集,用于检测印度语言中神经音频编解码器合成语音深度伪造,发现现有检测器在印度语音上表现不佳,并提出SATYAM模型以提升性能。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19798 2026-04-23 cs.CY cs.CV econ.EM 67%

Diagnosing Urban Street Vitality via a Visual-Semantic and Spatiotemporal Framework for Street-Level Economics

通过视觉-语义和时空框架诊断城市街道活力

Xinxin Zhuo, Mengyuan Niu, Ruizhe Wang, Junyan Yang, Qiao Wang

机构 * School of Economics and Management, Southeast University(经济管理学院,东南大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) School of Architecture, Southeast University(建筑学院,东南大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出基于视觉-语义和时空框架的街道经济活力指数,结合时空数据和LBS信息,揭示街道活力的时空异质性及品牌层级影响。

Comments Submitted to ACM Transactions on Spatial Computing. This paper is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19386 2026-04-23 cs.CV 67%

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

Air-Know: 基于仲裁校准的知识内化鲁棒网络用于组合图像检索

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li

机构 * Shandong University(山东大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对组合图像检索中噪声三元组对应问题,Air-Know提出专家-代理-分流解耦范式,通过外部先验仲裁、专家知识内化和双流协调模块,提升鲁棒性和检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18151 2026-04-23 eess.IV cs.CV physics.med-ph 67%

Automated Description Generation of Cytologic Findings for Lung Cytological Images Using a Pretrained Vision Model and Dual Text Decoders: Preliminary Study

利用预训练视觉模型和双文本解码器自动描述肺穿刺图像的细胞学发现:初步研究

Atsushi Teramoto, Ayano Michiba, Yuka Kiriyama, Tetsuya Tsukamoto, Kazuyoshi Imaizumi, Hiroshi Fujita

机构 * Faculty of Information Engineering, Meijo University(_meijo大学信息工程学部) School of Medicine, Fujita Health University(_fujita健康大学医学部) Narita Memorial Hospital(_narita纪念医院) Oncology Innovation Center, Fujita Health University(_fujita健康大学肿瘤创新中心) Faculty of Engineering, Gifu University(_gifu大学工学部)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出利用预训练视觉模型和双文本解码器自动生成肺穿刺图像的细胞学发现,通过CNN分类和Transformer生成文本,实现高准确率的细胞学报告生成。

Comments This paper has been published in Cytopathology (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20570 2026-04-23 cs.CV 67%

Exploring Spatial Intelligence from a Generative Perspective

从生成视角探索空间智能

Muzhi Zhu, Shunyao Jiang, Huanyi Zheng, Zekai Luo, Hao Zhong, Anzhou Li, Kaijun Wang, Jintao Rong, Yang Liu, Hao Chen, Tao Lin, Chunhua Shen

机构 * Zhejiang University(浙江大学) State Key Laboratory of CAD & CG(计算机辅助设计与图形学国家重点实验室) Ant Group(蚂蚁集团) Westlake University(西湖大学) Zhejiang University of Technology(浙江工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出GSI-Bench,首个评估生成空间智能的基准,通过空间 grounded 图像编辑量化空间合规性与编辑保真度,实验表明生成训练可提升空间推理能力。

Comments Accepted by CVPR 2026. Project page: https://aim-uofa.github.io/GSI-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16607 2026-04-23 cs.CL cs.AI 62%

Spotlights and Blindspots: Evaluating Machine-Generated Text Detection

聚光灯与盲区:评估机器生成文本检测

Kevin Stowe, Kailash Patil

机构 * Pindrop(Pindrop公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了15种不同检测模型在七种英文文本测试集和三种创意人类写作数据集上的表现,揭示了模型性能、训练数据和评估指标对结果的影响,发现模型表现高度依赖于数据集和指标选择。

Comments 15 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20842 2026-04-23 cs.CL cs.AI cs.SD 62%

SpeechParaling-Bench: A Comprehensive Benchmark for Paralinguistic-Aware Speech Generation

SpeechParaling-Bench: 一种全面的语音生成语义意识基准

Ruohan Liu, Shukang Yin, Tao Wang, Dong Zhang, Weiji Zhuang, Shuhuai Ren, Ran He, Caifeng Shan, Chaoyou Fu

机构 * Nanjing University(南京大学) Xiaomi(小米)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SpeechParaling-Bench,通过1000个英中平行语音查询扩展细粒度特征,设置三个渐进任务评估语音生成的语义意识能力,揭示现有LALMs在语义控制和动态调节上的不足。

Comments Project page: https://speechparaling-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20601 2026-04-23 cs.AI cs.CL 62%

Self-Guided Plan Extraction for Instruction-Following Tasks with Goal-Conditional Reinforcement Learning

具有目标条件强化学习的指令遵循任务自引导计划提取

Zoya Volovikova, Nikita Sorokin, Dmitriy Lukashevskiy, Aleksandr Panov, Alexey Skrynnik

机构 * AXXX MIRAI

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SuperIgor框架,通过自学习机制使语言模型生成并优化高层计划,减少手动标注需求。通过迭代共训练,强化学习代理和语言模型共同改进,验证了在动态和随机环境中严格遵循指令的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19895 2026-04-23 cs.AI 57%

Learning When Not to Decide: A Framework for Overcoming Factual Presumptuousness in AI Adjudication

学习何时不决定:一种克服人工智能裁决中事实预设性的框架

Mohamed Afane, Emily Robitschek, Derek Ouyang, Daniel E. Ho

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文研究了人工智能裁决中因信息不足导致的预设性问题,提出SPEC框架在失业保险裁决中实现89%的准确率,展示了如何通过结构化提示清单解决信息缺失问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19932 2026-04-23 cs.CL cs.HC 57%

"Newspaper Eat" Means "Not Tasty": A Taxonomy and Benchmark for Coded Language in Real-World Chinese Online Reviews

‘Newspaper Eat’意味着‘不美味’:一种实世界中文在线评论中编码语言的分类和基准

Ruyuan Wan, Changye Li, Ting-Hao 'Kenneth' Huang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出CodedLang数据集,包含7744条中文Google地图评论,包含900条带有跨度标注的编码语言评论。通过七类分类法捕捉常见编码策略,如发音、拼写和跨语言替代。测试语言模型在编码语言检测、分类和评论评分预测中的表现,发现即使强模型也难以识别和理解编码语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08508 2026-04-23 cs.CV cs.CL 57%

Re:Verse -- Can Your VLM Read a Manga?

Re:Verse -- 能读懂漫画吗?

Aaditya Baranwal, Madhav Kataria, Naitik Agrawal, Yogesh S Rawat, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学) Indian Institute of Technology, Jodhpur(印度理工学院,朱达浦尔) Indian Institute of Technology, Varanasi(印度理工学院,瓦拉纳西)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文通过分析漫画叙事理解,揭示现有VLM在时间因果和跨面板连贯性上的不足,提出新的评估框架,系统研究长篇叙事理解能力。

Comments Accepted (oral) at ICCV (AISTORY Workshop) 2025

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW), pp. 3820-3830

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20706 2026-04-23 cs.SE cs.AI 57%

QuanForge: A Mutation Testing Framework for Quantum Neural Networks

QuanForge:一种用于量子神经网络的变异测试框架

Minqi Shao, Shangzhou Xia, Jianjun Zhao

机构 * Kyushu University(九州大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI

AI总结 本文提出QuanForge,一种针对量子神经网络的变异测试框架,通过引入统计变异杀灭准则和九种变异操作符,有效区分测试套件并定位脆弱电路区域,评估其在噪声环境下的可行性。

Comments 23 pages, 4 figures, accepted at FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20545 2026-04-23 cs.AI 57%

Measuring the Machine: Evaluating Generative AI as Pluralist Sociotechical Systems

测量机器:评估生成式AI作为多元社会技术系统

Rebecca L. Johnson

机构 * The School of History and Philosophy of Science, Faculty of Science(历史与哲学科学学院,科学学院) The University of Sydney(悉尼大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 本文提出MaSH循环框架,通过递归过程评估生成式AI作为多元社会技术系统,结合世界价值观调查数据和结构化提示,探讨价值观在交互中的生成与塑造。

Comments PhD Thesis - Author formatted. Original available on the University of Sydney library website

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20460 2026-04-23 cs.CV 50%

CCTVBench: Contrastive Consistency Traffic VideoQA Benchmark for Multimodal LLMs

CCTVBench:用于多模态大语言模型的对比一致性交通视频问答基准

Xingcheng Zhou, Hao Guo, Rui Song, Walter Zimmer, Mingyu Liu, André Schamschurko, Hu Cao, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(abstract_cn)

AI总结 CCTVBench通过真实事故视频与世界模型生成的反事实场景配对,提出对比一致性评估方法,揭示视频问答中对比一致性与标准指标间的显著差距,并引入C-TCD方法提升问答与一致性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19813 2026-04-23 cs.GT cs.MA quant-ph 50%

Evolution of Lane-Changing Behavior in Mixed Traffic: A Quantum Game Theory Approach

混合交通中变道行为的演变:一种量子博弈论方法

Sungyong Chung, Tina Radvand, Alireza Talebpour

专题命中 评测与基准 :prompting(abstract)

AI总结 本文通过量子博弈论框架分析变道行为,揭示人类与自动驾驶车辆的互动机制,发现人类适应性依赖于AV算法,提出模拟方法以预测行为演变。

详情

展开后加载摘要…

URL PDF HTML 收藏