arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1309 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1309 篇

2506.10386 2026-07-22 cs.CV 版本更新 78%

PoseIDON: 6DoF Pose Estimation with Foundation Model Features for Marine Sediment Burial Mapping

PoseIDON:利用基础模型特征进行海洋沉积物掩埋测绘的6自由度姿态估计

Jerry Yan, Chinmay Talegaonkar, Nicholas Antipa, Eric Terrill, Sophia Merrifield

机构 * Marine Physical Laboratory, Scripps Institution of Oceanography(Scripps海洋研究所物理实验室) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究针对海底物体掩埋深度估计难题,提出PoseIDON计算机视觉管道,结合基础模型特征与多视图摄影测量,从ROV视频估计物体姿态和海底方向,经实验验证,平均误差约10厘米,可实现可扩展非侵入测绘,支持污染场地环境评估。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing 239 (2026) 928-942

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03117 2026-07-21 cs.CV 版本更新 78%

Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models

揭示物理世界语义漏洞:用于红外视觉语言模型的通用对抗性补丁

Chengyin Hu, Yuxian Dong, Yikun Guo, Xiang Chen, Qike Zhang, Junqi Wu, Jiahuan Long, Jiujiang Guo, Yiwei Wei, Tingsong Jiang, Wen Yao

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出通用曲网格补丁框架UCGP,用于揭示红外视觉语言模型的语义鲁棒性漏洞,通过扰动视觉表征空间以削弱跨模态语义对齐,验证了其在多种架构和数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12537 2026-07-21 cs.CV 版本更新 78%

Prompt-Guided Foundation Model Tuning for Pathology Image Classification

用于病理图像分类的提示引导基础模型调优

Yi Lin, Zhengjie Zhu, Kwang-Ting Cheng, Hao Chen

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子与计算机工程系) Department of Chemical and Biological Engineering, The Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究院) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科技大学神经系统疾病国家重点实验室)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究针对病理图像分类中基础模型预训练与下游任务的差异问题,提出PAMT框架,通过引入RPS、PVP及AMT,在14个公开数据集上严格评估,显著提升分类准确率,确立了PAMT作为病理图像分类新基准的地位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17471 2026-07-17 cs.CR 版本更新 78%

PatchIsland: Orchestration of LLM Agents for Continuous Vulnerability Repair

PatchIsland:用于持续漏洞修复的大语言模型代理编排

Wonyoung Kim, Seunggi Min, Minjae Gwon, Dowoo Baik, Haein Lee, Hyeon Heo, Minjae Lee, Min Woo Baek, Yonghwi Jin, Younggi Park, Yunjae Choi, Taesoo Kim, Sangdon Park, Insu Yun

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究针对持续模糊测试中漏洞修复多为人工且现有AVR技术不适用于此的问题,提出PatchIsland系统,通过集成多种大语言模型代理及两阶段去重方法,实现高效漏洞修复,在内部评估和竞赛中都取得了较好的修复成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08842 2026-07-16 cs.CY 版本更新 78%

L2-Bench: An Evaluation Benchmark for Measuring LLM Capabilities in Second Language Education

L2-Bench:用于衡量第二语言教育中大型语言模型能力的评估基准

James Edgell, Wm. Matthew Kennedy, Ben Knight, Danielle Carvalho, Martin Ku, Isaac Pattis

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究针对第二语言教育中AIED系统评估不足的问题,引入L2-Bench开源基准。通过 validated分类法、基于评分标准的评估方法和评估数据集,对大型模型能力进行评估,发现Claude Opus 4.7总体最佳,难任务性能降,为教育决策提供方法,推动AI评估科学成熟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22830 2026-07-16 cs.CV cs.RO 版本更新 78%

A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions

大型视觉-语言模型在SOTIF条件下2D目标检测的比较评估

Ji Zhou, Yilin Ding, Yongqi Zhao, Jiachen Xu, Dong Bi, Johannes Betz, Arno Eichberger

机构 * Institute of Automotive Engineering, Graz University of Technology(汽车工程研究所,格拉茨技术大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文评估了大型视觉-语言模型在SOTIF条件下2D目标检测的性能,发现其在复杂场景中召回率显著优于传统方法,但几何精度仍有一定优势。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22633 2026-07-16 cs.SE 版本更新 78%

Rethinking the Capability of Fine-Tuned Language Models for Automated Vulnerability Repair

重新思考微调语言模型在自动漏洞修复方面的能力

Woorim Han, Yeongjun Kwak, Miseon Yu, Kyeongmin Kim, Younghan Lee, Hyungon Moon, Yunheung Paek

专题命中 评测与基准 :language model(title,abstract)

AI总结 探讨基于微调语言模型的自动漏洞修复技术,通过语义变换、重划数据集和引入新基准三种方式,考察现有模型能力及匹配评估指标充分性,以提升模型修复未见漏洞的能力和评估准确性。

Comments To appear at ICSE 2026. 13 pages. The L-AVRBench benchmark, Docker images, and evaluation scripts are available at https://github.com/rimwoohan/L-AVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05711 2026-07-13 cs.CV 版本更新 78%

Any to Full: Prompting Depth Anything for Depth Completion in One Stage

任何到完整:提示深度任何物以完成深度估计的一阶段

Zhiyuan Zhou, Ruofeng Liu, Taichi Liu, Weijian Zuo, Shanshan Wang, Zhiqing Hong, Desheng Zhang

机构 * Rutgers University(罗格斯大学) Michigan State University(密歇根州立大学) JD Logistics(京东物流) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :prompting(title,abstract)

AI总结 Any2Full提出一种单阶段深度完成框架,通过尺度提示适应预训练MDE模型,提升鲁棒性和效率,优于现有方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09076 2026-07-13 cs.CV 版本更新 78%

ProSGNeRF: Progressive Dynamic Neural Scene Graph with Frequency Modulated Foundation Model in Urban Scenes

ProSGNeRF:城市场景中基于频率调制基础模型的渐进式动态神经场景图

Tianchen Deng, Yanbo Wang, Yejia Liu, Chenpeng Su, Jingchuan Wang, Danwei Wang, Shao-Yuan Lo, Weidong Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对大规模城市场景中快速移动对象建模及相机自我运动处理难题,提出ProSGNeRF,通过渐进式场景图网络架构学习局部场景表示,利用基础模型网络编码潜码并引入频率调制模块,提升视图合成等能力。

Comments Accepted by IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19032 2026-07-10 cs.CV 版本更新 78%

Diagnosing Corruption-Induced Reliability Failures in Vision-Language Models

诊断视觉语言模型中由损坏引起的可靠性故障

Xiangjie Sui, Songyang Li, Hanwei Zhu, Baoliang Chen, Yuming Fang, Xin Sun

机构 * City University of Macau(澳门城市大学) Nanyang Technological University(南洋理工大学) Jiangxi University of Finance and Economics(江西财经大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉损坏对视觉语言模型行为的影响,引入Bench-C测试平台及稳健对齐分数(RAS),通过对13个VLM实验发现轻度损坏会提高top-1准确率却降低预测结构,支持超越最终答案的稳健性评估。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12497 2026-07-10 cs.CR 版本更新 78%

Demystifying LLM Supply Chain Vulnerabilities in the Wild: Distribution, Root Cause, and Real-World Impact

揭开大语言模型供应链在实际应用中的漏洞:分布、根源及现实世界影响

Shenao Wang, Yanjie Zhao, Zhao Liu, Quanchen Zou, Haoyu Wang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 该研究首次系统大规模实证分析大语言模型供应链漏洞,分析529个实际漏洞,发现漏洞集中在应用层等,特定漏洞源于独特特征,还研究了现实影响,提炼5条见解,为保障供应链安全提供数据基础与研究方向。

Comments Accepted by Internetware 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15177 2026-07-07 cs.SD cs.MM eess.AS 版本更新 78%

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

用于以音频为中心任务的音频-语言模型:系统综述

Yi Su, Jisheng Bai, Qisheng Xu, Kele Xu, Yong Dou

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) School of Communications and Information Engineering, Xi’an University of Posts and Telecommunications(通信与信息工程学院,西安邮电大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 对基于配对音频-文本数据训练的音频-语言模型进行系统综述,涵盖语音、音乐和声音,给出统一分类法,建立研究框架,助研究者了解技术发展与趋势,为应用提供参考。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03030 2026-07-03 cs.CV 版本更新 78%

BRIGHT: A Collaborative Generalist-Specialist Foundation Model for Breast Pathology

BRIGHT:用于乳腺病理的协作式通用-专科基础模型

Xiaojing Guo, Jiatai Lin, Yumian Jia, Jingqi Huang, Zeyan Xu, Weidong Li, Longfei Wang, Jingjing Chen, Qin Li, Weiwei Wang, Lifang Cui, Wen Yue, Zhiqiang Cheng, Xiaolong Wei, Jianzhong Yu, Xia Jin, Baizhou Li, Honghong Shen, Jing Li, Chunlan Li, Yanfen Cui, Yi Dai, Yiling Yang, Xiaolong Qian, Liu Yang, Yang Yang, Guangshen Gao, Yaqing Li, Lili Zhai, Chenying Liu, Tianhua Zhang, Zhenwei Shi, Cheng Lu, Xingchen Zhou, Jing Xu, Miaoqing Zhao, Fang Mei, Jiaojiao Zhou, Ning Mao, Fangfang Liu, Chu Han, Zaiyi Liu

机构 * Department of Breast Pathology and Laboratory, Tianjin Medical University Cancer Institute & Hospital, National Clinical Research Center for Cancer, Key Laboratory of Breast Cancer Prevention and Therapy, Tianjin Medical University, Ministry of Education, Tianjin’s Clinical Research Center for Cancer, West Huanhu Road, Tianjin, China(天津医科大学肿瘤医院乳腺病理科及实验室,国家癌症临床研究中心,天津医科大学乳腺癌预防与治疗重点实验室,天津医科大学,教育部,天津癌症临床研究中心,西湖南路,天津,中国) Guangdong Provincial Key Laboratory of Artificial Intelligence in Medical Image Analysis and Application, Guangdong Provincial People’s Hospital (Guangdong Academy of Medical Sciences), Southern Medical University, Guangzhou, China(广东省人工智能在医学影像分析与应用重点实验室,广东省人民医院(广东省医学科学院),南方医科大学,广州,中国)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出BRIGHT,首个针对乳腺病理的基础模型,采用通用-专科协作框架,在5.1万张全切片图像上训练,在25项内部验证任务中均达最优性能,优于5个通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20274 2026-07-03 cs.CV 版本更新 78%

SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking

SCLARO:面向场景级场景理解的数据集及用于基准测试的ScenarioCLIP

Advik Sinha, Saurabh Atreya, Aashutosh A, Sk Aziz Ali, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Science, Pilani – Hyderabad Campus(人工智能组,计算机科学与信息系,比拉理工学院和科学学院,比拉-海得拉巴校区)

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出SCLARO数据集(615,805张图像,含动作、对象和关系标注)及ScenarioCLIP模型,通过解耦编码器和知识蒸馏联合编码场景上下文、对象和关系,在零样本检索等任务上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10764 2026-06-29 cs.CV 版本更新 78%

SurgXBench: Explainable Vision-Language Model Benchmark for Surgery

SurgXBench: 可解释的视觉-语言模型手术基准

Jiajun Cheng, Xianwu Zhao, Sainan Liu, Xiaofan Yu, Ravi Prakash, Patrick J. Codd, Jonathan Elliott Katz, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) Intel Labs(英特尔实验室) Duke University(杜克大学) University of Miami(迈阿密大学) University of California, Merced(加州大学默塞德分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对手术视觉-语言模型(VLM)泛化能力不足的问题,提出SurgXBench基准,在零样本设置下评估多个先进VLM在器械与动作分类任务上的表现,并集成可解释AI分析模型注意力与因果解释,揭示模型依赖弱上下文线索而非临床相关证据的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04764 2026-06-24 cs.CV 版本更新 78%

Do Foundation Models See Biology? Evaluating Attention Coherence with Spatial Transcriptomics in Glioblastoma

基础模型是否理解生物学?利用空间转录组学评估胶质母细胞瘤中的注意力一致性

Dilakshan Srikanthan, Amoon Jamzad, Paul Wilson, Nooshin Maghsoodi, Robert Policelli, Gabor Fichtinger, John F. Rudan, Parvin Mousavi

机构 * Translational Medicine, School of Medicine, Queen’s University, Kingston, ON, Canada(转化医学、医学院、皇后大学、金斯顿,ON,加拿大) School of Computing, Queen’s University, Kingston, ON, Canada(计算学院、皇后大学、金斯顿,ON,加拿大) Department of Surgery, Queen’s University, Kingston, ON, Canada(外科部门、皇后大学、金斯顿,ON,加拿大)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出基于空间转录组学的框架,客观评估病理基础模型注意力图与生物学的一致性,发现注意力捕捉多基因转录程序而非单个分子事件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09054 2026-06-24 cs.SD cs.MM 版本更新 78%

HAFM: Hierarchical Autoregressive Foundation Model for Music Accompaniment Generation

HAFM:用于音乐伴奏生成的分层自回归基础模型

Jian Zhu, Jianwei Cui, Yunlong Xue, Shihao Chen, Yubang Zhang, Cheng Luo, Jun Sun

机构 * Zhejiang Lab(浙江实验室) University of Science and Technology of China(中国科学技术大学) Zhejiang International Studies University(浙江国际 Studies 大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出HAFM分层自回归基础模型,通过双速率分词和三阶段级联生成框架,在MUSDB18上FAD达1.71,主观偏好率51.5%,优于基线。

Comments This paper is submitted to the to National Conference on Man-Machine Speech Communication (NCMMSC, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05739 2026-06-18 cs.SD eess.AS 版本更新 78%

Do speech foundation models perceive speaker similarity as humans do?

语音基础模型是否像人类一样感知说话人相似性?

Minoru Kishi, Hayato Yagi, Shinnosuke Takamichi, Yuki Saito

机构 * Keio University, Japan(庆应大学,日本) The University of Tokyo, Japan(东京大学,日本)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究通过比较40多个语音基础模型的说话人嵌入与人类主观相似性评分,探究模型距离是否与人类感知一致,并识别影响模型与人类感知一致性的关键配置因素。

Comments Accepted by INTERSPEECH 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04796 2026-06-18 eess.AS cs.SD 版本更新 78%

LALM-as-a-Judge: Benchmarking Large Audio-Language Models for Safety Evaluation in Multi-Turn Spoken Dialogues

LALM-as-a-Judge:用于多轮口语对话安全评估的大型音频语言模型基准测试

Amir Ivry, Shinji Watanabe

机构 * Computer Engineering, Technion--Israel Institute of Technology, Haifa, Israel(技术学院电子工程系,技术离子技术研究所,以色列海法) Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,卡内基梅隆大学,美国匹兹堡)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对口语对话中社会不安全内容评估仍以文本为中心、忽略韵律和转录失败的问题,提出包含24000个多轮口语对话的开放基准,评估6种大型音频语言模型在文本、音频和多模态设置下的敏感性、严重性顺序特异性和轮次位置偏差,发现音频提供非词汇证据,多模态增益非普遍且存在多种模式。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03308 2026-06-11 cs.CR 版本更新 78%

The Security Budget of Code-LLM Prompt Hardening: Provable Limits Under Pass-Only Acceptance

代码大语言模型的安全预算:一种信息论容量-安全界限

Jianwei Tai

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出一种信息论框架,通过容量-安全界限量化代码大语言模型在提示扰动下的功能容量与扰动保留之间的权衡,并利用输出隐藏状态进行实证验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22153 2026-06-10 eess.AS 版本更新 78%

Towards Paradigm-General Suicide Risk Detection via Speech LLM

面向范式通用的语音自杀风险检测:基于语音大语言模型

Jialun Li, Weitao Jiang, Ziyun Cui, Yinan Duan, Diyang Qu, Chao Zhang, Runsen Chen, Chang Lei, Wen Wu

专题命中 评测与基准 :LLM(title,abstract)

AI总结 提出基于语音大语言模型和混合DoRA专家的方法,统一多种语音诱发范式,在1223名参与者十种范式上优于特定范式及传统联合学习模型,并泛化至未见范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14441 2026-06-09 eess.SP 版本更新 78%

Batch Effects In Brain Foundation Model Embeddings

脑基础模型嵌入中的批次效应

Ye Tao, Bradley T. Baker, Yu Wu, Anand D. Sarwate, Sandeep Panta, Sergey Plis, Vince D. Calhoun

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究评估了两个脑影像基础模型在多中心fMRI数据集中的嵌入表现,发现嵌入编码了显著的批次相关变异,并探讨了和谐化对嵌入的影响,揭示了不同模型对区域活动和区域交互的偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18785 2026-08-17 cs.AI 版本更新 77%

SkillSight: Calibrating Generic Content Bias for Skill Retrieval

SkillSight:通过共享描述实现准确技能检索

Jinying Xiao, Bin Li, Xiaopeng Li, Jianling Li, Jiacheng Jie, Xiaodong Liu, Ma Jun, Chao Wang, Nyima Tashi, Jie Yu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型智能体技能检索问题,提出SkillSight框架,通过语义和词汇空间校准共享背景,减少偏差,实验证明该方法能提升检索指标,在端到端评估中表现出色且速度快,实现准确高效的技能选择。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27826 2026-08-11 cs.AI 版本更新 77%

NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms

NormAct:具身规划中隐藏社会规范遵守的基准

Shiyun Zhao, Xinwei Song, Tianyu Guo, Xiaomeng Gao, Mingyuan Liu, Xu Han, Yuanyuan Zhang, Zhenliang Zhang, Xue Feng, Bo Dai

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院) China Academy of Information and Communications Technology(中国信息通信研究院) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出NormAct基准,评估多模态大语言模型在具身规划中遵守隐藏社会规范的能力,发现模型在67.3%情况下达成显式目标,但仅26.4%遵守隐藏规范;提出NormPerceptor方法将任务成功率从24.2%提升至46.7%。

Comments This version revises the paper content and adds substantial details on the benchmark design and experimental setup

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新 77%

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新 77%

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.AI

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12383 2026-08-10 cs.CL 版本更新 77%

Beyond Binary Detection: A Multi-Dimensional Taxonomy of Cancer Misinformation on Reddit

超越二元检测:Reddit 上癌症错误信息的多维分类法

Aria Pessianzadeh, Pooriya Jamie, Naima Sultana, Georgia Himmelstein, Yuliya Zektser, Patricia Ganz, Homa Hosseinmardi, Amir Ghasemian, Rezvaneh Rezapour

机构 * Drexel University(德雷塞尔大学) UCLA(加州大学洛杉矶分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究旨在刻画Reddit上癌症错误信息,引入多维分类法涵盖七个维度。利用专家标注数据评估大语言模型,分析错误信息。发现其约占癌症讨论6%,少样本提示可提高性能,还识别出常见错误信息叙述,为相关建模奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21140 2026-08-07 cs.SE cs.AI 版本更新 77%

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配

Han Chi, Jiaxin Qi, Yan Cui, Baisheng Lai, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。

Comments 13 pages, 4 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00794 2026-08-06 cs.AI 版本更新 77%

Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

无效度的测量:智能体AI评估中的复合可靠性问题

William Caban

机构 * Red Hat, Inc.(红帽公司) Alma Mater Europaea University(欧洲母校大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究指出智能体AI评估存在复合可靠性问题,任务生成、LLM模拟、评分者间信度三个层面的失效相乘降低效度,提出八项心理测量学改进建议以提升评估可信度。

Comments 34 pages (review/double-spaced format), 2 figures, 5 tables. Submitted to Knowledge-Based Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20690 2026-08-06 cs.CL 版本更新 77%

Learning to Detect UI Principle Violations via Reinforcement Learning

通过强化学习学习检测用户界面原则违规

Nishi Mehta, Swathi Alse, Himani Kumawat, Yue Yu, Pratik Jayarao

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 研究小型语言模型和编码代理生成的网页前端代码违反界面质量原则的问题,通过统一多来源的界面质量原则,构建数据集并利用强化学习训练轻量级视觉语言模型作为评判器,提升检测效果并发布相关方法支持评估和后续工作。

详情

展开后加载摘要…

URL PDF HTML 收藏