arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-18 至 2026-06-18 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2606.19183 2026-06-18 cs.CL cs.AI 新提交 93%

Language Models as Interfaces, Not Oracles: A Hybrid LLM-ML System for Pediatric Appendicitis

语言模型作为接口而非预言机:用于小儿阑尾炎的混合LLM-ML系统

Soheyl Bateni, Maryam Abdolali

机构 * K. N. Toosi University of Technology(K.N. Toosi技术大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ClaMPAPP混合系统,利用LLM从自由文本中提取结构化特征,再由XGBoost分类器进行诊断,在两个独立队列中优于端到端LLM,提高了诊断稳定性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18422 2026-06-18 quant-ph 新提交 92%

Gatekeepers and Hallucinations: A Layered Evaluation Framework for LLM-Driven Quantum Circuit Generation

守门人与幻觉:LLM驱动的量子电路生成的分层评估框架

Christopher Coleman, Sharon Marfatia

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出分层评估框架,通过守门人筛选、电路保真度分析和设计熵指标,识别LLM在量子电路生成中的五种失败模式,并揭示评估基础设施本身可能引入错误。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00802 2026-06-18 cs.SE cs.CL cs.LG 版本更新 92%

GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents

GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化

Jie JW Wu, Ayanda Patrick Herlihy, Ahmad Saleem Mirza, Ali Afoud, Fatemeh Fard

机构 * Michigan Technological University, Houghton(密歇根技术大学) Birmingham City University(伯明翰城市大学) University of British Columbia, Kelowna(不列颠哥伦比亚大学, 肯洛纳)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GrowthHacker基准,利用LLM代理自动迭代修改代码以优化离线策略评估(OPE)实现,在Open Bandit Pipeline和Scope-RL上评估多种框架,证明基于LLM的代理可作为自动增长黑客持续改进OPE系统。

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18797 2026-06-18 cs.CL 新提交 92%

Beyond Scalar Scores: Exploring LLM-based Metrics for Clinical Significance Evaluation in Radiology Reports

超越标量分数:探索基于LLM的放射学报告临床意义评估指标

Qingyu Lu, Ruochen Li, Liang Ding, Yufei Xia, Youxiang Zhu, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) Technical University of Munich(慕尼黑工业大学) Alibaba(阿里巴巴) University of Glasgow(格拉斯哥大学) University of Massachusetts Boston(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对放射学报告评估中临床准确性要求,研究基于LLM的指标区分临床错误与无害变体的能力,发现判别偏差,并通过合成数据训练轻量级指标,在成本敏感部署中优于大型模型。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12347 2026-06-18 cs.CL cs.AI cs.CY 91%

Assessment of Evolving Large Language Models in Upper Secondary Mathematics

对上中学数学中演进式大语言模型的评估

Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

机构 * Faculty of Information Technology(信息科技学院) University of Jyväskylä(于韦斯屈莱大学) Faculty of Humanities and Social Sciences(人文与社会科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文评估了不同大语言模型在芬兰毕业考试中的数学能力,发现随着模型演进,其表现显著提升,部分模型接近完美,展示了LLM在数学能力上的快速进步及其在教育中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02690 2026-06-18 cs.SE 版本更新 91%

Outrunning LLM Cutoffs: A Live Kernel Crash Resolution Benchmark for All

超越LLM截止日期:一个面向所有人的实时内核崩溃修复基准

Chenxi Huang, Alex Mathai, Feiyang Yu, Aleksandr Nogikh, Petros Maniatis, Franjo Ivančić, Eugene Wu, Kostis Kaffes, Junfeng Yang, Baishakhi Ray

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Live-kBench和kEnv框架,用于持续评估LLM代理修复新发现的Linux内核崩溃,实验显示代理在截止日期前修复率高出25%,但仅20%的补丁与开发者修复匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15851 2026-06-18 cs.CL cs.AI 版本更新 91%

Narrative Theory-Driven LLM Methods for Automatic Story Generation and Understanding: A Survey

叙事理论驱动的LLM方法在自动故事生成与理解中的应用:综述

David Y. Liu, Aditya Joshi, Paul Dawson

机构 * School of Computer Science and Engineering(计算机科学与工程学院) School of Arts and Media(艺术与媒体学院) University of New South Wales (UNSW)(新南威尔士大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 综述叙事理论驱动的大语言模型方法在自动故事生成与理解中的应用,分析现状并指出生成任务在理论应用、后训练方法、非虚构叙事及叙事层次等方面落后于理解任务,提出未来方向。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18473 2026-06-18 cs.CL 新提交 90%

PreUnlearn: Auditing Collateral Knowledge Damage Before Large Language Model Unlearning

PreUnlearn: 在大语言模型遗忘之前审计附带知识损害

Bo Su, Ankit Shah, Thai Le

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出PreUnlearn方法,通过数据特征预测遗忘操作对同领域和远距离知识的附带损害,实现遗忘前的风险审计。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18258 2026-06-18 cs.HC cs.AI 新提交 90%

Examining Human-Like Behaviors in LLMs: A Multi-Dimensional Analysis of Model Behaviors, User Factors, and System Prompts

审视LLM中的人类行为:模型行为、用户因素和系统提示的多维分析

Sunnie S. Y. Kim, Margit Bowler, Leon A Gatys

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过21,000次对话的多维分析,发现LLM普遍表现出人类行为,但不同模型和用户因素下差异显著;人类评估者认为LLM的自我参照和关系建立行为不如人类适当,但边界维护行为更适当;系统提示可控制这些行为但需谨慎评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19111 2026-06-18 cs.CL cs.AI cs.MA 新提交 90%

Leadership as Coordination Control: Behavioral Signatures and the Recovery-Advantage Boundary in Multi-Agent LLM Teams

领导力作为协调控制:多智能体LLM团队中的行为特征与恢复优势边界

Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究多智能体LLM团队中过程级协调控制何时增加价值,通过行为特征和消融实验发现,控制器的优势仅在初始多数投票不可靠、任务可恢复且无指导交互无法修复时出现,验证了权变理论。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13899 2026-06-18 cs.CL cs.AI 版本更新 90%

Do We Still Need Humans in the Loop? Comparing Human and LLM Annotation in Active Learning for Hostility Detection

我们是否仍然需要人在回路中?比较主动学习中用于敌意检测的人类与LLM标注

Ahmad Dawar Hakimi, Lea Hirlimann, Isabelle Augenstein, Hinrich Schütze

机构 * Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究比较了LLM与人类在主动学习中的标注效果,发现LLM标注成本更低且性能更优,但主动学习在LLM标注下无优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18596 2026-06-18 cs.HC cs.AI 新提交 90%

Better Adherence, Richer Context: A Field Evaluation of LLM-Powered Conversational Voice Diaries for Sleep

更好的依从性,更丰富的上下文:基于LLM的对话式语音睡眠日记的现场评估

Amama Mahmood, Bokyung Kim, Honghao Zhao, Molly E. Atwood, Luis F. Buenaver, Michael T. Smith, Chien-Ming Huang

机构 * The Johns Hopkins University(约翰霍普金斯大学) Department of Psychiatry and Behavioral Sciences, The Johns Hopkins University School of Medicine(精神病学与行为科学系,约翰霍普金斯大学医学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过现场实验评估基于LLM的对话式语音睡眠日记,发现相比文本日记,语音日记提高了依从性并收集了更详细的上下文信息,但结构化字段完整性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19057 2026-06-18 stat.ML cs.LG stat.CO stat.ME 新提交 87%

Quantifying and Auditing LLM Evaluation via Positive--Unlabeled Learning

通过正-无标签学习量化与审计大语言模型评估

Zilong Zhang, Yi-Ting Hung, Lei Ding, Chi-Kuang Yeh

机构 * Department of Mathematics and Statistics(数学与统计学系) Georgia State University(佐治亚州立大学) Department of Statistics(统计学系) University of Manitoba(曼尼托巴大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对大语言模型作为评估者存在的系统性偏差(如冗长偏好),提出基于部分最优传输的几何审计框架,利用少量人工验证正样本校正偏差,无需重训练即可提升与人类偏好的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18356 2026-06-18 cs.CR cs.AI 新提交 87%

SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents

SafeClawBench: 区分工具使用LLM代理中的语义、审计证据和沙箱危害

Yuchuan Tian, Mengyu Zheng, Haocheng Mei, Ye Yuan, Chao Xu, Xinghao Chen, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Beijing Jiaotong University(北京交通大学) SUIBE(上海外国语大学) Huawei(华为) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出SafeClawBench基准,通过三个独立端点(语义攻击接受、审计可见危害证据、沙箱观察危害)评估工具使用LLM代理的安全性,揭示不同失败模式并支持可复现比较。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23851 2026-06-18 cs.CL cs.AI cs.SC 版本更新 87%

ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark

ASyMOB:代数符号数学运算基准

Michael Shalyt, Rotem Elimelech, Ido Kaminer

机构 * MIT(麻省理工学院) Technion - Israel Institute of Technology(技术学院-以色列理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ASyMOB基准,包含35,368个符号数学问题,通过扰动测试揭示大模型在符号数学推理中的鲁棒性不足,并发现LLM与CAS的互补潜力。

Comments Published in ICML2026: https://icml.cc/virtual/2026/poster/63549 Code repository: https://github.com/RamanujanMachine/ASyMOB Complete benchmark dataset: https://huggingface.co/datasets/Shalyt/ASyMOB-Algebraic_Symbolic_Mathematical_Operations_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18471 2026-06-18 cs.CL 新提交 86%

Possible or Definite? A Benchmark for Evaluating Diagnostic Uncertainty Preservation in Clinical Text

可能还是确定?评估临床文本中诊断不确定性保留的基准

Hongbo Du, Zixin Lu, Jiaming Qu

机构 * Trine University(特里尼大学) University of Michigan(密歇根大学) Amazon(亚马逊)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 构建包含9184个不确定性标注的基准,评估LLM在临床文本中保留诊断不确定性的能力,发现LLM保留原始不确定性线索不足一半,且难以区分相邻级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19338 2026-06-18 cs.CV 新提交 86%

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract)

AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18789 2026-06-18 eess.SY cs.SY 新提交 86%

PowerAgentBench-SS: A Benchmark for Agentic AI in Power System Steady-State Studies

PowerAgentBench-SS:电力系统稳态研究中智能体AI的基准测试

Costas Mylonas, Magda Foti, Andrea Pomarico, Matheus Duarte, Qian Zhang, Emmanouel Varvarigos

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出PowerAgentBench-SS基准框架,用于评估LLM智能体在电力系统稳态研究中执行工程工作流的能力,通过工具API、验证预算和风险敏感指标区分智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18285 2026-06-18 cs.SI cs.CY 新提交 86%

RELIANCE: Curating and Evaluating Reproductive Health Information on Social Media

RELIANCE: 策展与评估社交媒体上的生殖健康信息

Vaibhav Balloli, Laura Peyton Ellis, Vishala Mishra, Alice Chi, Alex Peahl, Elizabeth Bondi-Kelly

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对TikTok上孕期和产后健康信息,构建专家标注数据集RELIANCE,评估LLM事实核查能力,发现近60%信息准确,但整体与具体声明评估存在15%差距。

Comments Accepted at Datasets and Benchmarks Track, ACM Knowledge Discovery and Data Mining (KDD) 2026. Project page: https://realize-lab.github.io/RELIANCE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18636 2026-06-18 cs.CL cs.AI 新提交 85%

PEC-Home: Interpretation of Progressively Elliptical Commands in Smart Homes

PEC-Home:智能家居中渐进式省略命令的解释

Yingyu Shan, Zeming Liu, Silin Li, Boao Qian, Jiashu Yao, Yuhang Guo, Haifeng Wang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对智能家居中用户因共享上下文而使用渐进式省略命令导致的指代和意图歧义问题,提出首个模拟家庭数据集PEC-Home,实验表明现有LLM助手难以准确执行省略命令。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02904 2026-06-18 cs.HC cs.CL q-bio.NC 版本更新 84%

ScholaWrite: A Dataset of End-to-End Scholarly Writing Process

ScholaWrite: 端到端学术写作过程数据集

Khanh Chi Le, Linghe Wang, Minhwa Lee, Ross Volkov, Luan Tuyen Chau, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ScholaWrite数据集,通过Chrome扩展记录Overleaf上的按键,捕捉从初稿到终稿的多月写作过程,包含5篇计算机科学预印本的近6.2万次文本修改及认知写作意图标注,揭示人类写作与LLM辅助之间的差距。

Comments Equal contribution: Khanh Chi Le, Linghe Wang, Minhwa Lee | project page: https://minnesotanlp.github.io/scholawrite/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18557 2026-06-18 cs.AI cs.LG cs.LO 新提交 84%

DeFAb: A Verifiable Benchmark for Defeasible Abduction in Foundation Models

DeFAb:基础模型中可废止溯因的可验证基准

Patrick Cooper, Alvaro Velasquez

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :foundation model(title);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 提出DeFAb基准,通过将知识库转换为可验证的溯因实例,评估基础模型在可废止推理中的创造力与理论推理能力,发现前沿模型准确率远低于符号求解器。

Comments 33 pages, 14 figures, 23 tables. Dataset: https://huggingface.co/datasets/PatrickAllenCooper/DeFAb ; code and evaluation harness: https://github.com/PatrickAllenCooper/blanc

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18310 2026-06-18 cs.CR cs.AI 新提交 83%

Conflict-Aware Retriever Editing for Knowledge Injection Attacks on LLM-Based RAG Systems

冲突感知检索器编辑:针对基于LLM的RAG系统的知识注入攻击

Xinru Liu, Xianglong Zhang, Di Cai, Zhumin Chen, Pengfei Hu, Xin Xin

机构 * Shandong University, China(山东大学,中国) Tsinghua University, China(清华大学,中国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出冲突感知检索器编辑框架CAREATTACK,通过模型中心攻击将恶意知识注入RAG系统,利用图检测和参数编辑投影解决冲突,并轻量校准保持攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18986 2026-06-18 cs.CL cs.AI 新提交 82%

Beyond Tokenization: Direct Timestep Embedding and Contrastive Alignment for Time-Series Question Answering

超越分词:面向时间序列问答的直接时间步嵌入与对比对齐

Yafeng Wu, Huu Hiep Nguyen, Thin Nguyen, Hung Le

机构 * Deakin University(德肯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CADE框架,通过逐点线性编码器直接嵌入每个时间步,避免分词瓶颈,并利用单向监督对比损失对齐时间序列与文本锚点,在Time-MQA基准上提升六项TSQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20135 2026-06-18 cs.CL cs.AI cs.IR 82%

KNIGHT: Knowledge Graph-Driven Multiple-Choice Question Generation with Adaptive Hardness Calibration

KNIGHT: 基于知识图谱的多选题生成与自适应难度校准

Mohammad Amanlou, Erfan Shafiee Moghaddam, Yasaman Amou Jafari, Mahdi Noori, Farhan Farsi, Behnam Bahrak

机构 * University of Tehran(塔里班大学) Independent Researcher(独立研究员) Amirkabir University of Technology(阿米尔卡比尔技术大学) TEIAS Institute(TEIAS研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 KNIGHT通过构建领域特定知识图谱,实现高效生成多选题数据集,支持自适应难度控制,提升生成效率与质量,验证了其在多个领域内的有效性。

Comments Accepted at the Third Conference on Parsimony and Learning (CPAL 2026). 36 pages, 12 figures. (Equal contribution: Yasaman Amou Jafari and Mahdi Noori.)

Journal ref Conference on Parsimony and Learning, Proceedings of Machine Learning Research, 328:989-1024, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18668 2026-06-18 cs.MA cs.CL 新提交 81%

EARS: Explanatory Abstention for Reliable Sub-Agent Modeling in Large-scale Multi-Agent Systems

EARS:大规模多智能体系统中可靠子智能体建模的解释性弃权

Shuang Xie, Yunan Lu, Han Li, Lingyun Wang

机构 * Shopify Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对大规模多智能体系统中子智能体过度回答导致幻觉的问题,提出EARS框架,通过将弃权重构为智能体间通信协议,利用校准的LLM裁判模型生成结构化弃权标签和理由,微调子智能体以检测故障并返回理由,在电商助手系统中将响应通过率从68.5%提升至78.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18656 2026-06-18 cs.CL 新提交 81%

The Wrong Kind of Right: Quantifying and Localizing Misfired Alignment in LLMs

错误的正确:量化和定位大语言模型中的失调对齐

Naihao Deng, Yiming Feng, Chimaobi Okite, Kaijian Zou, Lu Wang, Rada Mihalcea, Yulong Chen

机构 * University of Michigan(密歇根大学) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出VETO基准和失调对齐率(MAR)指标,发现所有LLM在刻板印象相关问题上均存在非平凡的失调对齐,且人类为0%,机制分析表明对齐诱导的线索会放大该现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13836 2026-06-18 cs.CL cs.CV cs.MM 版本更新 81%

FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs

FutureOmni:从全模态上下文中评估多模态大语言模型的未来预测能力

Qian Chen, Jinlan Fu, Changsong Li, Min Zhang, See-Kiong Ng, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出FutureOmni基准,评估多模态大模型从音视频线索预测未来的能力,发现现有模型在语音密集场景下表现差,并设计OFF训练策略提升性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14968 2026-06-18 cs.LG cs.AI 版本更新 81%

InstructTime++: Time Series Classification with Multimodal Language Modeling via Implicit Feature Enhancement

InstructTime++: 通过隐式特征增强的多模态语言建模进行时间序列分类

Mingyue Cheng, Xiaoyu Tao, Huajian Zhang, Qi Liu, Zhiding Liu, Yucong Luo, Yiheng Chen, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出将时间序列分类转化为多模态生成任务,通过离散化模块和对齐投影层弥合模态差距,并利用隐式特征建模提升语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18553 2026-06-18 cs.CV 新提交 80%

Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning

基于知识的分层多模态检索用于新闻图像描述生成

Minh-Loi Nguyen, Xuan-Vu Le, Long-Bao Nguyen, Hoang-Bach Ngo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市分校理学院) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市分校)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出分层多模态文章检索增强的图像描述框架,通过结构感知检索和上下文精炼,结合VLM和LLM生成富含上下文细节的描述,在EVENTA 2025挑战赛中获得第5名。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏