arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-01 至 2026-07-01 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 53 篇

2508.02376 2026-07-01 cs.HC 版本更新 67%

Talking Surveys: How Photorealistic Embodied Conversational Agents Shape Response Quality, Engagement, and Satisfaction

对话式调查:逼真的具身对话代理如何影响回答质量、参与度和满意度

Matus Krajcovic, Peter Demcak, Eduard Kuric

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究提出一种集成AI驱动视频生成、语音识别和大语言模型的虚拟化身对话调查工具,实验表明具身代理能显著提升回答信息量和详细度,提高参与效率,但对满意度无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31919 2026-07-01 cs.RO cs.AI cs.CV 新提交 57%

MVP-Nav: Multi-layer Value Map Planner Navigator

MVP-Nav: 多层价值地图规划导航器

Wenyuan Xie, Shaokai Wu, Yijin Zhou, Yanbiao Ji, Guodong Zhang, Bayram Bayramli, Qiuchang Li, Xunchu Zhou, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 针对零样本目标导航中缺乏深度信息导致的物理不确定性,提出MVP-Nav框架,通过3D基础模型重建物理占用并构建多层价值地图,实现语义与物理约束的统一规划,达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31800 2026-07-01 cs.AI 新提交 57%

Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

Evo-PI:通过演化原则引导的对齐医学推理

Xianda Zheng, Huan Gao, Meng-Fen Chiang, Michael Witbrock, Kaiqi Zhao, Shangyang Li

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) National Yang Ming Chiao Tung University(国立阳明交通大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出Evo-PI框架,将推理原则作为可演化的语言监督信号,通过协同进化循环动态调整模型推理,在医学视觉问答中提升准确率最高达24.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31748 2026-07-01 cs.LG 新提交 57%

Addressing Over-Refusal in LLMs with Competing Rewards

用竞争奖励解决大语言模型中的过度拒绝问题

Taeyoun Kim, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) SynthLabs

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 提出SEAR方法,通过对抗优化和过程奖励,让模型在推理中探索有害思路但最终输出安全答案,从而缓解安全训练导致的过度拒绝问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30774 2026-07-01 cs.AI 新提交 57%

What Drives Interactive Improvement from Feedback?

什么驱动了来自反馈的交互式改进?

Bartłomiej Cupiał, Jan Łojek, Mikołaj Garstecki, Szymon Pobłocki, Alicja Ziarko, Piotr Miłoś

机构 * University of Warsaw(华沙大学) AKCES NCBR Princeton University(普林斯顿大学) Mistral AI Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所)

专题命中 推理与问题求解 :language agent(abstract);分类 cs.AI

AI总结 通过受控的学生-教师协议,分离反馈、重试和格式修正对多轮语言智能体性能提升的影响,发现有用反馈必须提供超越通用重试的指导,且学生利用反馈的能力是交互改进的关键瓶颈。

Comments 9 pages, 7 figures, accepted to the RLxF Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10652 2026-07-01 cs.CV cs.AI 版本更新 57%

Are Video Reasoning Models Ready to Go Outside?

视频推理模型是否已准备好走向户外?

Yangfan He, Changgyu Boo, Jaehong Yoon

机构 * NTU Singapore(新加坡国立大学) Korea University(韩国大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。

Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16807 2026-07-01 cs.AI cs.DM math.CO 版本更新 57%

Improved Upper Bounds for Slicing the Hypercube

切割超立方体的改进上界

Duncan Soiffer, Nathaniel Itty, Christopher D. Rosin, Blake Bruell, Mason DiCicco, Gábor N. Sárközy, Ryan Offstein, Daniel Reichman

机构 * Carnegie Mellon University(卡内基梅隆大学) Worcester Polytechnic Institute(伍斯特理工学院) Constructive Codes

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 研究用最少超平面切割n维超立方体所有边的问题,通过构造8个超平面切割Q_{10},将上界从⌈5n/6⌉改进为⌈4n/5⌉(n为5的奇数倍时加1)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31467 2026-07-01 cs.CV 新提交 50%

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。

Comments 21 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31257 2026-07-01 cs.CV 新提交 50%

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

可解码不等于已接地:用于VLM空间推理的视觉消融仲裁器

Chih-Ting Liao, Fei Shen, Xin Cao, Tat-Seng Chua

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出一种视觉消融仲裁方法,通过将图像替换为灰色空白,揭示视觉语言模型在空间推理中存在的三种接地机制:接地、先验和反转,并证明线性探针和转向恢复会系统性地高估模型的实际视觉接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31100 2026-07-01 cs.CV 新提交 50%

TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis

TaxoMIL:用于层次化全切片图像分析的分层约束学习

Chaeyeon Lee, Khang Nguyen Quoc, Jinsol Song, Yosep Chong, Kwangil Yim, Jin Tae Kwak

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出TaxoMIL框架,将WSI诊断重构为多粒度文本生成任务,通过双头Transformer解码器和分类学引导目标,实现层次感知的准确预测。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31071 2026-07-01 cs.CV cs.RO 新提交 50%

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

层次化3D场景图构建与基于信念的语义导航规划

Bing Wu, Zuyao Chen, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 提出零样本语义导航框架,通过在线维护层次化3D场景图(HSG)实现多粒度语义拓扑,并基于信念规划进行有限视野推演,在长距离导航中显著提升成功率与路径效率。

Comments Camera-ready version accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22075 2026-07-01 cs.CV 版本更新 50%

Reasoning in machine vision by learning fast and slow thinking

通过快速与慢速思考学习进行机器视觉推理

Shaheer U. Saeed, Yipei Wang, Veeru Kasivisvanathan, Brian R. Davidson, Matthew J. Clarkson, Yipeng Hu, Daniel C. Alexander

机构 * Centre for Bioengineering, Queen Mary University of London(伦敦玛丽女王大学生物工程中心) Digital Environment Research Institute, Queen Mary University of London(伦敦玛丽女王大学数字环境研究所) School of Engineering and Materials Science, Queen Mary University of London(伦敦玛丽女王大学工程与材料科学学院) UCL Hawkes Institute, University College London(伦敦大学学院UCL霍克斯研究所) Department of Medical Physics and Biomedical Engineering, University College London(伦敦大学学院医学物理与生物医学工程系) Centre for Urology Imaging, Prostate, AI and Surgical Studies (COMPASS) Research Group, Division of Surgery and Interventional Science, University College London(伦敦大学学院外科与介入科学部泌尿影像、前列腺、人工智能与手术研究(COMPASS)组中心) Department of Urology, Comprehensive Cancer Center, Medical University of Vienna(维也纳医科大学综合癌症中心泌尿科) Division of Surgery and Interventional Science, University College London(伦敦大学学院外科与介入科学部) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 受人类双过程认知理论启发,提出结合快速系统I和慢速系统II的视觉推理范式,通过推理时计算提升数据稀缺场景下的性能,在计算机视觉基准和五器官癌症定位任务中超越大规模监督学习和人类专家。

Journal ref Nat Commun (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19610 2026-07-01 cs.CE 50%

V2T-CoT: From Vision to Text Chain-of-Thought for Medical Reasoning and Diagnosis

V2T-CoT:从视觉到文本链式推理用于医学推理与诊断

Yuan Wang, Jiaxiang Liu, Shujian Gao, Bin Feng, Zhihang Tang, Xiaotang Gai, Jian Wu, Zuozhu Liu

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出V2T-CoT方法,通过自动化定位生物医学图像中的偏好区域并将其整合到区域级像素注意力中,提升医学诊断的可解释性与准确性。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 79 篇

2602.06625 2026-07-01 cs.CL 版本更新 93%

FairJudge: An Adaptive, Debiased, and Consistent LLM-as-a-Judge

FairJudge: 一种自适应、去偏且一致的LLM作为评判者

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Xiao Xu, Shijian Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)

专题命中 评测与基准 :LLM(title,title_cn);SFT(summary_cn,abstract);分类 cs.CL

AI总结 针对LLM评判系统在适应性、偏见和一致性上的局限,提出FairJudge,通过可学习正则化策略和课程式SFT-DPO-GRPO训练范式,实现自适应、去偏和一致评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31639 2026-07-01 cs.CR cs.AI cs.GT cs.LO 新提交 92%

A Lifecycle and Application-Stack Survey of Large Language Model Vulnerabilities: Attacks, Risks, Defenses, and Open Problems

大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题

Seyed Bagher Hashemi Natanzi, Bo Tang

机构 * Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31307 2026-07-01 cs.CL 新提交 92%

When the Database Fails: Prompting LLM Dialogue Agents for Safe Recovery in Task-Oriented Dialogue

当数据库失败时:提示LLM对话代理在任务导向对话中安全恢复

Mohammad Alijanpour Shalmani, Alale Rezvani Boroujeni, Jiann Shiun Yuan

机构 * College of Engineering and Computer Science, University of Central Florida(中佛罗里达大学工程与计算机科学学院) Department of Marketing, University of Central Florida(中佛罗里达大学市场营销系)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对任务导向对话中后端数据库失败导致LLM产生不安全响应的问题,提出基于提示的轻量级恢复策略,无需重训练即可将幻觉率降低42-50%。

Comments Accepted at SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07385 2026-07-01 cs.CL cs.AI 版本更新 92%

SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

SAGE:面向自由形式问答的大语言模型的搜索增强评估

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SAGE框架,通过主动检索和综合外部证据评估LLM输出的事实性,无需固定参考答案,在多个自由问答基准上实现与人类评估的高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31371 2026-07-01 cs.LG cs.AI cs.CL 新提交 92%

Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

校准评估器:概率校准能否缓解LLM智能体反馈回路中的偏好耦合?

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过概率校准评估器的成对判断来缓解LLM智能体反馈回路中的偏好耦合,实验表明校准将耦合系数降低20-49%,JS散度降低45-67%。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11354 2026-07-01 cs.AI cs.CL 版本更新 92%

ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences

ReplicatorBench:用于社会科学和行为科学中可复制性评估的LLM代理基准测试

Bang Nguyen, Dominik Soós, Qian Ma, Rochana R. Obadage, Zack Ranjan, Sai Koneru, Timothy M. Errington, Shakhlo Nematova, Sarah Rajtmajer, Jian Wu, Meng Jiang

机构 * University of Notre Dame(圣母大学) Old Dominion University(老道明大学) Pennsylvania State University(宾夕法尼亚州立大学) Independent Researcher(独立研究员) Uppsala University(乌普萨拉大学) Center for Open Science(开放科学中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReplicatorBench,一个端到端的基准测试,用于评估AI代理在可复制性研究中的能力,涵盖数据提取、实验设计与结果解释三个阶段,并开发了ReplicatorAgent框架以评估不同LLM和编程语言的性能。

Comments Accepted to KDD 2026 AI4Sciences Track, Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31608 2026-07-01 cs.CL 新提交 92%

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

CLExEval: 一种用于定性评估LLM临床推理的人机协同框架

Ajmal M., Abin Roy, Afthab Salam Kanniyan, Jawadh Abdul Kabeer, Jerin James, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) IIT Madras(印度理工学院马德拉斯分校) Calicut Medical College(卡利卡特医学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CLExEval框架,通过渐进信息遮蔽和专家注释,揭示LLM临床推理中的冗长偏差、隐藏知识悖论和推理-输出不匹配问题,并验证了LLM作为评判者的局限性。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14732 2026-07-01 physics.ed-ph cs.CL 版本更新 92%

LLM-as-a-judge validity in physics assessment depends more on the task than the model

LLM作为评判者在物理评估中的有效性更取决于任务而非模型

Will Yeadon, Tom Hardy, Paul Mackay, Elise Agra

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究评估LLM在不同物理评估格式(结构化问题、论文、科学图表)中的评分有效性,发现任务类型对评分准确性和排序一致性影响显著,而非模型能力。

Comments 29 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01023 2026-07-01 cs.SE 91%

Large Language Model Evaluation Via Multi AI Agents: Preliminary results

通过多AI代理评估大型语言模型:初步结果

Zeeshan Rasheed, Muhammad Waseem, Kari Systä, Pekka Abrahamsson

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文提出多AI代理模型评估不同LLM性能,通过代码检索与验证,初步结果显示GPT-3.5 Turbo表现更优,未来将引入MBPP基准提升评估精度。

Comments 10 pages, 1 figure

Journal ref ICLR 2024 Workshop on Large Language Model (LLM) Agents, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31718 2026-07-01 cs.CL cs.AI 新提交 91%

Cross-lingual Relation Extraction with Large Language Models: Zero-Shot, Few-Shot, and Fine-Tuned Evaluation on Romanian

跨语言关系抽取与大语言模型:罗马尼亚语的零样本、少样本和微调评估

Dragos-Mitrut Vasile, Elena-Simona Apostol, Stefan-Adrian Toma, Adrian Paschke, Ciprian-Octavian Truica

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 通过自动翻译数据集结合大语言模型推理,研究罗马尼亚语的跨语言关系抽取,评估Gemma 4 31B在零样本、少样本和QLoRA微调下的性能,并与四种编码器基线对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31250 2026-07-01 cs.CL cs.AI 新提交 91%

Probing Stylistic Appropriation using Large Language Models: An Evaluation Framework for Copyright Infringement under EU Law

使用大语言模型探测风格挪用:欧盟法律下版权侵权的评估框架

Noah Scharrenberg, Chang Sun

机构 * Maastricht University(马斯特里赫特大学) Contractuo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PSALM框架,通过十个评估器将欧盟版权法标准操作化,发现指令调优模型在接触语料前已有非平凡风格相似性,微调导致系统性风格挪用,负偏好优化可降低但残留可检测风格模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31308 2026-07-01 cs.AI 新提交 90%

Benchmarking Large Language Models on Floating-Point Error Classification

大型语言模型在浮点错误分类上的基准测试

Lisa Taldir, Muhammad Ahmad Saeed, David Defour, Pablo de Oliveira Castro, Eric Petit

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI

AI总结 本文提出InterFLOPBench基准,评估14个LLM在六类浮点错误上的静态检测性能,最新模型整体F1超过0.88。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30931 2026-07-01 cs.AI cs.LG cs.MA math.OC math.PR 新提交 90%

RoPoLL: Robust Panel of LLM Judges

RoPoLL: 鲁棒的LLM评审团

Anish Acharya, Kris W Pan, Brian Verkhovsky

机构 * Amazon Web Services(亚马逊云服务)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对LLM评审团在污染数据下偏差无界的问题,提出RoPoLL,用几何中位数聚合替代均值,实现最优鲁棒性,在多种偏差攻击下显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28183 2026-07-01 cs.CL cs.AI 版本更新 90%

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

BenGER:德国法律中基于归入的法律推理的LLM系统基准测试

Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas, Matthias Grabmair

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Ludwig Maximilian University of Munich (LMU)(慕尼黑路德维希-马克西米利安大学) University of Konstanz(康斯坦茨大学) University of Saarbrücken(萨尔布吕肯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出BenGER数据集,用于评估LLM系统在德国法律归入推理中的表现,通过自动和基于法官的指标比较12个LLM系统与人类基线。

Comments Pre-Print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31039 2026-07-01 cs.CL 新提交 90%

Truth or Sophistry? LoFa: A Benchmark for LLM Robustness Against Logical Fallacies

真相还是诡辩?LoFa:大语言模型对逻辑谬误鲁棒性的基准测试

Xudong Shen, Li Yuan, Ye Chen, Xin Wu, Yi Cai, Zhiyong Wu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) South China University of Technology(华南理工大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LoFa基准,通过多智能体管道生成事实与谬误配对,结合多轮辩论框架评估LLM对逻辑谬误的鲁棒性,并设计LFR@k指标量化抵抗能力。

Comments Accepted to ACL 2026 Main. 33 pages (9 pages main text)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32034 2026-07-01 cs.LG cs.AI cs.CL 新提交 89%

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

QVal:廉价评估长周期LLM智能体的密集监督信号

Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina, Joschka Strüber, Ameya Prabhu, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出QVal,一种无需训练的基准测试,通过Q值对齐直接评估密集监督信号质量,避免下游训练开销。在21种方法、4个环境上的实验表明,简单提示基线优于现有方法。

Comments 10 pages, 5 figures in main text; 48 pages, 6 figures with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31614 2026-07-01 eess.SY cs.AI cs.SY 新提交 89%

Automating Cause-Effect Specification with Knowledge Graphs and Large Language Models

利用知识图谱和大语言模型自动化因果规范生成

Javal Vyas, Milapji Singh Gill, Mehmet Mercangöz

机构 * Autonomous Industrial Systems Lab, Imperial College London(帝国理工学院自主工业系统实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 提出一种语义AI框架,结合知识图谱与约束大语言模型,自动生成因果逻辑和操作安全叙述,减少手动工作。

详情

展开后加载摘要…

URL PDF HTML 收藏