arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-24 至 2026-04-24 共收录 178 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2507.04023 2026-04-24 cs.CL 83%

Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models

大语言模型是否会过度思考基础数学推理?评估语言模型中准确性与效率的权衡

Gaurav Srivastava, Aafiya Hussain, Sriram Srinivasan, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系,布莱克斯堡,VA,美国)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出LLMThinkBench基准测试,评估语言模型在准确性与过度思考之间的权衡,发现模型在复杂基准上的表现不直接转化为基础数学推理能力,且过度思考导致效率下降。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20994 2026-04-24 cs.CR cs.AI cs.CL 82%

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

打破MCP:函数劫持攻击:函数调用和代理模型的新威胁

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院都柏林) Imperial College London(帝国理工学院伦敦) ADAPT Research Centre(ADAPT研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21420 2026-04-24 cs.AI 81%

FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation

FairQE:缓解翻译质量评估中性别偏见的多智能体框架

Jinhee Jang, Juhwan Choi, Dongjin Lee, Seunguk Yu, Youngbin Kim

机构 * Chung-Ang University(Chung-Ang 大学) AITRICS

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 FairQE通过多智能体机制检测性别线索并生成性别翻转翻译变体,结合传统QE评分与LLM偏见缓解推理,提升翻译质量评估的性别公平性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21354 2026-04-24 cs.LG 81%

Decoupled Travel Planning with Behavior Forest

解耦行为森林中的旅行计划

Duanyang Yuan, Sihang Zhou, Yanning Hou, Xiaoshu Chen, Haoyuan Chen, Ke Liang, Jiyuan Liu, Chuan Ma, Xinwang Liu, Jian Huang

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) College of Computer Science, Chongqing University(计算机科学学院,重庆大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出行为森林方法,通过解耦复杂任务和约束到可管理的子空间,提升大语言模型在多约束旅行计划中的性能,实验表明在TravelPlanner和ChinaTravel基准上分别优于现有方法6.67%和11.82%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21523 2026-04-24 cs.CV cs.CL 79%

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

看到并不等于相信:揭示评估者视觉-语言模型的盲区

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) BITS Pilani, Hyderabad(海得拉巴 BITS学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11066 2026-04-24 math.DS cs.AI cs.HC 79%

Exploring Collatz Dynamics with Human-LLM Collaboration

通过人类-大语言模型协作探索科拉兹动力学

Edward Y. Chang

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过1014次计算实验,系统分析科拉兹猜想,利用29种数学方法揭示分布收敛到点收敛的不可还原障碍,证明了科拉兹猜想难以证明的本质原因。

Comments 233 pages, 11 figures, 52 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21253 2026-04-24 cs.CL cs.AI 79%

Planning Beyond Text: Graph-based Reasoning for Complex Narrative Generation

超越文本的规划:基于图的复杂叙事生成推理

Hanwen Gu, Chao Guo, Junle Wang, Wenda Xie, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Turing Lab(腾讯人工智能实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出PLOTTER框架,通过结构图进行叙事规划,提升LLM在复杂叙事生成中的长上下文推理能力。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21327 2026-04-24 cs.LG cs.AI cs.CL 75%

Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

理解并缓解测试时间强化学习在数学推理中的虚假信号放大

Yongcan Yu, Lingxiao He, Jian Liang, Kuangpu Guo, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR与MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时间强化学习在数学推理中因标签噪声导致的虚假信号放大问题,提出DDRL框架通过频率采样、去偏优势估计和共识-off-policy优化来缓解该问题,实验表明其优于现有基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12721 2026-04-24 cs.AI cs.CL cs.LG stat.ML 75%

Strategic Scaling of Test-Time Compute: A Bandit Learning Approach

测试时计算的战略扩展:一种多臂学习方法

Bowen Zuo, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多臂学习方法,通过动态分配计算资源提升大语言模型性能,针对不同查询难度优化计算分配,实验表明在多个基准数据集上显著提升性能。

Comments To appear at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21357 2026-04-24 cs.AI cs.CL 73%

ReaGeo: Reasoning-Enhanced End-to-End Geocoding with LLMs

ReaGeo:基于大语言模型的推理增强端到端地名编码

Jian Cui, Zhiyuan Ren, Desheng Weng, Yongqi Zhao, Gong Wenbin, Yu Lei, Zhenning Dong

机构 * Amap, Alibaba Group(阿里巴巴集团阿地图) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReaGeo利用大语言模型解决传统多阶段方法在地理数据库中依赖文本或向量相似性检索的局限性,通过将坐标转换为geohash序列,引入链式推理机制提升空间关系推理能力,并通过距离偏差奖励的强化学习优化生成精度。

Comments 12 pages, 8 figures, submitted to ACM SIGSPATIAL 2024 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21346 2026-04-24 cs.AI cs.CL cs.CV 73%

Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning

符号 grounding 揭示了抽象视觉推理中的表征瓶颈

Mohit Vaishnav, Tanel Tammet

机构 * Applied Artificial Intelligence Group, Tallinn University of Technology, Estonia(塔林技术大学应用人工智能小组,爱沙尼亚) Kimova AI, Tallinn, Estonia(Kimova AI,塔林,爱沙尼亚)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过Bongard-LOGO基准测试,发现符号输入能显著提升抽象视觉推理性能,揭示了表征能力是核心瓶颈。

Journal ref 30th Conference on Computational Natural Language Learning (CoNLL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21593 2026-04-24 cs.CL 70%

Language as a Latent Variable for Reasoning Optimization

语言作为潜在变量用于推理优化

Linjuan Wu, Haoran Wei, Jialong Tang, Shuang Luo, Baosong Yang, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究探讨语言作为潜在变量对推理性能的影响,提出polyGRPO框架通过多语言数据优化模型,提升推理准确率和跨任务泛化能力。

Comments 17 pages, 7 figures, Under Reviewing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21282 2026-04-24 cs.CR cs.LG cs.SE 70%

Strategic Heterogeneous Multi-Agent Architecture for Cost-Effective Code Vulnerability Detection

战略异构多智能体架构用于高效代码漏洞检测

Zhaohui Geoffrey Wang

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种基于博弈论的异构多智能体架构,结合云上大语言模型专家与本地轻量验证器,通过三重专家并行分析与对抗验证,实现高效且高精度的代码漏洞检测,实验显示其在精度和召回率上均优于现有方法。

Comments 11 pages, 5 figures. Accepted at the AAMAS 2026 Workshop on Software Engineering (SE Workshop). This version corresponds to the preprint of the workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21092 2026-04-24 cs.AI cs.SE 70%

Mind the Prompt: Self-adaptive Generation of Task Plan Explanations via LLMs

注意提示:通过LLMs实现自我适应的任务计划解释生成

Gricel Vázquez, Alexandros Evangelidis, Sepeedeh Shahbeigi, Radu Calinescu, Simos Gerasimou

机构 * University of York, UK(英国约克大学) Cyprus University of Technology, Cyprus(塞浦路斯技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出COMPASS方法,通过将提示工程建模为认知和概率决策过程,实现复杂任务规划系统中自适应的解释生成和提示优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20860 2026-04-24 cs.IR cs.AI 70%

RealRoute: Dynamic Query Routing System via Retrieve-then-Verify Paradigm

RealRoute:通过检索-验证范式实现动态查询路由系统

Jiahe Liu, Qinkai Yu, Jingcheng Niu, Xi Zhu, Zirui He, Zhen Xiang, Fan Yang, Jinman Zhao

机构 * Technical University of Denmark(技术大学) University of Exeter(埃克塞特大学) University of Toronto(多伦多大学) Rutgers University(罗格斯大学) NJIT(新 jersey 工业技术学院) University of Georgia(佐治亚大学) Wake Forest University(威克森林大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 RealRoute引入一种鲁棒的检索-验证机制,通过并行源无关检索和动态验证器确保证据完整性,优于预测基线,在多跳RAG推理任务中表现更佳。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15468 2026-04-24 cs.SE cs.AI 70%

The Semi-Executable Stack: Agentic Software Engineering and the Expanding Scope of SE

半可执行堆栈:智能软件工程与SE范围的扩展

Robert Feldt, Per Lenberg, Julian Frattini, Dhasarathy Parthasarathy

机构 * Chalmers University of Technology(挑战者技术大学) Volvo Group(沃尔沃集团)

专题命中 推理与问题求解 :LLM(abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 本文探讨了软件工程领域因AI系统发展而扩展的范围,提出半可执行堆栈模型以分析可执行代码与非可执行 artifacts 的结合,通过三个案例研究重新定义工程目标,提供保留与净化的决策框架。

Comments This paper is the write-up of Robert Feldt's keynote "Agentic Software Engineering Will Eat the World: AI-Based Systems as the New Operating System of Society'' given at the Agentic Engineering 2026 workshop, Rio de Janeiro, Brazil, April 14, 2026. April 23 upload fixed the reference list to be more complete, and added a few additional citations; text essentially unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11569 2026-04-24 cs.AI 70%

SemaPop: Semantic-Persona Conditioned and Controllable Population Synthesis

SemaPop:基于语义-人设的可控人口合成

Zhenlin Qin, Yancheng Ling, Leizhen Wang, Francisco Câmara Pereira, Zhenliang Ma

机构 * Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑系,皇家理工学院) Digital Future, KTH Royal Institute of Technology(数字未来,皇家理工学院) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Department of Technology, Management and Economics, Technical University of Denmark(技术、管理与经济学系,丹麦技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SemaPop通过引入人设表示作为生成条件,实现可控的人口合成,提升生成性能并保持统计一致性与样本多样性。

Comments Submitted to Transportation Research Part C: Emerging Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21461 2026-04-24 cs.CV cs.HC 67%

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21455 2026-04-24 cs.HC 67%

The Privacy Guardian Agent: Towards Trustworthy AI Privacy Agents

隐私守护代理:迈向可信AI隐私代理

Vincent Freiberger

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出隐私守护代理,通过用户资料和上下文感知自动化隐私同意选择,同时在不确定或高风险情况时通知用户,确保透明和用户自主权。

Comments Position paper for the CHI26 Workshop "Moving Beyond Clicks: Rethinking Consent and User Control in the Age of AI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21409 2026-04-24 cs.CV 67%

S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images

S1-VL:具有图像思维的科学多模态推理模型

Qingxiao Li, Lifeng Xu, QingLi Wang, Yudong Bai, Mingwei Ou, Shu Hu, Nan Xu

机构 * ScienceOne AI

专题命中 推理与问题求解 :SFT(abstract,abstract_cn)

AI总结 S1-VL是一种支持科学推理和图像思维的多模态模型,通过Python代码执行图像处理,提升科学图表、显微图像和几何推理等复杂场景的性能。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21249 2026-04-24 cs.RO 67%

Reasoning About Traversability: Language-Guided Off-Road 3D Trajectory Planning

轨迹可 traversability 的推理:语言引导的越野3D轨迹规划

Byounggun Park, Soonmin Hwang

机构 * Department of Automotive Engineering, Hanyang University, Seoul, Republic of Korea(韩雅大学汽车工程系,首尔,大韩民国)

专题命中 推理与问题求解 :language model(abstract);preference optimization(abstract)

AI总结 本文提出语言精修框架与偏好优化策略,通过动作对齐监督和地形感知优化,提升越野3D轨迹规划的合规性与地形一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05320 2026-04-24 cs.RO 67%

ExpressMM: Expressive Mobile Manipulation Behaviors in Human-Robot Interactions

ExpressMM: 人机交互中的表达性移动 manipulation 行为

Souren Pashangpour, Haitong Wang, Matthew Lisondra, Goldie Nejat

机构 * Autonomous Systems and Biomechatronics Laboratory(自主系统与生物机械实验室) Department of Mechanical and Engineering(机械与工程系) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出ExpressMM框架,结合视觉语言模型和低层策略生成表达性机器人行为,支持中断交互,提升人机协作任务中的沟通效果与社会适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15096 2026-04-24 cs.AI cs.LG 62%

OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data

OpenEstimate:评估语言模型在不确定性下的推理能力实现实验

Alana Renda, Jillian Ross, Michael Cafarella, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OpenEstimate基准测试,用于评估语言模型在不确定环境下进行数值估计的能力,发现模型的先验概率常不准确且过度自信,但通过改进不确定性引导方式可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 50%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 35 篇

2510.15313 2026-04-24 cs.CL 92%

Capabilities and Evaluation Biases of Large Language Models in Classical Chinese Poetry Generation: A Case Study on Tang Poetry

大型语言模型在古典汉语诗歌生成中的能力与评估偏差:以唐诗为例

Bolei Ma, Yina Yao, Anna-Carolina Haensch

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过三步评估框架,分析了六个先进LLM在唐诗生成中的表现,揭示了LLM在模仿统计模式时对机器生成诗歌的系统性高估问题,强调了需要混合人类-模型验证框架的重要性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21505 2026-04-24 cs.SE 91%

Assessing the Impact of Requirement Ambiguity on LLM-based Function-Level Code Generation

评估需求模糊性对基于LLM的函数级代码生成的影响

Di Yang, Xinou Xie, Xiuwen Yang, Ming Hu, Yihao Huang, Yueling Zhang, Weikai Miao, Ting Su, Chengcheng Wan, Geguang Pu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Orchid基准,评估需求模糊性对LLM代码生成的影响,发现模糊性显著降低模型性能,且高阶模型受影响更严重,揭示了明确与模糊需求之间的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21377 2026-04-24 cs.RO cs.HC 91%

A Replicable Robotics Awareness Method Using LLM-Enabled Robotics Interaction: Evidence from a Corporate Challenge

一种利用LLM增强的机器人交互方法进行可复制的机器人意识:来自企业挑战的证据

S. A. Prieto, M. A. Gopee, Y. Ben Arab, B. García de Soto, J. Esteba, P. Olivera Brizzio

机构 * KINESIS Core Technology Platform, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校KINESIS核心科技平台) S.M.A.R.T. Construction Research Group, Division of Engineering, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校S.M.A.R.T.建筑研究小组) AD Ports Group, Corporate Innovation Department(AD Ports集团企业创新部)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于挑战的机器人意识方法,通过LLM增强的人形机器人与阿德港集团员工的互动,展示了在工业环境中提升机器人意识的可行性与可复制性。

Comments 10 pages, 8 Figures, to be submitted for journal per-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20677 2026-04-24 cs.CL 90%

Intersectional Fairness in Large Language Models

大语言模型中的交叉公平性

Chaima Boufaied, Ronnie De Souza Santos, Ann Barcomb

机构 * University of Calgary(卡尔加里大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文评估了六个大语言模型在交叉人口属性上的公平性,发现模型在模糊情境中表现良好,但在解歧情境中受刻板印象影响,且跨群体结果分布不均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20726 2026-04-24 cs.CL cs.AI 90%

Exploiting LLM-as-a-Judge Disposition on Free Text Legal QA via Prompt Optimization

通过提示优化利用LLM-as-a-Judge在自由文本法律问答中的处置

Mohamed Hesham Elganayni, Runsheng Chen, Sebastian Nagl, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文研究提示设计和法官选择在LLM-as-a-Judge评估自由文本法律问答中的作用,通过ProTeGi方法优化提示,发现自动优化优于人类设计,宽松反馈的提示在严格法官间转移更有效。

Comments Accepted at the 21st International Conference on Artificial Intelligence and Law (ICAIL 2026), Singapore, June 8-12, 2026. 10 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21308 2026-04-24 cs.CR cs.CL 90%

CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents

CI-Work: 企业LLM代理中情境完整性基准测试

Wenjie Fu, Xiaoting Qin, Jue Zhang, Qingwei Lin, Lukas Wutschitz, Robert Sim, Saravan Rajmohan, Dongmei Zhang

机构 * Huazhong University of Science and Technology(华中科技大学) Microsoft(微软)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 CI-Work基准测试评估企业LLM代理在密集检索中传达关键内容并隐藏敏感信息的能力,揭示隐私泄露普遍且高任务效用与隐私违规正相关,需转向以情境为中心的架构。

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL'2026) -- Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏