arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3016 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 3016 篇

cs/0307069 2009-12-01 cs.AI cs.LO 74%

A logic for reasoning about upper probabilities

Joseph Y. Halpern, Riccardo Pucella

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

Comments A preliminary version of this paper appeared in Proc. of the 17th Conference on Uncertainty in AI, 2001

Journal ref Journal of AI Research 17, 2001, pp. 57-81

详情

展开后加载摘要…

URL PDF HTML 收藏
cs/0208033 2009-11-30 cs.LO cs.AI 74%

Complete Axiomatizations for Reasoning About Knowledge and Time

Joseph Y. Halpern, Ron van der Meyden, Moshe Y. Vardi

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

Comments To appear, SIAM Journal on Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12426 2026-08-14 cs.AI cs.CL 新提交 73%

Large Language Models Can Follow Instructions, But Not Many at Once: Phase Transitions in Compositional Constraint Satisfaction

大语言模型能遵循指令,但无法同时遵循太多:组合约束满足中的相变

Mariya I. Vasileva

机构 * Meta Superintelligence Labs(元超级智能实验室)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出约束饱和评估基准,发现大语言模型在同时遵循5-6个以上指令约束时可靠性崩溃,不同类型约束的性能下降幅度存在差异,失败呈近独立的乘法累积效应。

Comments 35 pages, 7 figures, 13 tables. Reviewed in the ARR May 2026 cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09217 2026-08-11 cs.LG cs.AI 新提交 73%

Beyond Solvability: Task Learnability as a Static Prior for LLM RL Post-Training

超越可解性:任务可学习性作为大语言模型强化学习后训练的静态先验

Ting Zhou, Zhenqing Ling, Daoyuan Chen, Qianli Shen, Yilun Huang, Ying Shen, Yaliang Li

机构 * Sun Yat-Sen University(中山大学) Alibaba Group(阿里巴巴集团)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TrajVal估计任务可学习性,将其作为静态先验用于LLM的RL后训练任务采样,可提升数据效率并与在线调度方法互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03374 2026-08-11 cs.CL cs.AI 版本更新 73%

CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge

CresOWLve:基于现实世界知识的创造性问题解决基准测试

Mete Ismayilzada, Renqing Cuomao, Daniil Yurshevich, Anna Sotnikova, Lonneke van der Plas, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院洛桑) Università della Svizzera italiana (USI)(意大利语区瑞士大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CresOWLve基准测试,评估创造性问题解决能力,通过现实世界知识中的谜题,发现模型在事实性问题与创造性问题上的表现差异显著。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27405 2026-08-05 cs.CL cs.AI 版本更新 73%

Benchmarking LLM Competence on Logical Inference over Probability Operators

基于概率算子的逻辑推理能力大语言模型基准测试

Nayera Hasan, Jack Greff, Alvin Grissom

机构 * Haverford College(哈维福德学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究构建含14320个提示的概率算子推理基准,评估29个大语言模型,发现多数模型存在答案偏差,仅9个超随机水平,且各维度均有偏差。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20456 2026-07-24 cs.CL cs.AI 新提交 73%

Learn2Zinc: Fine-tuning Small Language Models for Text-to-Model Translation in MiniZinc

Learn2Zinc:微调小型语言模型以实现MiniZinc中的文本到模型翻译

Serdar Kadioglu, Karthik Uppuluri

机构 * AI Center of Excellence, Fidelity Investments(富达投资卓越人工智能中心) Department of Computer Science, Brown University(布朗大学计算机科学系)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究针对小型语言模型在MiniZinc文本到模型翻译的难题,提出跨模型错误引导方法,收集语法错误构建训练数据集微调模型,提升执行准确率至98%,虽语法可学但约束推理仍具挑战,且开源相关资源供后续研究。

Comments CP 2026 Workshop on LLMs meet Constraint Solving

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15783 2026-07-21 cs.AI cs.LG 版本更新 73%

Towards AI epidemiology: a measurement standardisation framework for prospective risk detection

迈向人工智能流行病学:一种用于前瞻性风险检测的测量标准化框架

Kit Tempest-Walters

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种测量标准化框架,用于在没有访问模型内部信息的情况下,将专家-人工智能交互压缩为结构化、可比较的领域,以进行前瞻性风险检测。该框架旨在定义其范围,包括语义和统计层面,并指定未来工作的实证测试协议。

Comments 38 pages, 3 figures, 4 tables. Accepted for publication in AI & Society

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14528 2026-07-17 cs.CL cs.AI 新提交 73%

Controlled Reformulation Testing for Logical Consistency in Large Language Models

大语言模型中逻辑一致性的可控重新表述测试

Alexander Gu, Alan Chen

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在逻辑等价问题表面形式改变时的逻辑一致性,提出CRTBench基准,评估多个前沿LLMs,发现存在准确率 - 一致性差距,揭示失败集中在逻辑非平凡变换,表明仅靠准确率无法评估LLMs的逻辑推理。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14349 2026-07-17 cs.CL cs.AI 新提交 73%

HABIB_TAZ at SemEval-2026 Task 11: Disentangling Formal Logic from Content via Synthetic Training and Multi-Objective Optimization

HABIB_TAZ参加SemEval-2026任务11:通过合成训练和多目标优化从内容中分离形式逻辑

Abdullah Shaikh, Zain Naqi, Taha Zahid, Sandesh Kumar, Abdul Samad

机构 * Dhanani School of Science & Engineering Habib University(哈比卜大学达纳尼科学与工程学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对SemEval-2026任务11,用基于三段论合成数据集微调的mDeBERTa-v3网络,结合多目标损失函数应对大语言模型形式推理受内容影响的问题,在多个子任务中取得优异成绩,还公开了数据集生成引擎和代码库。

Journal ref Proceedings of the 20th International Workshop on Semantic Evaluation (2026), pp. 1006-1014 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14499 2026-07-14 cs.AI cs.LG 版本更新 73%

Measuring AI Ability to Complete Long Software Tasks

衡量AI完成长期软件任务的能力

Thomas Kwa, Ben West, Joel Becker, Amy Deng, Katharyn Garcia, Max Hasin, Sami Jawhar, Megan Kinniment, Nate Rush, Sydney Von Arx, Ryan Bloom, Thomas Broadley, Haoxing Du, Brian Goodrich, Nikola Jurkovic, Luke Harold Miles, Seraphina Nix, Tao Lin, Chris Painter, Neev Parikh, David Rein, Lucas Jun Koba Sato, Hjalmar Wijk, Daniel M. Ziegler, Elizabeth Barnes, Lawrence Chan

机构 * Model Evaluation & Threat Research (METR)(模型评估与威胁研究(METR)) Ohm Chip Anthropic

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出50%任务完成时间跨度指标,用于衡量AI在完成长期软件任务方面的能力,结果显示AI模型的时间跨度呈指数增长,预计5年后将能自动化许多人类月度完成的软件任务。

Comments v4: added Chris Painter as listed author, consistent with listing in the pdf

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02802 2026-07-07 cs.CL cs.AI 新提交 73%

Seduced by the Narrative: Assessing Rule Adherence in Semi-Open Textual Sandboxes

被叙事诱惑:评估半开放文本沙盒中的规则遵守情况

Weiying Chen, Junlong Shen, Zhanyuan Guo, Xiaoou Zhou

机构 * University of Alberta(阿尔伯塔大学) Qilu University of Technology(齐鲁工业大学) N-Dice Association(N-Dice协会)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究在半开放文本游戏环境中,当用户意图与系统规则冲突时大语言模型的规则遵守问题。基于桌面角色扮演游戏机制构建多智能体对抗基准CoC-Seduce,用前沿模型生成样本,对20个目标裁决器进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01595 2026-07-03 cs.AI cs.CL 新提交 73%

Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model

安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划

Junyan Tan, Haoran Lin, Siyuan Guo, Yichen Fang, Xinyue Luo, Tianyu Shen, Zeyu Qiao

机构 * Zhejiang University(浙江大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20091 2026-07-03 cs.CL cs.AI 版本更新 73%

CreativityPrism: A Cross-Domain Evaluation Framework for Large Language Model Creativity

CreativityPrism:大语言模型创造力的跨域评估框架

Zhaoyi Joey Hou, Bowei Alvin Zhang, Yining Lu, Bhiman Kumar Baghel, Anneliese Brei, Ximing Lu, Meng Jiang, Faeze Brahman, Snigdha Chaturvedi, Haw-Shiuan Chang, Daniel Khashabi, Xiang Lorraine Li

机构 * University of Pittsburgh(匹兹堡大学) Johns Hopkins University(约翰霍普金斯大学) University of Notre Dame(诺特丹大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CreativityPrism框架,整合发散思维、创意写作和逻辑推理三个领域的八项任务,从质量、新颖性和多样性三个维度评估LLM创造力,发现前沿模型在创意写作和逻辑推理上领先,但在发散思维上无显著优势,且各维度间相关性弱。

Comments Published in Transactions on Machine Learning Research (06/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01623 2026-07-03 cs.AI cs.LG 版本更新 73%

MAGIK: Mapping to Analogous Goals via Imagination-enabled Knowledge Transfer

MAGIK: 通过想象力驱动的知识迁移映射到类比目标

Ajsal Shereef Palattuparambil, Thommen George Karimpanal, Santu Rana

机构 * Applied Artificial Intelligence Initiative, Deakin University School of IT, Deakin University(应用人工智能倡议,德克萨斯大学IT学院,德克萨斯大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出MAGIK框架,利用想象力机制将目标任务实体映射到源域类比物,实现零样本知识迁移,在MiniGrid和MuJoCo任务上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20560 2026-06-19 cs.LG cs.AI 新提交 73%

How Transparent is DiffusionGemma?

DiffusionGemma 的透明度如何?

Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda

机构 * Google(谷歌)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究DiffusionGemma在连续潜空间中的推理透明度,通过变量透明度和算法透明度分解,发现可解释的令牌瓶颈将不透明串行深度降至Gemma 4的1.1倍,并揭示扩散特有现象。

Comments 20 main text pages and 6 pages of references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09737 2026-06-15 cs.LG cs.AI 版本更新 73%

STaR-DRO: Stateful Tsallis Reweighting for Group-Robust Structured Prediction

STaR-DRO: 面向群体鲁棒结构化预测的状态化Tsallis重加权

Samah Fodeh, Ganesh Puthiaraju, Elyas Irankhah, Afshan Khan, Sreeraj Ramachandran, Linhai Ma, Srivani Talakokkul, Sarah Schellhorn

机构 * Yale University(耶鲁大学) Yale School of Medicine(耶鲁医学院)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出STaR-DRO框架,结合Tsallis镜像上升和稀疏entmax映射,仅对持续困难群体上权重,在结构化预测中提升标签准确性和鲁棒性,在EPPC Miner任务上相比SFT和标准DRO分别提升F1分数1.08和2.20。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11709 2026-06-11 cs.LG cs.CL 新提交 73%

RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation

RLCSD: 基于对比策略自蒸馏的强化学习

Leyi Pan, Shuchang Tao, Yunpeng Zhai, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Peking University(北京大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

AI总结 针对策略自蒸馏中特权诱导的风格漂移问题,提出RLCSD方法,通过对比正确与错误提示下的师生差距来抑制风格偏移,提升推理模型在数学和逻辑推理任务上的性能。

Comments 20 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01182 2026-06-02 cs.CL cs.AI 73%

CA-BED: Conversation-Aware Bayesian Experimental Design

CA-BED:对话感知的贝叶斯实验设计

Daniel Arnould, Rashad Aziz, Zixuan Kang, Tanav Changal, Kevin Zhu, Sunishchal Dev, Gabriel Grand, Shreyas Sunil Kulkarni

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) University of Toronto(多伦多大学)

专题命中 逻辑推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 提出对话感知的贝叶斯实验设计(CA-BED),一种推理时概率对话规划框架,通过结合贝叶斯实验设计与LLM似然估计,在多个对话轮次中优化问题选择,在结构化实体推断基准上平均成功率提升21.8%,仅增加1.8轮对话。

Comments Reliable Autonomy Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28707 2026-05-28 cs.AI cs.LG 73%

Beyond Binary Moral Judgment: Modeling Ethical Pluralism in AI

超越二元道德判断:在AI中建模伦理多元主义

Aisha Aijaz, Rahul Goel, Arnav Batra, Raghava Mutharaju

机构 * Department of Computer Science and Engineering, IIIT Delhi(印度德里理工学院计算机科学与工程系) Mehta Family School of Data Science and AI, IIT Palakkad(印度帕拉卡德理工学院梅塔家庭数据科学与人工智能学院)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出将道德推理建模为规范性伦理理论分布(伦理多元主义)的框架,通过规范-语义双流架构和堆叠集成学习实现,在450个案例上达到88.89%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04868 2026-05-27 cs.CL cs.AI 73%

SEAL: Self-Evolving Agentic Learning for Conversational Question Answering over Knowledge Graphs

SEAL: 面向知识图谱对话问答的自我演进智能体学习

Hao Wang, Jialun Zhong, Changcheng Wang, Zhujun Nie, Zheng Li, Shunyu Yao, Yanzeng Li, Xinchi Li

机构 * Institute of Big Data and Artificial Intelligence, China Telecom Research Institute(大数据与人工智能研究院,中国电信研究院) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) School of Artificial Intelligence, China University of Geosciences (Beijing)(人工智能学院,中国地质大学(北京)) Center for Cognition and Neuroergonomics, State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(认知与神经工效学中心,认知神经科学与学习国家重点实验室,北京师范大学) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(人工智能与未来网络研究院,北京师范大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出SEAL两阶段语义解析框架,通过自我演进智能体学习解决知识图谱对话问答中的指代消解、上下文依赖和复杂逻辑推理问题,在SPICE基准上达到最先进性能。

Comments Accept by NeuroComputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14479 2026-05-26 cs.AI cs.CL 73%

A Neuro-Symbolic Approach for Reliable Proof Generation with LLMs: A Case Study in Euclidean Geometry

一种用于LLM可靠证明生成的神经符号方法:以欧几里得几何为例

Oren Sultan, Eitan Stern, Dafna Shahaf

机构 * The Hebrew University of Jerusalem(特拉维夫大学)

专题命中 逻辑推理 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出一种结合LLM生成能力与结构化组件的神经符号方法,通过类比问题检索和形式验证器反馈,显著提升欧几里得几何证明的准确性。

Comments long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20189 2026-05-21 cs.AI cs.LG 73%

SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation

SOLAR:一种自优化的开放式自主代理,用于终身学习和持续适应

Nitin Vetcha, Dianbo Liu

机构 * Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore, Singapore(眼科学系,Yong Loo Lin医学院,新加坡国立大学,新加坡) Department of Computational and Data Sciences, Indian Institute of Science, Bangalore, Karnataka, India(计算与数据科学系,印度科学研究院,班加罗尔,卡纳塔克邦,印度)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOLAR,一种自优化的开放式自主代理,通过参数级元学习实现自我改进,解决了动态真实世界中概念漂移和梯度基适应成本高的问题,展示了在常识、数学、医学、编程、社交和逻辑推理任务上的优越性能。

Comments Accepted at "Association for the Advancement of Artificial Intelligence 2026 Conference" in Streaming Continual Learning Bridge. Published in CEUR Workshop Proceedings (Original version at https://ceur-ws.org/Vol-4183/paper2.pdf)

Journal ref CEUR Workshop Proceedings, Vol. 4183, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09168 2026-05-12 cs.AI cs.LG 73%

CIVeX: Causal Intervention Verification for Language Agents

CIVeX:语言代理的因果干预验证

Fabio Rovai

机构 * The Tesseract Academy(泰塞克特学院)

专题命中 逻辑推理 :chain-of-thought(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 CIVeX通过结构因果查询验证语言代理的干预行动,解决因果效应识别问题,实验显示其在对抗性混淆下具有高准确性和可靠性。

Comments 16 pages, 3 figures. Includes Causal-ToolBench, IHDP, ZOZO Open Bandit, and LaLonde NSW evaluations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08416 2026-05-12 cs.AI cs.CY cs.LG 73%

Alignment as Jurisprudence

对齐作为法学

Nicholas Caputo

机构 * Oxford Martin AI Governance Initiative(牛津马丁人工智能治理研究所)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨法学与对齐的相似结构,通过法律解释主义和宪法AI等方法,揭示两者在规则与案例互动中的价值,并指出AI如何改进法律理解和应用。

Journal ref 27 Yale Journal of Law and Technology 390 (Sept. 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01373 2026-05-05 cs.CL cs.AI 73%

Focus on the Core: Empowering Diffusion Large Language Models by Self-Contrast

聚焦核心:通过自对比增强扩散大语言模型

Jinyuan Feng, Xin Yu, Yiqun Chen, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu, Zhiqiang Pu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过研究高信息密度token,提出FoCore解码策略,利用自对比提升生成质量与效率,实验表明在数学、代码和逻辑推理任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00436 2026-05-04 cs.CL cs.AI 73%

Impact of Task Phrasing on Presumptions in Large Language Models

任务表述对大语言模型中假设的影响

Kenneth J. K. Ong

机构 * AI.DA STC ST Engineering(AI.DA STC ST工程)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了任务表述如何导致大语言模型产生假设,影响其适应能力,通过囚徒困境实验发现中性表述可减少假设影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03237 2026-04-07 cs.HC cs.AI cs.CL 73%

The Persuasion Paradox: When LLM Explanations Fail to Improve Human-AI Team Performance

说服悖论:当LLM解释未能提升人机团队表现时

Ruth Cohen, Lu Feng, Ayala Bloch, Sarit Kraus

机构 * Bar-Ilan University(巴伊兰大学) University of Virginia(弗吉尼亚大学) Department of Psychology, Ariel University(阿里尔大学心理学系)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示LLM解释在提升人机团队表现上的矛盾效果,通过三组实验发现解释增加信心但未必提升准确性,且可能抑制错误恢复能力,强调需转向校准依赖与有效错误恢复的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02954 2026-04-06 cs.CL cs.AI 73%

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation

逻辑毒药:图检索增强生成中的逻辑攻击

Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang

机构 * Southwestern University of Finance and Economics(西南财经大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicPoison攻击框架,通过逻辑推理而非注入虚假内容,破坏图检索增强生成系统中的拓扑结构,从而降低其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02346 2026-04-06 cs.LG cs.AI cs.SE q-bio.BM 73%

DrugPlayGround: Benchmarking Large Language Models and Embeddings for Drug Discovery

DrugPlayGround:大型语言模型和嵌入式在药物发现中的基准测试

Tianyu Liu, Sihan Jiang, Fan Zhang, Kunyang Sun, Teresa Head-Gordon, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院和哈佛大学博德研究所) The Chinese University of Hong Kong(香港中文大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 逻辑推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DrugPlayGround框架,用于评估大型语言模型在生成药物物理化学特性、药物协同作用等文本描述方面的性能,同时通过专家解释验证模型的化学和生物推理能力。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏