arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1648 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1648 篇

2608.03506 2026-08-05 cs.AI stat.ML 新提交 57%

When Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMs

当存在多个有效答案时,投票会失效:针对大语言模型中K选1最佳因果推理的符号验证

Omatharv Bharat Vaidya, Connor Thomas Jerzak, Zayne Rea Sprague, Fangcong Yin, Nhat Ho

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 针对大语言模型因果推理中多有效答案下投票失效的问题,提出无需训练的符号验证器CALVER,在CLEAR数据集等场景下显著提升了推理选择准确率。

Comments 28 pages, 5 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02657 2026-08-05 cs.CR cs.AI 新提交 57%

Your Agentic LLMs Secretly Encode Latent Signals of Indirect Prompt-Injection Exposure

你的智能体大模型会秘密编码间接提示注入暴露的潜在信号

Jianshuo Dong, Yiming Liu, Maosen Zhang, Nan Deng, Xu Peng, Xiaoping Zhang, Tianwei Zhang, Jie Zhang, Han Qiu

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 本文研究智能体大模型的间接提示注入暴露问题,通过探测、防御、解释三方面分析,提出AGRI防御方法,可大幅降低攻击成功率且保持任务效用

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01930 2026-08-04 cs.CV cs.AI 新提交 57%

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

重新计算还是复用?诊断与缓解视觉语言模型自反思中的文本捷径

Wenxiao Fan, Jingling Fu, Fang Li, Luohang Liu, Yu He, Lichen Ma, Zhiyang Yu, Weishan Bi, Junshi Huang, Yan Li, Gu Simiu, Kan Li

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 该研究针对VLM自反思中存在的文本捷径问题,通过反事实分析诊断其特性,提出无需训练的FSAF干预,显著提升视觉更新率、降低先前答案率,为缓解VLM的文本复用偏差提供了有效方案。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01112 2026-08-04 cs.AI 新提交 57%

Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating

以毒攻毒:利用对抗机器学习保护练习题抵御AI作弊的可行性研究

Tobias Braun, Jonas Grebe, Louis Rethfeld, Marcus Rohrbach

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究探究利用对抗机器学习,通过在多模态选择题视觉组件添加扰动引导AI作弊者给出固定错误答案,再以统计检验检测作弊,以保护教育练习题抵御AI作弊的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27798 2026-07-31 cs.AI 新提交 57%

MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

MemeBench:大型视觉语言模型在解读依赖文化的梗图时所缺失的内容

Weihang Wang, Kainan Tu, Jielei Zhang, Run Yang, Boheng Sheng, Yuchen He, Yu Xie, Pengyu Chen, Peiyi Li, Huyang Sun, Longwen Gao, Zhouhui Lian

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究针对LVLMs解读文化类梗图的知识缺口问题,推出诊断基准MemeBench及实体引导检索基线KAR,验证了检索手段可提升梗图解读的VIKR成功率。

Comments 17 pages, 5 figures, and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24582 2026-07-28 cs.CV cs.AI 新提交 57%

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

CADER:用于长视频理解的置信度感知动态证据推理

Jinlong Yang, Wenhao Zhang, Kuanwei Lin, Sijie Cheng

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24471 2026-07-28 cs.CL 新提交 57%

Grounding latent algorithm routing in transformer reasoning

在变压器推理中为潜在算法路由建立基础

Xiangbo Zhang, Xiaoxu Ma

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究变压器能否围绕不同归纳偏差族组织情节级适应,通过潜在算法路由及ROUTEBENCH基准实验,发现从零训练的密集仅解码器变压器能开发类似路由的内部变量,缩小最优路由差距,但未建立通用路由。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24167 2026-07-28 cs.AI 新提交 57%

Falsifiable Commitment Planning for Self-Correcting Web Agents

用于自我纠正网络代理的可证伪承诺规划

Guangyi Liu, Huan Zhao, Quanming Yao

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究长期运行网络代理易偏离轨道问题,提出FCPAgent框架,将计划步骤表示为FCU,通过计划-测试-修复循环执行,经混合承诺测试模块和范围感知修复提高成功率,在WebArena上相比基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交 57%

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23794 2026-07-28 cs.CV cs.AI 新提交 57%

PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

PathScale-R1:用于病理图像分析的跨尺度推理

Chi Phan, Tianyi Zhang, Yufeng Wu, Qiaochu Xue, Jiajie Zhang, Linghan Cai, Zeyu Liu, Sudong Wang, Yueming Jin, Dan Hu

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究针对病理诊断多尺度需求及现有模型局限,引入抗捷径跨尺度病理推理框架,设计相关策略构建PathScale-VQA基准,经优化得到PathScale-R1,实验证明其在跨尺度推理任务性能及对单尺度病理VQA的有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23715 2026-07-28 cs.CL cs.PL 新提交 57%

Formally Verified Synthesizable Floating-Point Data Types in ARCH HDL

ARCH硬件描述语言中形式化验证的可综合浮点数据类型

Shuqing Zhao

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 该研究针对ARCH硬件描述语言设计并验证了FP32和BF16算术,通过单个位向量IR生成三种模型,在求解器可处理性边界处验证,对FMA重新实现并证明其与参考位相同,所有验证声明与开源版本关联。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23605 2026-07-28 cs.AI 新提交 57%

Hybrid Advantage Estimation with Unified Critic for VLM Agentic Reinforcement Learning

用于视觉语言模型智能体强化学习的统一评论家混合优势估计

Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny

机构 * KAUST(沙特阿卜杜拉国王科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究视觉语言模型智能体强化学习,提出HyGAE框架,用统一评论家估计值,推导混合优势联合优化令牌和轮次级目标,在多轮决策环境评估中平均成功率91%,比其他方法显著提升10%,证明混合优势解析形式对优化关键。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23491 2026-07-28 cs.CV cs.CL 新提交 57%

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation

PlanCraft:用于受建筑师启发的渐进式3D住宅场景生成的草图绘制、细化和布置

Pengyu Zeng, Yuqin Dai, Jun Yin, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究针对自动住宅平面图生成中忽视的设计渐进性及二维平面图重要性问题,提出PlanCraft,通过SketchPlan提供训练信号,PlanCraft-Diff细化草图,PlanCraft-Agent布置场景,实验显示其在FID及空间合理性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22902 2026-07-28 cs.AI cs.SE 新提交 57%

How Well Can AI Generate Backlogs from App Mockups?

人工智能从应用程序原型生成待办事项列表的效果如何?

Andrea Lezcano Airaldi, Lourdes Romera, Walid Maalej

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 研究人工智能从应用程序原型生成待办事项列表的效果,提出多模态方法,评估三种提示策略,发现结合架构上下文的混合提示有帮助,结果因项目类型而异,还提出新度量,强调开发人员监督必要。

Comments Accepted at the AIRE Workshop, IEEE 34th International Requirements Engineering Conference (RE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22721 2026-07-28 cs.CV cs.AI 新提交 57%

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

用于精神分裂症认知康复的交互式视觉语言平台

Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi

机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) RIIMA Laboratory(RIIMA实验室)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22597 2026-07-28 cs.AI 新提交 57%

HyCE-RAG: Hypergraph Chain-of-Evidence Retrieval-Augmented Generation for Explainable Multi-hop Question Answering

HyCE-RAG:用于可解释多跳问答的超图证据链检索增强生成

Hong-Yu An, Yun-Jian Zhang, Chen-Wei Liang, Tian-Yi Zhang, Jian Ding, Yi-Lun Wu, Ao-Bo Li, Wei-Cong Su, Saifullah, Mujiangshan Wang

机构 * University of Macau(澳门大学) Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳开鸿数字产业发展有限公司) University of New South Wales(新南威尔士大学) Zhejiang University(浙江大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究可解释多跳问答,提出HyCE-RAG框架,将实体等组织成超边构建超图,经置信度传播和证据组装选择连接证据路径,评分时考虑多种因素,实验证明其在多方面优于标准和基于图的RAG基线,为复杂问答检索后推理提供新方向。

Comments 15 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22555 2026-07-28 cs.AI 新提交 57%

DeepLens Diagnosis Agent: Agentic Workflow Design Lets a Small Reasoning Model Compete with Frontier LLMs

深度镜头诊断代理:代理工作流程设计使小型推理模型能够与前沿语言模型竞争

Mahmood Bayeshi, Veysel Kocaman, Muhammed Ali Naqvi, Yigit Gul, David Talby

机构 * John Snow Labs(约翰·斯诺实验室)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 研究针对医疗诊断中前沿语言模型单步提示诊断推理脆弱的问题,提出以小型医疗推理模型和检索增强生成的深度镜头诊断代理五阶段利用管道,提升了诊断准确率,降低成本,还产生结构化工件支持高风险设置。

Comments 20 pages, 5 figures, 5 tables. Technical report, John Snow Labs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22314 2026-07-27 cs.LG 新提交 57%

Evolution-Aware MSA Reasoning for Subsampling via Factor Graphs

基于因子图的进化感知多序列比对抽样推理

Zhangzhi Xiong, Minzhang Li, Haotian Yu, Sixian Shen, Kexin Zhang, Mingrui Li, Jie Zheng, Kewei Tu, Jingyi Yu

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究针对MSA抽样在有限预算下难以控制进化信号的问题,提出将其作为优化问题,引入基于亲和传播的因子图方法AP-REASONER,通过特定因子和控制旋钮进行推理,实验表明该方法在下游任务中表现优异,能可控恢复蛋白质构象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22016 2026-07-27 cs.CV cs.AI 新提交 57%

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

EVL-MCoT:用于有害模因检测的增强视觉语言多思维链

Hao Yang, Jin Wang, Xuejie Zhang

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对有害模因检测,提出增强视觉语言多CoT(EVL-MCoT)方法,通过促进多CoT及设计解码框架,解决现有方法局限,在相关数据集上获良好结果,且公开了源代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22002 2026-07-27 cs.AI 新提交 57%

Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning

学习随推理展开:用于高效强化学习的渐进式展开分配

Heyang Jiang, Henry Liu, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究针对强化学习中GRPO方法计算昂贵且不稳定的问题,提出VIGOR方法,通过方差引导在线分配展开,理论上推导其加速比,实验表明该方法在数学推理和编码任务中能减少展开次数并提升通过率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21401 2026-07-24 cs.CV cs.AI 新提交 57%

When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation

基于推理的防护栏何时效率不高?ResponseGuard:用于实时审核的快速视觉语言防护工具

Dongbin Na

机构 * POSTECH(浦项科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究视觉语言防护栏筛查回复是否需推理,提出无链式推理的ResponseGuard,通过对请求、回复和图像的单一合并表示一次前向传递读取有害裁决,在回复有害性检测上优于基于推理的防护栏,且时间成本低,还发现了差距原因及推理防护栏注意力问题。

Comments 8 pages, 6 figures, 3 tables. Project page: https://ndb796.github.io/ResponseGuard ; Code: https://github.com/ndb796/ResponseGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21268 2026-07-24 cs.MA cs.AI econ.GN q-fin.EC 新提交 57%

pAI-Econ-claude: A Gated Human-in-the-Loop Multi-Agent Architecture for AI-Assisted Economic Theory Development

pAI-Econ-claude:用于人工智能辅助经济理论发展的门控人在回路多智能体架构

Chen Zhu, Xiaolu Wang, Weilong Zhang

机构 * China Agricultural University(中国农业大学) University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究针对经济学等领域中基于大语言模型智能体输出缺乏正确性信号的可靠性问题,提出pAI-Econ-claude门控人在回路多智能体架构,经实验评估,该架构能提高可审计性,证明不可逆人类判断分配比纯智能体自主性更具信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20935 2026-07-24 cs.CE cs.CL 新提交 57%

Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad

化学思维链函数作为易产生幻觉的分子草稿本

Jiatong Li, Yuxuan Ren, Weida Wang, Xiaoyong Wei, Yatao Bian

机构 * Blue Whale Lab, National University of Singapore(新加坡国立大学蓝鲸实验室) Hong Kong Polytechnic University(香港理工大学) Fudan University(复旦大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究化学推理语言模型中思维链的作用,发现其在多个模型和任务中易产生幻觉且与答案正确性无关,存在共享草稿本功能,如Chem-R依赖SMILES草稿,干扰其草图会影响生成,表明化学CoT是易产生幻觉的分子草稿本,提醒不能仅以CoT判断推理可靠性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20852 2026-07-24 cs.AI 新提交 57%

Code Monitor Red Teaming for Public-Test-Passing Code

用于通过公开测试的代码的代码监控红队

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究公开测试通过后代码隐藏错误监控问题,引入代码监控红队协议并实例化为代码监控基准。通过大量实验发现弱验证器虽能改进但仍易漏错,对抗性压力影响验证效果,GLM - 5.1验证器缩小部分差距,揭示了验证器故障与证据限制的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20464 2026-07-24 cs.AI 新提交 57%

Stochastic Sampling is Epistemically Shallow: The Dimensionality Gap Between Temperature Variation and Model Diversity in LLMs

随机采样在认知上是浅薄的:大语言模型中温度变化与模型多样性之间的维度差距

Izhar Ali

机构 * Rowan University(罗文大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究语言模型重复运行答案不同时其变化能否揭示未知,比较单个模型多次运行与模型集合一次运行,通过随机矩阵测试发现单个模型跨问题结构不明显,自一致性能给出单问题不确定性,多样集合可揭示模型未知。

Comments 8 pages, 4 figures, 3 tables. Accepted at EIML@ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19935 2026-07-23 cs.AI 新提交 57%

MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

MOF-Sleuth:用于可解释细粒度MOF CIF审核的工具基础奖励对齐

Yu Liu, Zhiwei Yang, Diandian Guo, Kun Peng, Fangfang Yuan, Cong Cao, Chaozhuo Li, Zhiyuan Ma, Yanbing Liu, Guobin Zhao

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究针对MOF数据库CIF输入错误影响下游结果及人工检查的问题,提出MOF-Sleuth,通过强化引导CIF审核代理的两个模块,利用奖励引导强化学习将工具测量转化为监督,提升检测、归因及解释质量,在多基准测试中性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19358 2026-07-23 cs.AI 新提交 57%

LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning

LISA:用于高效长上下文推理的线性索引稀疏注意力

Yu Zhao, Zekun Zhang, Fan Jiang, Bo Zeng, Linlong Xu, Shimin Shan, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业集团) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.AI

AI总结 研究针对长思维链推理模型中标准自注意力计算复杂度高的问题,提出LISA模块,它集成线性注意力模块和闪电索引器,经两阶段训练,能降低推理复杂度,在特定模型上实现推理加速并提升性能。

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19267 2026-07-22 cs.CR cs.AI cs.MA 新提交 57%

They'll Verify. They Just Won't Act. How Authority Framing and Laundered Code Turn a Trusted Agentic CI/CD Pipeline Into an Attack Surface

他们会验证。但他们不会采取行动。权威框架和清洗后的代码如何将一个可信的代理式CI/CD管道变成攻击面

Yohann Sidot

机构 * Senthex Research(Senthex研究机构) RELAY Lab(RELAY实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究五代理CI/CD管道在面对恶意输入时的安全性,通过AxB(xC)析因设计实验发现权威框架注入会使下游验证者放行恶意代码,基于内容的控制会失效,只有来源感知控制可防攻击,揭示了现有保护机制的不足。

Comments 9 pages. Dataset and reproduction code: https://github.com/senthex-security/senthex-research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18847 2026-07-22 cs.CR cs.AI 新提交 57%

Data Leakage Prevention in Agentic Applications via Preemptive Hardening

通过先发制硬化防止智能应用中的数据泄露

Akansha Shukla, Emily Bellov, Parth Atulbhai Gandhi, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18443 2026-07-22 cs.CL 新提交 57%

Computational models of pragmatic reasoning with flexible generation of meaning and expression alternatives

具有灵活生成意义和表达替代方案的语用推理计算模型

Polina Tsvilodub, Fausto Carcassi, Michael Franke

机构 * University of Tübingen(图宾根大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究提出SAGE框架,结合认知模型与语言模型,将语用过程分解为提议者、评估者和选择器模块。通过三个案例研究评估,该模型取得高精度且常超基线,不过组件分析有不对称性,还探讨了神经符号模型在语用语言使用中的前景与局限。

Comments 27 pages main text, 9 figures; 25 pages supplementary materials

详情

展开后加载摘要…

URL PDF HTML 收藏