arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 89 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 89 篇

2502.11603 2026-08-18 cs.CL cs.AI 版本更新 92%

DR.GAP: Mitigating Bias in Large Language Models using Gender-Aware Prompting with Decoupled Reasoning

DR.GAP:采用解耦推理的性别感知提示缓解大语言模型中的偏见

Hongye Qiu, Yue Xu, Yi Wang, Meikang Qiu, Wenjie Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型的性别偏见问题,提出DR.GAP方法,通过生成无性别推理轨迹作为上下文示例,在不修改模型参数的情况下缓解偏见,且可扩展至视觉语言模型,经多任务多模型实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01375 2026-08-18 cs.CY cs.AI 版本更新 92%

Beyond Access: Guided LLM Scaffolding for Independent Learning in Undergraduate Statistics

超越访问:引导式LLM支架在本科统计学自主学习中的应用

Mohammad Amanlou, Yasaman Amou-Jafari, Fereshte Bagheri, Fatemeh Boloukazari, Mehrad Liviyan, Elahe Khodaverdi Nadrabadi, Shahab Sherafat, Behnam Bahrak

机构 * School of Electrical and Computer Engineering, University of Tehran, Iran(伊朗塔里哈大学电气与计算机工程学院) Tehran Institute for Advanced Studies, Khatam University, Iran(伊朗卡塔姆大学泰赫兰高级研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过准实验比较无LLM、无限制LLM和引导式LLM三种条件,发现引导式LLM使用能促进以推理为导向的交互模式,提升无辅助测验表现,并改善自我评估校准,表明LLM作为教育工具需通过支架设计实现推理伙伴而非答案获取工具。

Comments 10 pages. Accepted at the 34th International Conference on Computers in Education (ICCE 2026), Asia-Pacific Society for Computers in Education (APSCE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28850 2026-08-18 cs.LG q-fin.CP 版本更新 92%

Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents

表示签名与LLM交易智能体中的风险反馈对齐

Weicheng Xue

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过TradeArena测试平台研究LLM交易智能体在金融决策中的行为对齐与表示动态,发现故障前表示签名(规划嵌入漂移、流形有效秩收缩)并验证风险反馈作为外部对齐信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-18 cs.RO cs.AI 新提交 91%

When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15574 2026-08-18 cs.CV cs.AI 新提交 91%

Catching Hallucinated Citations in Video-LLM Question Answering: A Self-Verification Pipeline and Verifier Ablation Study

视频-大语言模型(Video-LLM)问答中幻觉引用的检测:自验证流水线与验证器 ablation 研究

Yogesh Kumar

专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 针对视频-LLM问答中引用幻觉问题,提出自验证流水线,用小型自然语言推理模型作稳定验证器,在对抗性错误前提问题上检测率达79%,并发布相关代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15175 2026-08-18 cs.RO cs.AI 新提交 91%

LAPF: LLM-Agent-Based Path Finder Using the UAVScenes Dataset

LAPF:基于大语言模型智能体的路径查找器,使用UAVScenes数据集

Yousef Emami, Mohammadhossein Homaei, Hao Zhou, Miguel Gutiérrez Gaitán, Atefeh Hajijamali Arani, Rui Zhang

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于LLM智能体的LAPF框架,整合多模块构建闭环认知架构,在城镇级无人机导航中实现了更优路径效率,且无钳位事件,性能优于CoT提示方法。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-18 cs.AI cs.RO 新提交 90%

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14927 2026-08-18 cs.AI cs.CL cs.LG 新提交 90%

LLMs Can Predict Failure Risk, But Struggle to Predict Which Collaboration Protocol Pays Off: Cost-Aware Protocol Routing Across Reasoning Tasks

大语言模型(LLM)可预测失败风险,但难以预测哪种协作协议能产生回报:推理任务中考虑成本的协议路由

Chih-Hsuan Yang, Jingyan Jiang, Cheng-Hau Yang, Vikram Vasudevan, Huihuo Zheng, Venkatram Vishwanath, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) Oregon State University(俄勒冈州立大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨LLM多智能体系统中协作成本与收益的平衡,测试四种协作协议,发现LLM可预测失败风险但难以识别有效协议,置信度可支持初始协作升级,特定协议的成本感知路由仍待解决。

Comments 23 pages, 6 figures; includes appendices and ancillary aggregate-result CSV files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16461 2026-08-18 cs.ET cs.AI cs.CE cs.CY 新提交 90%

A Human-LLM Teaming Framework for Privacy Risk Analysis: An Illustration with CBDC-Based Welfare Schemes

一种用于隐私风险分析的人-大语言模型(LLM)协同框架:以基于央行数字货币(CBDC)的福利方案为例

Sourya Joyee De, Abdessamad Imine

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出用于隐私风险分析的人-LLM协同框架PRIAM,以CBDC福利方案为例验证,该框架通过人机迭代协作优化隐私风险评估,为相关领域提供基础贡献。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15389 2026-08-18 cs.AI 新提交 90%

Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL

重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析

Changruo Zhao, Zujun Peng, Yu Tian, Yuting Liu, Yiyun Su, Huiying Zhu, Luyan Zhang, Heming Zeng

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14668 2026-08-18 cs.MA cs.AI 新提交 90%

BRA-Audit: Budgeted Runtime Auditing for LLM Multi-Agent Systems via Cumulative-Exposure Audit-Point Placement

BRA-Audit:基于累积暴露审计点放置的LLM多智能体系统预算运行时审计

Kaixiang Wang, Yidan Lin, Jiong Lou, Jie Li

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 BRA-Audit是一种预算感知的LLM多智能体系统运行时审计框架,通过贪心调度放置审计点,在保障防护性能的同时降低了17.2%-40.6%的端到端token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16438 2026-08-18 cs.AI cs.CC cs.IT 新提交 90%

The Value of a Prompt: An LLM-Relative Kolmogorov-Complexity Approach

提示的价值:一种大语言模型(LLM)相对柯尔莫哥洛夫复杂度的方法

Rafael Pass

机构 * Cornell Tech(康奈尔科技学院) Technion(以色列理工学院) TAU(特拉维夫大学)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究提出LLM相对的概率性Levin–柯尔莫哥洛夫复杂度pKt,将提示价值定义为相对于pKt的算法互信息,可高效估算,且提示价值b位对应无提示时复制z的中位数token成本为有提示时的2^b倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15709 2026-08-18 cs.DB 新提交 89%

Logos: Certified Order-Sensitive SQL Rewrites with Mechanized Semantics and LLM Guidance

Logos:结合机械化语义与LLM指导的可验证顺序敏感型SQL重写

Jingyu Ke, Jingyang Li, Guoqiang Li

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 Logos是一款结合Rocq机械化语义与LLM指导的SQL重写验证工具,解决了现有工具的不足,在389个查询对的评估中解决率达86.9%,优于基线工具SQLSolver。

Comments 13 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14615 2026-08-18 cs.AI 新提交 89%

Large Language Models and their Awareness of Mechanics and Spatial Geometry

大语言模型及其对力学与空间几何的认知能力

Johannes Gerstmayr, Sebastian Weyrer, Tobias Möltner, Peter Manzl, Michael Pieber

机构 * University of Innsbruck(因斯布鲁克大学) University of Augsburg(奥格斯堡大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究构建了全自动基准MecEng,评估32个开放权重及2个专有LLMs的机械工程认知,发现其刚体任务成功率达86.0%,但柔性多体任务仍具挑战,且该能力正快速提升但仍易出错。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15673 2026-08-18 cs.LG cs.AI 新提交 88%

PL-Guard: Probabilistic Logic Reasoning for LLM Guardrails

PL-Guard:面向大语言模型安全护栏的概率逻辑推理

Satchit Chatterji, Shihan Wang, Giovanni Sileno, Erman Acar

机构 * University of Amsterdam(阿姆斯特丹大学) Utrecht University(乌得勒支大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);prompting(abstract)

AI总结 该研究提出神经符号安全护栏架构PL-Guard,通过分离神经落地与概率符号推理,在XSTest基准上大幅降低大语言模型的不安全依从率,虽过度拒绝率略高,但提升了推理可审计性。

Comments Preliminary version of this paper was presented at the IJCAI 2026 Workshop on Logical and Symbolic Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13221 2026-08-18 cs.AI cs.LG 版本更新 88%

An Agentic AI Framework with Large Language Models and Chain-of-Thought for UAV-Assisted Logistics Scheduling with Mobile Edge Computing

基于大语言模型和链式推理的智能AI框架用于无人机辅助物流调度与移动边缘计算

Hanwen Zhang, Dusit Niyato, Wei Zhang, Xin Lou, Malcolm Yoke Hean Low

机构 * Nanyang Technological University(南洋理工大学) Singapore Institute of Technology(新加坡理工学院) Seatrium New Energy Laboratory(Seatrium 新能源实验室) Ministry of Education (MOE) Tier 1(教育部 Tier 1) Research Innovation and Enterprise (RIE) 2025 Industry Alignment Fund-Industry Collaboration Projects (IAF-ICP)(研究创新与企业 (RIE) 2025 行业对齐基金-行业合作项目 (IAF-ICP))

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出结合大语言模型和链式推理的智能AI框架,用于解决无人机辅助物流调度中的混合调度问题,通过分层深度强化学习实现无人机路由和任务执行优化,提升物流效率与任务完成率。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08879 2026-08-18 cs.CL cs.AI 版本更新 88%

CulTrace: Tracing Internal Cultural Reasoning in Large Language Models

纠缠于表征:大型语言模型中文化偏见的机制性探究

Haeun Yu, Arnav Arora Seogyeong Jeong, Nadav Borenstein, Siddhesh Pawar, Jisu Shin, Jiho Jin, Junho Myung, Alice Oh, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) KAIST(韩国科学技术院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Culturescope方法,通过机制性可解释性探讨LLMs中文化偏见的来源,揭示低资源文化对文化偏见的抗性及模型参数知识的限制。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15979 2026-08-18 cs.AI 新提交 88%

ALPS: Measuring Valid Creativity in Large Language Models with Mathematical Construction

ALPS:通过数学构造衡量大语言模型的有效创造力

Eric Xie, Wenqian Ye, Aidong Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出ALPS基准,通过要求生成可证正确的原创数学结构或证明其不存在的任务,评估大语言模型的有效创造力,测试发现现有推理模型在证明侧成功率14%、构造侧为0,多数实例未被解决并发布完整ALPS资源。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10813 2026-08-18 cs.AI cs.GT 版本更新 88%

The Fragility of Strategic Thinking in Large Language Models

大型语言模型战略思维的脆弱性

Enric Junque de Fortuny, Veronica Roberta Cappelli

机构 * IESE(IESE商学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究开发框架拆解博弈中信念形成等环节,发现前沿LLMs的战略思维存在但具脆弱性,随复杂性提升会出现逻辑转变与启发式规则,警示其作为战略主体应用需谨慎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16637 2026-08-18 cs.AI 新提交 87%

PDDLCoder: Agentic PDDL Generation for LLM-Assisted Symbolic Planning

PDDLCoder:用于LLM辅助符号规划的智能体式PDDL生成工具

Veit Laule, Jiangtao Shuai, Manfred Hauswirth, Sonja Schimmler

机构 * Technical University of Berlin(柏林工业大学) Fraunhofer FOKUS(弗劳恩霍夫FOKUS研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出智能体式PDDL生成框架PDDLCoder,引入含711个问题的NL-pddlgym基准,其在测试集上可生成89.6%可执行规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15502 2026-08-18 cs.HC cs.CL cs.RO 交叉投稿 87%

FollowUpBot: An LLM-Based Conversational Robot for Automatic Postoperative Follow-up

FollowUpBot:基于大语言模型的术后自动随访对话机器人

Chen Chen, Jianing Yin, Jiannong Cao, Zhiyuan Wen, Mingjin Zhang, Weixun Gao, Xiang Wang, Haihua Shu

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对传统术后随访的局限,提出边缘部署的LLM机器人FollowUpBot,可实现自适应隐私保护的随访交互与结构化报告生成,实验验证其交互覆盖率、满意度及报告准确率均较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15303 2026-08-18 cs.AI 新提交 86%

Divergent-Convergent Reasoning: Scaling Test-Time Compute through Structured Solution Synthesis

发散-收敛推理:通过结构化解决方案合成扩展测试时计算

Bo Wen, Yuhao Chen, Erhan Bilal, Carla Agurto Rios, Chen Wang, Junchen Jiang

机构 * School of Computing, Queen’s University(女王大学计算学院) IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) University of Chicago(芝加哥大学) Tensormesh Inc.(Tensormesh公司)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出发散-收敛推理(DCR),引入递归DCR方法,利用分歧信息优化测试时计算分配,在AIME 2024、2025数据集上实现高准确率且减少计算量,揭示LLM测试时推理的扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12756 2026-08-18 cs.LG 版本更新 86%

Closing the Loop: A Control-Theoretic Framework for Provably Stable Time Series Forecasting with LLMs

闭环:基于控制理论的具有可证明稳定性的时序预测框架与大语言模型

Xingyu Zhang, Jingyao Wang, Zeen Song, Changwen Zheng, Wenwen Qiang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出F-LLM框架,通过控制理论方法解决大语言模型在时序预测中的误差累积问题,提供理论保证并实验验证其有效性。

Comments Accepted by ACM MM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16419 2026-08-18 cs.LG cs.AI q-bio.QM 新提交 86%

PertMind: Eliciting Emergent Biological Reasoning in LLM via Reinforcement Learning on Cellular Perturbation Data

PertMind:通过细胞扰动数据的强化学习在大语言模型中引出涌现生物推理能力

Zhenchao Tang, Xiaogang Xu, Tianxu Lv, Jiahui Guan, Jiale Zhou, Haohuai He, Zhi Song, Hanbo Huang, Jiehui Huang, Jiafei Wu, Zhe Liu

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究提出PertMind模型,结合可信轨迹监督初始化与多层面强化信号,以细胞扰动图谱为强化学习环境训练,实现生物推理能力的涌现,且可迁移至多类生物任务。

Comments Project page: this https URL (https://shapsider.github.io/PertMind/) Code: this https URL (https://github.com/shapsider/PertMind) Model: this https URL (https://huggingface.co/tzcfly/PertMind)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16003 2026-08-18 cs.AI cs.CL 新提交 86%

Prior Audit-Repair Context Shifts LLM Verifier Thresholds Toward Leniency

先验审计-修复上下文调整大语言模型验证器阈值以趋向宽松

Parsa Mazaheri, Kasra Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理与问题求解 :LLM(title,summary_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现,LLM检查器上下文中的审计→修复事件会降低误报率,调整了验证器阈值趋向宽松,且该效应与负性不对称性预测相反,不随推理启用而消失。

Comments 12 pages, 2 figures, 4 tables. Code and analysis artefacts: this https URL (https://github.com/parsa-mz/crtitxer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15210 2026-08-18 cs.MM 新提交 86%

RoE-FND: Synergizing LLMs with Experiential Learning for Effective and Generalizable Evidence-Based Fake News Detection

RoE-FND:结合大语言模型与经验学习实现有效且可泛化的循证假新闻检测

Yuzhou Yang, Qichao Ying, Sheng Li, Zhiyin Zhu, Zhenxing Qian, Xinpeng Zhang

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RoE-FND框架,结合LLM与自反经验学习构建经验库,推理时检索经验裁决对立推演,在5个FND基准上优于基线且跨数据集泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14613 2026-08-18 cs.AI 新提交 85%

Do LLM Agents Negotiate Rationally? A Mechanism-Design Framework for Verifiable Multi-Agent Interaction over A2A/MCP

大语言模型智能体是否进行理性协商?面向A2A/MCP的可验证多智能体交互机制设计框架

Wael Albayaydh, Rui Zhao

专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究针对A2A/MCP协议提出可验证多智能体交互机制设计框架,实验发现机制激励兼容性无法自动迁移至大语言模型智能体行为,相关成果连接经典多智能体理论与现代LLM智能体基础设施。

Comments 20 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14610 2026-08-18 cs.AI 新提交 85%

When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning

大型语言模型何时适用错误法律?诊断大型语言模型在时间法律推理中的失败

Yiqian Huang, Shuyuan Zheng, Qianying Liu, Shaowen Peng, Yuntao Kong, Kotaro Funakoshi, Chuan Xiao, Manabu Okumura, Yang Cao

机构 * Institute of Science Tokyo(东京科学大学) Osaka University(大阪大学) NII LLMC(日本信息学研究所语言、语言学与媒体中心) Nara Institute of Science and Technology(奈良科学技术研究所) Center of Juris-Informatics, ROIS-DS(日本学术研究推进机构跨学科科学研究中心法学信息学中心)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文构建基准评估LLMs的时间适用法律判定能力,发现LLMs存在适用最新法律的偏差,该偏差源于强化学习塑造的显式推理导致推理路径多样性减少,通用推理能力更强的模型在时间法律推理中表现更差,为相关优化提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15710 2026-08-18 cs.CV cs.AI cs.CL 新提交 85%

Beyond Single Object: Learning 3D Relations with Large Language Models

超越单一物体:用大语言模型学习三维关系

Kohsuke Ide, Ryousuke Yamada, Yue Qiu, Xianzheng Ma, Yoshihiro Fukuhara, Hirokatsu Kataoka, Yutaka Satoh

机构 * AIST(日本国立 Advanced Industrial Science and Technology(AIST)) University of Tsukuba(筑波大学) University of Technology Nuremberg(纽伦堡工业大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 针对现有3D-LLMs难以开展多物体间详细比较的问题,提出含MO3D数据集、Multi-3DLLM模型及Mini-apps基准的框架,该模型在MO3D任务上超越所有基线且对单物体分类有正向迁移

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16032 2026-08-18 cs.CR 新提交 85%

Proof-of-Execution Memory: Defending LLM Agents Against Forged-Reasoning Attacks by Verifying What Actually Happened

执行证明内存:通过验证实际发生的内容防御大语言模型智能体的伪造推理攻击

Md Habibur Rahman, Jaeho Kim

专题命中 推理与问题求解 :LLM(title,abstract);language model(abstract)

AI总结 该研究针对大语言模型智能体的伪造推理攻击,提出执行证明内存(PoEM)防御方案,通过维护防篡改的HMAC链式分类账验证实际执行步骤,使攻击成功率降至0%,且误报率极低、开销微小。

Comments 8 pages, 6 figures, 5 tables. Code: this https URL (https://github.com/bithabib/ai_security)

详情

展开后加载摘要…

URL PDF HTML 收藏