arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-24 至 2026-04-24 共收录 35 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2604.21584 2026-04-24 cs.AI cs.CE cs.LG 92%

CoFEE: Reasoning Control for LLM-Based Feature Discovery

CoFEE:基于LLM的特征发现的推理控制

Maximilian Westermann, Ben Griffin, Aaron Ontoyin Yin, Zakari Salifu, Yagiz Ihlamur, Kelvin Amoaba, Joseph Ternasky, Fuat Alican, Yigit Ihlamur

机构 * University of Oxford(牛津大学) Vela Research(Vela研究) Amazon(亚马逊)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoFEE框架,通过引入认知行为提升LLM特征发现的预测性和效率,实验显示其在预测性和成本控制上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21264 2026-04-24 cs.AI 92%

Enhancing Online Recruitment with Category-Aware MoE and LLM-based Data Augmentation

通过类别感知的MoE和基于LLM的数据增强提升在线招聘

Minping Chen, Bing Xu, Zulong Chen, Chuanfei Xu, Ying Zhou, Zui Tao, Zeyi Wen

机构 * HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Zhijiang Lab(浙江实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于LLM的数据增强和类别感知MoE方法,解决低质量职位描述和相似候选-职位对的问题,提升AUC、GAUC和点击转化率。

Comments Accepted to ACL Industry Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20987 2026-04-24 cs.AI 92%

Co-Evolving LLM Decision and Skill Bank Agents for Long-Horizon Tasks

共进化LLM决策与技能库代理以应对长周期任务

Xiyang Wu, Zongxia Li, Guangyao Shi, Alexander Duffy, Tyler Marques, Matthew Lyle Olson, Tianyi Zhou, Dinesh Manocha

机构 * University of Maryland(马里兰大学) University of Southern California(南加州大学) Good Start Labs(Good Start实验室) Independent Researcher(独立研究者) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出COSPLAY框架,通过LLM决策代理与技能库代理的共进化,提升长周期任务中的技能检索与决策能力,实验显示在六个游戏环境中,COSPLAY在单人游戏基准上平均奖励提升超过25.1%。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20916 2026-04-24 cs.AR 90%

AnalogMaster: Large Language Model-based Automated Analog IC Design Framework from Image to Layout

AnalogMaster: 基于大语言模型的从图像到布局的自动化模拟集成电路设计框架

Xian Rong Qin, Yong Zhang, Ying Hu, Tao Su, Bo-Wen Jia, Ning Xu

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出AnalogMaster框架,利用大语言模型实现模拟集成电路设计的端到端自动化,通过统一流程完成电路图像到网表生成、参数优化、布局和布线,验证了其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20878 2026-04-24 cs.CL cs.CV cs.LG eess.IV 88%

AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models

AITP:通过多模态大语言模型进行交通事故责任分配

Zijin Zhou, Songan Zhang

机构 * Global Institute of Future Technology(未来技术全球研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出AITP模型,结合多模态链式推理和法律知识检索,解决交通事故责任分配问题,并构建DecaTARA基准测试集,验证模型在责任分配、事故检测和理解任务中的领先性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06209 2026-04-24 cs.AI cs.CL 88%

ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

ReProbe:通过探测大语言模型的内部状态实现多步骤推理的高效测试时间扩展

Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) National University of Singapore(新加坡国立大学) MBZUAI(马斯喀特人工智能研究所) University of Zürich(苏黎世大学) The University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于探测大语言模型内部状态的轻量级方法,用于多步骤推理验证,其性能超越了810倍大的Process Reward Models,为可扩展的测试时间扩展和更可 introspective 的大语言模型提供了新路径。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24239 2026-04-24 cs.LG cs.AI 88%

ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models

ChessArena: 一个用于评估大语言模型战略推理能力的国际象棋测试平台

Jincheng Liu, Sijun He, Jingjing Wu, Xiangsen Wang, Yang Chen, Zhaoqi Kuang, Siqi Bao, Yuan Yao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Baidu(百度) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ChessArena测试平台,用于评估大语言模型的战略推理能力,测试了13个模型在800多局游戏中表现,发现无模型能击败业余水平的Maia-1100,但经过微调的Qwen3-8B模型表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21611 2026-04-24 cs.CL cs.AI 87%

Process Supervision via Verbal Critique Improves Reasoning in Large Language Models

通过口头批评过程监督提高大语言模型的推理能力

Hao-Yuan Chen

机构 * Mindify AI Research(Mindify AI研究院) University of London(伦敦大学) Senate House, Malet Street, London WC1E 7HU, United Kingdom(伦敦大学 Senate House, 马莱特街, 伦敦 WC1E 7HU, 英国)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过外部口头监督提升大语言模型推理能力的方法,通过结构化自然语言批评指导生成-批评-完善循环,提升推理性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21187 2026-04-24 math.CO cs.AI 86%

Doubly Saturated Ramsey Graphs: A Case Study in Computer-Assisted Mathematical Discovery

双重饱和的Ramsey图:计算机辅助数学发现的一个案例研究

Benjamin Przybocki, John Mackey, Marijn J. H. Heule, Bernardo Subercaseaux

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过结合SAT求解与定制生成的代码,发现无限多的双重饱和Ramsey图,回答了Grinstead和Roberts在1982年的疑问,并利用LLM生成形式化证明,展示自动化推理、大语言模型和形式验证在数学发现中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20917 2026-04-24 cs.LG cs.AI cs.CL cs.PL cs.SE 86%

The Path Not Taken: Duality in Reasoning about Program Execution

未选择的道路:程序执行推理中的对偶性

Eshgin Hasanov, Md Mahadi Hassan Sibat, Santu Karmaker, Aashish Yadavally

机构 * Department of Computer Science, University of Central Florida(中央佛罗里达大学计算机科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过双重推理任务评估程序执行的因果理解,提出DexBench基准测试集,评估13种LLM,证明双路径推理能有效提升动态代码理解能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04573 2026-04-24 cs.LG cs.AI cs.CL 83%

LaDiR: Latent Diffusion Enhances LLMs for Text Reasoning

LaDiR:潜在扩散增强大语言模型进行文本推理

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Nicklas Majamaki, Navdeep Jaitly, Yi-An Ma, Lianhui Qin

机构 * University of California, San Diego(加州大学圣迭戈分校) Apple(苹果公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LaDiR通过结合连续潜在表示的表达力与潜在扩散模型的迭代精炼能力,提升大语言模型在文本推理中的准确性、多样性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04023 2026-04-24 cs.CL 83%

Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models

大语言模型是否会过度思考基础数学推理?评估语言模型中准确性与效率的权衡

Gaurav Srivastava, Aafiya Hussain, Sriram Srinivasan, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工大学计算机科学系,布莱克斯堡,VA,美国)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出LLMThinkBench基准测试,评估语言模型在准确性与过度思考之间的权衡,发现模型在复杂基准上的表现不直接转化为基础数学推理能力,且过度思考导致效率下降。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20994 2026-04-24 cs.CR cs.AI cs.CL 82%

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

打破MCP:函数劫持攻击:函数调用和代理模型的新威胁

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院都柏林) Imperial College London(帝国理工学院伦敦) ADAPT Research Centre(ADAPT研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21420 2026-04-24 cs.AI 81%

FairQE: Multi-Agent Framework for Mitigating Gender Bias in Translation Quality Estimation

FairQE:缓解翻译质量评估中性别偏见的多智能体框架

Jinhee Jang, Juhwan Choi, Dongjin Lee, Seunguk Yu, Youngbin Kim

机构 * Chung-Ang University(Chung-Ang 大学) AITRICS

专题命中 推理与问题求解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 FairQE通过多智能体机制检测性别线索并生成性别翻转翻译变体,结合传统QE评分与LLM偏见缓解推理,提升翻译质量评估的性别公平性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21354 2026-04-24 cs.LG 81%

Decoupled Travel Planning with Behavior Forest

解耦行为森林中的旅行计划

Duanyang Yuan, Sihang Zhou, Yanning Hou, Xiaoshu Chen, Haoyuan Chen, Ke Liang, Jiyuan Liu, Chuan Ma, Xinwang Liu, Jian Huang

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) College of Computer Science, Chongqing University(计算机科学学院,重庆大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出行为森林方法,通过解耦复杂任务和约束到可管理的子空间,提升大语言模型在多约束旅行计划中的性能,实验表明在TravelPlanner和ChinaTravel基准上分别优于现有方法6.67%和11.82%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21523 2026-04-24 cs.CV cs.CL 79%

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

看到并不等于相信:揭示评估者视觉-语言模型的盲区

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) BITS Pilani, Hyderabad(海得拉巴 BITS学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11066 2026-04-24 math.DS cs.AI cs.HC 79%

Exploring Collatz Dynamics with Human-LLM Collaboration

通过人类-大语言模型协作探索科拉兹动力学

Edward Y. Chang

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过1014次计算实验,系统分析科拉兹猜想,利用29种数学方法揭示分布收敛到点收敛的不可还原障碍,证明了科拉兹猜想难以证明的本质原因。

Comments 233 pages, 11 figures, 52 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21253 2026-04-24 cs.CL cs.AI 79%

Planning Beyond Text: Graph-based Reasoning for Complex Narrative Generation

超越文本的规划:基于图的复杂叙事生成推理

Hanwen Gu, Chao Guo, Junle Wang, Wenda Xie, Yisheng Lv

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tencent Turing Lab(腾讯人工智能实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出PLOTTER框架,通过结构图进行叙事规划,提升LLM在复杂叙事生成中的长上下文推理能力。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21327 2026-04-24 cs.LG cs.AI cs.CL 75%

Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning

理解并缓解测试时间强化学习在数学推理中的虚假信号放大

Yongcan Yu, Lingxiao He, Jian Liang, Kuangpu Guo, Meng Wang, Qianlong Xie, Xingxing Wang, Ran He

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所NLPR与MAIS实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Meituan(美团) University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了测试时间强化学习在数学推理中因标签噪声导致的虚假信号放大问题,提出DDRL框架通过频率采样、去偏优势估计和共识-off-policy优化来缓解该问题,实验表明其优于现有基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12721 2026-04-24 cs.AI cs.CL cs.LG stat.ML 75%

Strategic Scaling of Test-Time Compute: A Bandit Learning Approach

测试时计算的战略扩展:一种多臂学习方法

Bowen Zuo, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多臂学习方法,通过动态分配计算资源提升大语言模型性能,针对不同查询难度优化计算分配,实验表明在多个基准数据集上显著提升性能。

Comments To appear at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21357 2026-04-24 cs.AI cs.CL 73%

ReaGeo: Reasoning-Enhanced End-to-End Geocoding with LLMs

ReaGeo:基于大语言模型的推理增强端到端地名编码

Jian Cui, Zhiyuan Ren, Desheng Weng, Yongqi Zhao, Gong Wenbin, Yu Lei, Zhenning Dong

机构 * Amap, Alibaba Group(阿里巴巴集团阿地图) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReaGeo利用大语言模型解决传统多阶段方法在地理数据库中依赖文本或向量相似性检索的局限性,通过将坐标转换为geohash序列,引入链式推理机制提升空间关系推理能力,并通过距离偏差奖励的强化学习优化生成精度。

Comments 12 pages, 8 figures, submitted to ACM SIGSPATIAL 2024 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21346 2026-04-24 cs.AI cs.CL cs.CV 73%

Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning

符号 grounding 揭示了抽象视觉推理中的表征瓶颈

Mohit Vaishnav, Tanel Tammet

机构 * Applied Artificial Intelligence Group, Tallinn University of Technology, Estonia(塔林技术大学应用人工智能小组,爱沙尼亚) Kimova AI, Tallinn, Estonia(Kimova AI,塔林,爱沙尼亚)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过Bongard-LOGO基准测试,发现符号输入能显著提升抽象视觉推理性能,揭示了表征能力是核心瓶颈。

Journal ref 30th Conference on Computational Natural Language Learning (CoNLL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21593 2026-04-24 cs.CL 70%

Language as a Latent Variable for Reasoning Optimization

语言作为潜在变量用于推理优化

Linjuan Wu, Haoran Wei, Jialong Tang, Shuang Luo, Baosong Yang, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究探讨语言作为潜在变量对推理性能的影响,提出polyGRPO框架通过多语言数据优化模型,提升推理准确率和跨任务泛化能力。

Comments 17 pages, 7 figures, Under Reviewing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21282 2026-04-24 cs.CR cs.LG cs.SE 70%

Strategic Heterogeneous Multi-Agent Architecture for Cost-Effective Code Vulnerability Detection

战略异构多智能体架构用于高效代码漏洞检测

Zhaohui Geoffrey Wang

机构 * University of Southern California(南加州大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种基于博弈论的异构多智能体架构,结合云上大语言模型专家与本地轻量验证器,通过三重专家并行分析与对抗验证,实现高效且高精度的代码漏洞检测,实验显示其在精度和召回率上均优于现有方法。

Comments 11 pages, 5 figures. Accepted at the AAMAS 2026 Workshop on Software Engineering (SE Workshop). This version corresponds to the preprint of the workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21092 2026-04-24 cs.AI cs.SE 70%

Mind the Prompt: Self-adaptive Generation of Task Plan Explanations via LLMs

注意提示:通过LLMs实现自我适应的任务计划解释生成

Gricel Vázquez, Alexandros Evangelidis, Sepeedeh Shahbeigi, Radu Calinescu, Simos Gerasimou

机构 * University of York, UK(英国约克大学) Cyprus University of Technology, Cyprus(塞浦路斯技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出COMPASS方法,通过将提示工程建模为认知和概率决策过程,实现复杂任务规划系统中自适应的解释生成和提示优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20860 2026-04-24 cs.IR cs.AI 70%

RealRoute: Dynamic Query Routing System via Retrieve-then-Verify Paradigm

RealRoute:通过检索-验证范式实现动态查询路由系统

Jiahe Liu, Qinkai Yu, Jingcheng Niu, Xi Zhu, Zirui He, Zhen Xiang, Fan Yang, Jinman Zhao

机构 * Technical University of Denmark(技术大学) University of Exeter(埃克塞特大学) University of Toronto(多伦多大学) Rutgers University(罗格斯大学) NJIT(新 jersey 工业技术学院) University of Georgia(佐治亚大学) Wake Forest University(威克森林大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 RealRoute引入一种鲁棒的检索-验证机制,通过并行源无关检索和动态验证器确保证据完整性,优于预测基线,在多跳RAG推理任务中表现更佳。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15468 2026-04-24 cs.SE cs.AI 70%

The Semi-Executable Stack: Agentic Software Engineering and the Expanding Scope of SE

半可执行堆栈:智能软件工程与SE范围的扩展

Robert Feldt, Per Lenberg, Julian Frattini, Dhasarathy Parthasarathy

机构 * Chalmers University of Technology(挑战者技术大学) Volvo Group(沃尔沃集团)

专题命中 推理与问题求解 :LLM(abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 本文探讨了软件工程领域因AI系统发展而扩展的范围,提出半可执行堆栈模型以分析可执行代码与非可执行 artifacts 的结合,通过三个案例研究重新定义工程目标,提供保留与净化的决策框架。

Comments This paper is the write-up of Robert Feldt's keynote "Agentic Software Engineering Will Eat the World: AI-Based Systems as the New Operating System of Society'' given at the Agentic Engineering 2026 workshop, Rio de Janeiro, Brazil, April 14, 2026. April 23 upload fixed the reference list to be more complete, and added a few additional citations; text essentially unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11569 2026-04-24 cs.AI 70%

SemaPop: Semantic-Persona Conditioned and Controllable Population Synthesis

SemaPop:基于语义-人设的可控人口合成

Zhenlin Qin, Yancheng Ling, Leizhen Wang, Francisco Câmara Pereira, Zhenliang Ma

机构 * Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑系,皇家理工学院) Digital Future, KTH Royal Institute of Technology(数字未来,皇家理工学院) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Department of Technology, Management and Economics, Technical University of Denmark(技术、管理与经济学系,丹麦技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SemaPop通过引入人设表示作为生成条件,实现可控的人口合成,提升生成性能并保持统计一致性与样本多样性。

Comments Submitted to Transportation Research Part C: Emerging Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21461 2026-04-24 cs.CV cs.HC 67%

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21455 2026-04-24 cs.HC 67%

The Privacy Guardian Agent: Towards Trustworthy AI Privacy Agents

隐私守护代理:迈向可信AI隐私代理

Vincent Freiberger

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出隐私守护代理,通过用户资料和上下文感知自动化隐私同意选择,同时在不确定或高风险情况时通知用户,确保透明和用户自主权。

Comments Position paper for the CHI26 Workshop "Moving Beyond Clicks: Rethinking Consent and User Control in the Age of AI"

详情

展开后加载摘要…

URL PDF HTML 收藏