Generalizing from a few environments in safety-critical reinforcement learning
专题命中 其他Agent :autonomous agent(abstract);分类 cs.AI、cs.LG
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
专题命中 其他Agent :autonomous agent(abstract);分类 cs.AI、cs.LG
专题命中 其他Agent :autonomous agent(abstract);分类 cs.AI、cs.CL
Journal ref Proceedings of AAAI Spring Symposium on Natural Language Generation in Spoken and Written Dialogue, Stanford, 2003
机构 * Arizona State University(亚利桑那州立大学) ; Kitware, Inc(Kitware公司) ; Columbia University(哥伦比亚大学)
专题命中 其他Agent :agentic(abstract);分类 cs.CL;AI agent(comments)
Comments Accepted as a paper at COLM 2025 Workshop on AI Agents: Capabilities and Safety
机构 * University of Warsaw(华沙大学)
专题命中 其他Agent :AI agent(abstract);分类 cs.AI;autonomous agent(comments)
Comments In proceedings of the 24th International Conference on Autonomous Agents and Multiagent Systems (AAMAS-2025), pages 1996--2005, May 19-23, Detroit, Michigan, USA
推理能力并不决定法律范围
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 本文探讨欧盟数字法中《人工智能法案》与GDPR对推理的不同界定,指出推理能力不决定法律范围,提出两层框架及组合效果测试等规则,为智能体架构下的相关监管提供解释方案。
一种保留人类赋能的公平AI目标: desiderata、设计及可能的行为后果
机构 * Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所)
专题命中 其他Agent :AI agent(abstract);分类 cs.AI
AI总结 本文设计了一种保留人类赋能的AI公平目标函数,通过公理化方法兼顾人类权力的不平等与风险规避,明确AI需赋能人类并管理人机权力平衡,还验证了其在典型场景的行为后果。
Comments Slightly extended version of paper accepted for Algorithmic Decision Theory 2026
视觉-语言模型中的源模态监控
机构 * Department of Computer Science, Brown University(布朗大学计算机科学系)
专题命中 其他Agent :agentic(abstract);分类 cs.CL
AI总结 研究探讨了多模态模型追踪并沟通信息来源的能力,分析了语法与语义信号在绑定提示词与输入组件中的作用,发现语义信号在模态分布差异大时更占主导。
Comments Accepted at COLM 2026. All resources will be available at https://github.com/ethahtz/source-modality-monitoring
专题命中 其他Agent :autonomous agent(abstract);分类 cs.AI
Comments Accepted manuscript: Robotics and Autonomous Systems [Elsevier]
SkillTFM:用于表格基础模型无训练适应的门控技能演化
专题命中 其他Agent :agentic(abstract);分类 cs.LG
AI总结 SkillTFM是一种无训练系统,通过可验证可扩展的技能库将表格基础模型的适应转向技能门控演化,在电价预测等任务中提升了AUC,且在不同骨干网络上均有效。
随机鹦鹉还是和谐合唱?测试五种领先的大语言模型在复制人类调查响应方面的能力
机构 * Centre for Global Sustainability, University of Oslo(全球可持续发展中心,奥斯陆大学) ; Peace Research Institute Oslo(奥斯陆和平研究所) ; American University of Sharjah(阿联酋沙迦美国大学)
专题命中 其他Agent :AI agent(abstract);分类 cs.AI
AI总结 本文比较了420名硅谷程序员和开发者的调查数据与五种大语言模型生成的合成数据,发现AI生成的数据在技术上合理但无法捕捉人类调查的非直观洞察,表明合成调查数据在组织研究中存在局限。
Comments V2
稀疏最小二乘中的条件数障碍
专题命中 其他Agent :agentic(abstract);分类 cs.LG
AI总结 该研究基于特定假设建立了稀疏最小二乘中受限条件数线性依赖的下界,证明不存在满足相关条件的随机多项式时间算法,且证明由Gemini智能体系统完成并经作者验证。
提示码本:面向语言模型指令精炼的离散组合优化
机构 * IIT Delhi(印度德里理工学院)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 提出Prompt Codebooks (PCO)框架,将自动提示优化重构为离散组合学习,通过可重用的自然语言本能单元实现实例级路由和结构化反馈,在多个基准上提升性能并压缩提示长度。
重新思考医学影像中的人工智能:假设、现实与重构
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 本文指出医学影像AI研究转化不足源于结构性错位,明确六大错位维度并提出重构路径,最终愿景是开发与医生对齐、扩展而非替代临床判断的智能体AI。
Comments 10 pages, 2 figures
Pramana:面向实证网络研究的可组合领域专用后端
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 本文提出面向实证网络研究的可组合领域专用后端Pramana,其通过单一意图规范实现跨载体运行,概念验证可满足34%的数据生成意图,为加速网络研究提供了支撑。
HALLELUAI:一个用于大规模超逼真图像到视频生成的幻觉感知人工智能系统
机构 * Expedia Group(亿客行集团)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 针对AI生成视频时质量控制难的问题,HALLELUAI系统集成视频调节与智能再生模块,能评估风险并迭代修复。经人工参与评估,该系统可输出超逼真视频,推动了可信AI视频内容发展,实现大规模图像到视频生成。
Comments 10 pages, 4 figures, 3 tables
用于时间决策的轨迹感知检索代理
机构 * Amazon(亚马逊)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 研究用大语言模型代理从长篇时间结构化文本中决策的问题,针对标准RAG丢弃时间结构缺陷,引入闭环代理框架TLM,其关键技术是LGCM,在医学问答、收益电话会议惊喜预测和隔夜股票缺口预测任务中表现出色。
即时计算:展望无人机计算的未来
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 报告设想无人机大规模运输货物等的未来,指出需弥合能力差距,确定了实现无人机技术变革潜力的十二个技术挑战及应对方法,为无人机技术发展规划了多方面的前进路径。
规范驱动开发作为人工智能原生企业软件工程的基础
专题命中 其他Agent :agentic(abstract);分类 cs.SE
AI总结 研究大语言模型和智能人工智能推动下软件工程范式转变,介绍规范驱动开发,提出规范治理参考模型,经评估能减少安全缺陷、缩短上市时间,证明企业软件需规范治理,vibe编码适用于构思和快速原型制作。
精度变化预测(PVP):增强语音识别系统对对抗攻击的鲁棒性
机构 * Faculty of Computer Science, Ruhr University Bochum, Germany(计算机科学系,博尔塔伦鲁尔大学)
专题命中 其他Agent :agentic(abstract);分类 cs.LG
AI总结 本文提出PVP方法,通过在推理过程中随机采样精度来提高ASR系统对对抗攻击的鲁棒性,并利用不同精度的输出进行对抗示例检测。
迈向自主工业系统的意图抽象层
专题命中 其他Agent :autonomous agent(abstract);分类 cs.AI
AI总结 针对自主工业系统中各子系统运行目标冲突难以及时发现的问题,提出意图抽象层(IAL),通过大型语言模型等将自然语言目标解析为结构化意图,检测并解释冲突,实现执行前意图级检查,保障协作自主系统行为。
超越趣味性:用于视觉数据分析的语义和上下文感知自然语言查询推荐
专题命中 其他Agent :agentic(abstract);分类 cs.CL
AI总结 针对分析师分解查询目标的挑战,研究用语义和上下文感知推荐增强自然语言接口,联合整合多种因素引导数据库探索,经多方式评估,QRec-NLI在代理比较和用户研究中表现优于基线。
Comments This is the preprint version of the paper accepted to Visual Informatics journal
相同的故事,不同的旅程:从社交媒体比较到人工智能介导的同伴职业探索中的意义建构
机构 * Sun Yat-sen University(中山大学)
专题命中 其他Agent :AI agent(abstract);分类 cs.AI
AI总结 研究针对年轻求职者在社交媒体职业探索时被动浏览的问题,开发JobMate交互式系统,将真实帖子转化为对话式AI代理,通过对比研究发现其能引导社会比较转向建设性自我重构并促进意义建构,还探讨了相关AI系统设计启示。
Comments 10 pages, 7 figures, 2 tables
智能体何时撒谎:重复博弈中的预谋、持续性与可利用性研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Vector Institute(向量研究所) ; University of Toronto(多伦多大学) ; EuroSafeAI
专题命中 其他Agent :autonomous agent(abstract);分类 cs.CL
AI总结 本文针对大语言模型智能体行动前公示意图的诚信问题,设计三阶段n人重复博弈协议,评测前沿模型,发现其偏离公示行为多属预谋,不同模型对公示的语义理解不兼容。
Comments Best Paper Award at ICML NExT-Game Workshop
识别组织中生成式人工智能的用例并确定其优先级:一个行业案例研究
专题命中 其他Agent :agentic(abstract);分类 cs.SE
AI总结 本研究以能源公司为例,通过半结构化访谈等收集数据,分析员工对人工智能采用的理解,确定其有用领域及引入方式,为能源行业人工智能应用提供概述及实施切入点,助力跨行业比较研究。
拒绝背后:通过行为监控确定护栏激活
机构 * Mindgard ; Lancaster University(兰卡斯特大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 提出首个黑盒护栏侦察方法,通过HTTP、词汇和时序信号行为监控检测AI系统中护栏的存在,准确率100%,并能区分护栏拦截与LLM拒绝。
Comments 19 pages, 13 figures, 4 tables
超越有监督澄清:基于LLM的输入重写用于对话篇章解析
专题命中 其他Agent :agentic(abstract);分类 cs.CL
AI总结 研究在无监督条件下利用LLM零样本或基于解析器反馈重写输入以提升对话篇章解析性能,发现重写常引入回归,提出选择性干预问题并识别可重写性预测为关键缺失能力。
Comments Accepted to SIGDIAL 2026. 17 pages, 2 figures
Fund2Persona:基于基金披露数据构建与精炼金融顾问角色的框架
机构 * UNIST(蔚山科学技术院) ; LinqAlpha ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Florida(佛罗里达大学) ; Blackstone(黑石集团) ; Hanwha Life(韩华生命)
专题命中 其他Agent :agentic(abstract);分类 cs.CL
AI总结 提出Fund2Persona框架,利用基金披露、持仓变动、市场背景和管理人评论构建金融顾问角色,并通过智能体循环精炼,在持仓重建和管理人评论对齐任务上优于通用基线,生成更具体有用的建议。
Comments 17 pages, 5 figures, 12 tables
公共管理中AI系统的技术类型学
机构 * University of Oxford(牛津大学) ; Hertie School(赫蒂学院) ; Utrecht University(乌得勒支大学) ; Harvard University(哈佛大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 针对公共管理研究将AI视为单一类别的问题,提出五类AI系统类型学(手编、玻璃箱、黑箱、通用、代理系统),通过分析91篇高引论文发现技术精度不足,并给出改进建议。
Comments Under Review
LLMs中的一致性困境:生成器-评估器一致性与对错误的脆弱性
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 提出生成器-评估器自一致性度量,发现模型自一致性越高,在临床环境中对已验证错误的脆弱性越大,揭示LLMs中的一致性困境。
参数化技能
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学) ; KTH Royal Institute of Technology(皇家理工学院) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 其他Agent :agentic(abstract);分类 cs.CL
AI总结 提出ParametricSkills框架,将文本技能在测试时转换为LoRA参数,解决长上下文下技能指令难以遵循的问题,在软件工程任务中平均提升6.44分。
Comments Preprint, Under Review