How People Evaluate AI-, Expert-, and Peer-Style Financial Advice
人们如何评估AI风格、专家风格和同行风格的金融建议
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过实验对比AI、专家、同行风格金融建议的评估差异,发现归属标注与沟通线索共同影响评估,错误标注会提升AI建议评分。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
人们如何评估AI风格、专家风格和同行风格的金融建议
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 通过实验对比AI、专家、同行风格金融建议的评估差异,发现归属标注与沟通线索共同影响评估,错误标注会提升AI建议评分。
DistillCache:基于KL引导的自适应KV缓存驱逐的内存高效大语言模型推理
机构 * Oklahoma State University(俄克拉荷马州立大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 DistillCache是一种强化学习框架,将KV缓存驱逐建模为序列决策问题,在25%缓存预算下,在LongBench上保留全缓存94.2%的准确率,优于多种基线方法,可提升推理吞吐量。
Comments 20 pages, 5 figures
超越表格:用于关系忠实的文档到数据库构建的Doc2DB-Bench
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对现有文档到表格基准无法适配关系数据库构建需求的问题,推出Doc2DB-Bench基准,含多领域长文档实例,为基于LLM的可靠数据系统提供测试平台。
Comments 24 pages, 13 figures, 7 tables
LatticeMind:面向多智能体系统的冲突感知记忆原语
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Shanghai AI Laboratory(上海人工智能实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Oxford(牛津大学)
专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出冲突感知记忆原语LatticeMind,解决多智能体LLM系统的主张信任决策问题,在ConflictBank评估中准确率达0.97,显著优于基线, ablation验证了其核心组件的重要性。
IntelliAudit:使用大语言模型评估审计控制
机构 * Coca-Cola(可口可乐公司) ; Telus(德达斯电信公司)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于检索的多智能体系统IntelliAudit,用于辅助IT审计证据评估,在ISO/IEC 27001上的评估显示其可支持审计工作,需作为决策支持工具使用。
HindsightBench:用于时间索引语言模型决策任务中参数后见之明的黑盒行为审计协议
机构 * University College Dublin(都柏林大学学院)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 研究针对大语言模型在金融决策任务中泄露参数知识的问题,提出HindsightBench黑盒行为审计协议,通过特定矩阵、探测及指标分析参数后见之明,应用于多模型获三个主要模式,揭示模型特性及审计结果与服务的关系,还发布相关数据。
Comments 17 pages, 3 figures. Code, panel, and per-model audit rows: https://github.com/Khaozhe/hindsightbench (v1.0 release archived at doi:10.5281/zenodo.21453191)
ColluSkill:用于规避智能体技能扫描器的对抗性跨技能组合
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 本研究提出ColluSkill攻击框架,可通过跨技能组合规避技能扫描器,攻击成功率达96.0%;还提出ChainGuard防御框架,能将攻击成功率降至22.5%,同时放行99.5%良性工作流。
Comments 9 pages, 3 figures, 4 tables
从相关性到执行效用:面向基于技能的大语言模型智能体的奖励感知动态执行门控
机构 * Tongji University(同济大学) ; The University of Sydney(悉尼大学) ; University of Science and Technology of China(中国科学技术大学) ; Nankai University(南开大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; City University of Hong Kong(香港城市大学) ; University of Surrey(萨里大学)
专题命中 规划推理 :verifier(abstract);分类 cs.AI
AI总结 针对基于技能的LLM智能体执行决策难题,提出RADEG轻量型决策层,通过学习代理模型预测执行效用,在288个rollout的评估中减少不必要执行并优于基线方法
探索、建图、记忆、决策:具身视觉语言模型是否已准备好应对安全关键场景?
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文扩展ToS框架为EMRD流程,评估VLMs在安全关键场景下的空间理解与决策能力,发现其决策依赖文本先验、空间推理受低光照影响,且记忆与人类认知存在根本差异,存在对齐风险。
HugSelect:一种用于基础模型选择的可解释多标准决策支持框架
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 HugSelect是用于基础模型选择的可解释多标准决策支持框架,构建含71274个模型的知识库,经多维度评估,推荐质量与商业系统相当,推理可追溯且实用直观。
Comments Pages: 29, Figures: 5. Corresponding authors: Alireza Joonbakhsh (alireza.joonbakhsh@hafez.shirazu.ac.ir) and Siamak Farshidi (siamak.farshidi@wur.nl)
SodaMem:面向大语言模型智能体的基于证据的时序图记忆
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对LLM智能体对话的时效性、来源追溯等问题,提出基于证据的时序图记忆SodaMem,在LongMemEval-S上以Flash级花费达到高准确率,性能优于部分高成本系统。
CausalNav:用于物理参数偏移下控制的可靠性可验证因果世界模型
机构 * University of Wollongong(卧龙岗大学) ; CSIRO’s Data61(联邦科学与工业研究组织Data61) ; Adelaide University(阿德莱德大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出CausalNav控制器,其结合因果转移图与多门控可靠性验证机制,在物理参数偏移的CartPole-v1和Pendulum-v1任务上,较9种基准取得最佳平均排名,关键在于经认证的弃权(不执行)提升了部署安全性。
面向多模态大语言模型的多分支策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Sichuan University(四川大学) ; Shanghai University(上海大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型统一信用分配的缺陷,提出MBPO框架,通过树结构与分支相对优势分配信用,结合时间回放缓冲区提升性能,在多模态推理基准上优于基线。
Comments 10 pages,8 figures
KumbhDoot:面向大规模集会公共服务助手的可扩展、大语言模型(LLM)限定架构
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对大壶节这类高风险低连接性的大规模集会,提出KumbhDoot架构,以相似度优先、LLM限定为核心,解决默认LLM助手成本高、易幻觉等问题,适配公共服务场景。
Agent-MD:用于有状态GCMC-MD模拟流程的带事件驱动升级机制的选择性大语言模型干预框架
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 Agent-MD框架将LLM推理选择性用于GCMC-MD分子模拟流程的构建与事件审查,结合确定性执行,在蒙脱石水蒸汽脱附模拟中完成多周期计算,识别问题并揭示体系依赖的低湿度响应,实现可复现的代理辅助分子模拟。
Comments 7 figures, 2 tables
端到端智能体审计引擎
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 针对智能体适配框架的系统化评估难题,本文提出A²E引擎,借助ATP协议实现任务快速集成,通过多维指标评估适配框架能力,实验表明模型-适配框架组合性能差异显著,为模型与适配框架协同演进提供指导。
从接口到推理:从任意阶模型中引出任意阶推理
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Harvard University(哈佛大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 该研究针对离散推理任务的任意阶推理需求,提出两种掩码扩散改进方法,训练对应模型验证了方法可诱导任意阶推理行为并提升下游性能。
通道卫士:安全模型无法组合成安全的多智能体系统
机构 * College of Engineering and Computer Science, University of Central Florida(工程与计算机科学学院,中央佛罗里达大学) ; Department of Computer Science and Engineering, North South University(计算机科学与工程系,北南大学) ; Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程,阿沙努拉科学与技术大学) ; Department of Electrical and Computer Engineering, Purdue University Fort Wayne(电气与计算机工程系,普渡大学弗拉特沃恩分校)
专题命中 规划推理 :verifier(abstract);分类 cs.AI
AI总结 研究多智能体大语言模型应用程序中智能体间通道安全问题,提出ChannelGuard深度防御框架,在通道设信息瓶颈门,通过文本与对抗短语库评分处理信息,能有效阻止工具中毒攻击,降低提示注入攻击成功率,保持准确率,白盒自适应释义可规避嵌入门。
展示TOFFEE:一个大规模合成数据代理轨迹的学习系统
机构 * Nanyang Technological University(南洋理工大学) ; Huawei(华为) ; Industrial and Commercial Bank of China Limited(中国工商银行)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 针对现有数据代理难以适应新环境的问题,提出TOFFEE系统,通过蒙特卡洛树搜索等方法,能从给定数据环境合成高质量数据代理轨迹,可用于监督微调与上下文学习,还展示了系统框架、界面及工作流程与应用场景。
Comments Accepted to VLDB 2026
OmniV2X:一种用于高效端到端协同驾驶的生成式基础规划器
机构 * Purdue University(普渡大学)
专题命中 规划推理 :planning(abstract);分类 cs.AI
AI总结 提出OmniV2X生成式基础模型,通过端到端监督训练和交叉注意力注入,利用多模态多智能体上下文实现高效协同驾驶,在DAIR-V2X-Seq数据集上以少于10%微调数据和1%通信带宽达到最优性能。
Comments Accepted to IROS 2026
当置信度误导时:扩散语言模型的后缀锚定与锚邻近置信度调制
机构 * RICS(智能研究学院) ; AIIS(人工智能研究所) ; IPAI(人工智能研究所) ; Department of Intelligence and Information(智能与信息系) ; Daegu Gyeongbuk Institute of Science and Technology(大邱庆州市科学技术院)
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 针对扩散语言模型中置信度误导导致生成不完整或过早解码的问题,提出后缀锚定与锚邻近置信度调制方法,无需训练即可提升完全非自回归解码性能。
Comments Preprint
超越LLM、稀疏分布式记忆和神经形态计算:一种用于超高速、超低功耗和低成本的超维SRAM-CAM“VaCoAl”
机构 * Hitotsubashi University(立命馆大学) ; Meisei University(立命馆大学) ; Shuhari System(Shuhari系统)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出VaCoAl算法,通过超维计算和伽罗瓦域扩散,在SRAM/DRAM-CAM上实现可逆、可审计的多跳推理,解决灾难性遗忘和绑定问题,并在维基数据上验证了其路径依赖的STDP式选择机制。
Comments 58 pages, 4 figure, 19 tables
从太空看SDG 6:利用卫星图像和自监督学习对非洲管道水和污水系统接入进行局部尺度监测
机构 * Mila – Quebec AI Institute(魁北克人工智能研究所) ; School of Computer Science, McGill University(麦吉尔大学计算机科学学院) ; Department of Earth and Environmental Engineering, Columbia University(哥伦比亚大学地球与环境工程系) ; Center for Learning the Earth with Artificial Intelligence and Physics (LEAP)(人工智能与物理学习地球中心(LEAP)) ; Division of Natural and Applied Sciences, Duke Kunshan University(杜克-昆山大学自然科学与应用科学系)
专题命中 规划推理 :planning(abstract);分类 cs.LG
AI总结 本研究利用Sentinel-2图像、Afrobarometer调查数据、30米人口数据和DINO自监督视觉Transformer特征,开发了一个可扩展的遥感框架,以约2.56公里分辨率估计管道水和污水系统接入情况,最佳模型AUROC分别达到91.54%和93.24%,与WHO/UNICEF JMP统计数据高度一致,并在尼日利亚案例中揭示了细粒度环境不平等。
Comments Under Review
StitchCUDA:一种基于规则的多智能体端到端GPU编程框架与基于代理的强化学习
机构 * Department of Computer Science\&Engineering, University of Minnesota-Twin Cities, Minnesota, USA ; Department of Electrical Engineering, University of Minnesota-Twin Cities, Minnesota, USA
专题命中 规划推理 :verifier(abstract);分类 cs.CL
AI总结 StitchCUDA通过基于规则的多智能体强化学习,实现了端到端GPU编程的高效生成与验证,显著提升了性能和准确性。
思考使大语言模型代理变得内向:强制性思考在用户参与代理中的反效果
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 本文研究了强制性思考在用户参与代理中的反效果,发现其导致性能下降,而主动透明性可提升代理性能。
Comments 26 pages, 5 figures, 7 tables
提示工程并不能普遍提升大型语言模型在临床决策任务中的性能
专题命中 规划推理 :reasoning(abstract);分类 cs.CL
AI总结 本研究发现提示工程对LLMs在临床决策任务中的性能提升具有高度依赖模型和任务的特性,强调了定制化策略的重要性。
VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解
机构 * Zhejiang University(浙江大学) ; Peking University(北京大学) ; Sun Yat-sen University(中山大学) ; CUHK(香港中文大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI
AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。
美国人工智能数据中心的环境与经济影响
专题命中 规划推理 :planning(abstract)
AI总结 本研究评估美国AI数据中心的环境与经济影响,发现其影响由电力等系统决定,需综合政策协调数据中心运营与资源规划以改善绩效。
迈向智能天空:低空无线网络的信号处理与人工智能基础
专题命中 规划推理 :planning(abstract)
AI总结 本教程从AI与信号处理视角,全面阐述低空无线网络(LAWN)的架构基础、信号处理与AI技术,结合案例分析其融合应用,指出未来发展挑战与机遇。
Comments Invited Overview Paper in JSTSP
FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索
机构 * Vietnamese-German University(越南-德国大学) ; Ho Chi Minh City University of Technology(胡志明市技术大学) ; University of Information Technology(信息技术大学) ; Ho Chi Minh city University of Science(胡志明市科学大学)
专题命中 规划推理 :reasoning(abstract)
AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。
Comments accepted to the ECCV 2026 AI City Challenge Workshop