arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 334
2607.22671 2026-07-28 cs.AI 新提交

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

AIR-BENCH Live:基础模型不断演进的安全基准测试

Rohan Naphade, Minzhou Pan, Bo Li

机构 * Virtue AI(美德人工智能公司) Carnegie Mellon University(卡内基梅隆大学) Northeastern University(东北大学) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究针对基础模型安全基准测试随模型和法规发展而不足的问题,提出AIR-BENCH Live,通过自动化更新管道和多智能体算法更新提示,扩展了基准测试风险数量,评估模型发现安全范围广等结果,使其能随领域发展。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22489 2026-07-27 cs.LG cs.AI 新提交

\k{appa}-LoRA: Condition Numbers Reveal Which LoRA Matrices Worth Updating

κ-LoRA:条件数揭示哪些LoRA矩阵值得更新

Jianghui Wang, Silong Yong, Francesco Orabona, Marco Canini, Katia P. Sycara, Yaqi Xie

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究指出LoRA统一更新矩阵计算成本高,条件数大的矩阵对性能提升贡献大。提出κ-LoRA方法,聚焦更新条件数大的矩阵,可减半可训练参数数量,降低计算和内存成本,实验证明其能缩短微调时间、降低内存成本且不影响精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21839 2026-07-27 cs.CR cs.LG 新提交

Certified in Theory, Broken in Practice: Assumption Gaps in Cryptographic Model Certification

理论上可认证,实践中却被破解:密码学模型认证中的假设差距

Carter Luck, Olive Franzese-McLaughlin, Elisaweta Masserova, Akira Takahashi, Antigoni Polychroniadou, Nicolas Papernot

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Vector Institute & University of Toronto(向量研究所及多伦多大学) Carnegie Mellon University(卡内基梅隆大学) J.P.Morgan AI Research & AlgoCRYPT CoE(摩根大通人工智能研究及AlgoCRYPT中心) University of Toronto(多伦多大学)

AI总结 研究密码学模型认证中现有安全定义与实际应用的差距,通过精心设计训练数据可攻击相关认证方案。为此形式化严格安全概念,引入通用协议模板,为设计安全隐私保护的机器学习审计协议提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21655 2026-07-27 cs.RO cs.CL 新提交

Progress Reward Modeling for Robotic Learning: A Comprehensive Survey

机器人学习中的进度奖励建模:全面综述

Jianshu Zhang, Keliang Wu, Haoran Lu, Anbang Liu, Ce Zhang, Weijie Yin, Chengxuan Qian, Xiyuan Yang, Zhenyu Pan, Guo Ye, Han Liu

机构 * Northwestern University(西北大学) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California, Santa Barbara(加利福尼亚大学圣塔芭芭拉分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 该综述针对机器人学习中进度奖励建模缺乏共享框架的问题,分三步组织领域研究,包括研究进度模型接口、构建信号方法及支持数据基准,将模型相关要点联系起来,还总结了局限并探讨未来方向。

Comments Project page: https://github.com/sterzhang/Awesome-Progress-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21635 2026-07-27 cs.LG 新提交

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

面向时间干预下个人语言模型代理的用户条件评估

Pin Qian, Su Wang, Yihang Chen, Qiaolin Yu, Xiaoyuan Wang, Zhitong Guo, Zhicheng Wang, Junxian You

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) University of Glasgow(格拉斯哥大学)

AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。

Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21552 2026-07-24 cs.AI cs.LG 新提交

MIRROR: Learning from the Other View for Multi-Modal Reasoning

MIRROR:从其他视角学习以进行多模态推理

Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20723 2026-07-24 cs.CR cs.LG 新提交

Leaky Language Models: Stealing Architecture and Inference Optimizations via Per-Token Timing

泄漏语言模型:通过逐令牌计时窃取架构和推理优化

Sadegh Majidi, Niloofar Mireshghallah, Kazem Taram

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究通过LeakyLMs攻击从生产语言模型中窃取信息,利用令牌生成时间推断关键细节。核心方法是构建令牌生成时间模型,可针对推理优化和部署策略及恢复架构属性。主要贡献是能有效窃取模型、架构和部署信息,实验效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20372 2026-07-23 cs.CL 新提交

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

给自己的笔记:大语言模型能从经验抽象中受益吗?

Chang Liu, Xinyu Li, Artur Dubrawski

机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)

AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19954 2026-07-23 cs.CL 新提交

A Multi-Dimensional Evaluation of Explainability in Media Bias Detection

媒体偏见检测中可解释性的多维评估

Ting Chen, Raina Zhang, Benjamin M. Ampel, Sagar Samtani

机构 * Carnegie Mellon University(卡内基梅隆大学) Indiana University(印第安纳大学) Georgia State University(佐治亚州立大学)

AI总结 研究媒体偏见检测中可解释性,以BABE数据集对BERT和RoBERTa沿预测性能、解释合理性、机制忠实性三个轴评估,还研究注意力监督微调,发现不同架构在这些方面有差异,三者应分别评估。

Comments 12 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19432 2026-07-23 cs.CR cs.AI 新提交

ChainWatch: A Kill Chain-Aligned Sequential Detection Framework for Multi-Step Attacks in MCP-Based AI Agent Systems

ChainWatch:基于杀伤链的顺序检测框架,用于基于MCP的人工智能代理系统中的多步攻击

Om Narayan, Rashmi Jyoti, Ramkinker Singh

机构 * Computer Science New York University New York, USA(计算机科学 新 York 大学 新 York 美国) Cybersecurity University of Maryland, College Park MD, USA(网络安全 美国马里兰大学College Park分校 MD 美国) Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学 彭博 美国)

AI总结 针对基于MCP的人工智能代理系统中现有防御无法可靠检测多步攻击的问题,提出ChainWatch框架,用六阶段杀伤链建模攻击进展,结合隐马尔可夫模型分类工具调用序列,能检测逃避传统机制的攻击链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19367 2026-07-23 cs.AI 新提交

Rethinking Uncertainty Evaluation in Large Language Models

重新思考大语言模型中的不确定性评估

Krish Matta, Atharv Naphade, Andy Zou

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

AI总结 研究大语言模型中置信度评估问题,指出校准标准不充分。沿结构连贯性、忠实性和有用性三个轴形式化条件为C1指标,发现常用估计器违反条件,RLHF等未恢复连贯性,框架可测度与弥合差距。

Comments 19 pages, 11 figures, ICML 2026 EIML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18539 2026-07-22 cs.CV 新提交

AniGS: Bridging Rendering and Diffusion Prior for 3D Scene Animation

AniGS:弥合3D场景动画的渲染与扩散先验

Yen-Chi Cheng, Chen Gao, Chuhan Chen, Tuotuo Li, Rajvi Shah, Ayush Saraf, Changil Kim, Liangyan Gui, Alexander Schwing, Johannes Kopf, Hung-Yu Tseng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Waymo(Waymo公司) Carnegie Mellon University(卡内基梅隆大学) Meta

AI总结 AniGS旨在为3DGS重建的大型场景添加动画,用规范3DGS表示场景,借时间条件变形场建模运动,利用预训练视频扩散模型及迭代更新策略,防止静态区域运动伪影,实验证明该方法能产生自然动态和高质量新视图视频。

Comments Preprint. Project page: https://yccyenchicheng.github.io/AniGS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18424 2026-07-22 cs.CY cs.CL 新提交

Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps

实现多语言隐私政策审计:对西班牙移动应用的大规模分析

Marcos Moran, David Rodriguez, Luka Nenadic, Norman Sadeh, Jose M. Del Alamo

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究多语言环境下隐私政策审计,利用大语言模型构建跨语言分类器,通过对西班牙谷歌应用商店应用的大规模审计,发现公共部门与商业应用语言使用差异及声明与实际做法的差异,揭示仅英语审计掩盖透明度差距的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18362 2026-07-22 cs.RO 新提交

FARO: Feasibility-Aware Robot Motion Optimization

FARO:可行性感知机器人运动优化

Michal Ciebielski, Shafeef Omar, Aaron Johnson, Majid Khadiv

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) Institute for Advanced Study, Technical University of Munich(慕尼黑工业大学高级研究所) Carnegie Mellon University(卡内基梅隆大学) SIEMENS AG(西门子公司) Huawei-TUM joint laboratory(华为-慕尼黑工业大学联合实验室)

AI总结 针对机器人在未知场景快速规划新行为的挑战,提出嵌套运动动力学框架,结合可行性引导树搜索和大语言模型采样策略,能改善搜索过程,生成的轨迹可用强化学习控制器跟踪,质量高可用于实际运动操作场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18253 2026-07-22 cs.AI 新提交

Beyond Accuracy and Cost: Latency-Aware LLM Query Routing for Dynamic Workloads

超越准确性和成本:针对动态工作负载的延迟感知大语言模型查询路由

Shivam Patel, Akaash R. Parthasarathy, Ankur Mallick, Gauri Joshi

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软)

AI总结 研究针对动态工作负载的大语言模型查询路由,设计轻量级延迟估计器,纳入延迟感知路由器,联合优化延迟、准确性和成本,实验表明该方法能在保持延迟的同时提升准确性 - 成本效用达40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18142 2026-07-21 cs.CV cs.AI cs.CL cs.MA 新提交

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测

Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Griffith University(格里菲斯大学)

AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17984 2026-07-21 cs.RO 新提交

Distilling Global Traversability Priors for Image-based Affordance Prediction in Off-road Environments

用于越野环境中基于图像的可承受性预测的全局可通行性先验知识提炼

Matthew Sivaprakasam, Samuel Triest, Micah Nye, Deegan Atha, Shehryar Khattak, David Fan, Wenshan Wang, Sebastian Scherer

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Field AI(现场人工智能公司)

AI总结 研究非结构化地形长距离自主导航易短视问题,利用卫星图像计算导航路径监督网络,直接从FPV图像提取远距离可通行性感知边界,提升长距离越野导航性能,减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17946 2026-07-21 cs.LG cs.AI 新提交

A Geometric Perspective on Stabilizing Value Conflict Resolution

稳定价值冲突解决的几何视角

Saket Reddy, Andy Liu

机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。

Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17399 2026-07-21 cs.CV 新提交

The PanAf-SBR Dataset: Social Behaviour Recognition for Wild Great Apes

泛非社会行为识别数据集:野生大猩猩的社会行为识别

Maciej Braszczok, Otto Brookes, Xiaoxuan Ma, Federico Rossano, Yixin Zhu, Mimi Arandjelovic, Hjalmar Kühl, Majid Mirmehdi, Tilo Burghardt

机构 * University of Bristol(布里斯托大学) Wild Chimpanzee Foundation(野生黑猩猩基金会) Carnegie Mellon University(卡内基梅隆大学) University of California(加利福尼亚大学) Peking University(北京大学) Max Planck Institute for Evolutionary Anthropology(马克斯·普朗克进化人类学研究所) Senckenberg Museum of Natural History(森肯伯格自然历史博物馆)

AI总结 研究旨在解决野生大猩猩社会行为识别数据不足问题,引入PanAf-SBR数据集,结合AlphaChimp架构建立基准,通过双向迁移学习实验发现跨数据集预训练对特定类别有益,还研究了背景上下文在其中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16946 2026-07-21 cs.GR cs.CV 新提交

Points as Tori: Fast Pointwise Signed Distance for Point Clouds

点作为环面:用于点云的快速逐点符号距离

Nicole Feng, Ioannis Gkioulekas, Keenan Crane

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究提出一种计算点云符号距离的方法,通过用环面局部拟合点云,利用预训练网络输出参数,无需全局优化和空间离散化且易并行化,基于新理论统一相关方法,可直接用于点云应用,无需显式重建。

Comments Published in ACM Transactions on Graphics, volume 45 (2026). For associated presentations and code, see https://nzfeng.github.io/research/PointsAsTori

Journal ref ACM Transactions on Graphics, volume 45 (2026), article number 53

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16324 2026-07-21 cs.CV cs.LG 新提交

SGMCE: Segment-Grounded Morphological Concept Explanation for Malaria Parasite Species Identification in Thick Blood Smears

SGMCE:厚血涂片疟原虫物种识别的基于片段的形态学概念解释

Ahmed Tahiru Issah, Charles B. Delahunt, Carine Mukamakuza

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

AI总结 研究旨在解决厚血涂片疟原虫物种识别中深度学习缺乏形态学证据的问题,提出SGMCE框架,无需额外训练等,通过提取特征、查询GPT-4o生成自然语言解释,经多指标验证,在多种检测中取得较好结果。

Comments Accepted for publication in the 30th Conference on Medical Image Understanding and Analysis (MIUA 2026), Dublin. To appear in Springer Lecture Notes in Computer Science (LNCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15565 2026-07-20 cs.CV cs.AI cs.LG eess.IV 新提交

Ask Twice, Look Twice: Prompt Echoing Resolves the Question-First Paradox in Vision-Language Models

问两次,看两次:提示回声解决视觉语言模型中的问题优先悖论

Rakshanda Hassan Abhinandan, John Galeotti, Deva Ramanan, Gautam Rajendrakumar Gare

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究视觉语言模型中问题优先提示的悖论,发现问题前置虽能引导感知但后续答案生成阶段难关注到问题。提出问题回声方法,即在图像两侧重复问题,解决了悖论,在多基准测试中表现出色且无需训练等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15532 2026-07-20 cs.AI math.OC 新提交

Logic, Optimization, and Artificial Intelligence

逻辑、优化与人工智能

J. N. Hooker

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 探讨逻辑与优化结合对基于规则的人工智能的贡献,综述二者合作的多个领域,介绍利用决策图等计算投影、用最优性后分析增强透明度及优化在相关编程中的作用,并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14818 2026-07-17 cs.LO cs.AI 新提交

Can LLMs Build a MaxSAT Solver from Papers? The CoreForge Experience

大语言模型能否根据论文构建最大可满足性求解器?CoreForge 经验

Ruben Martins

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究利用大语言模型从论文构建无权重 MaxSAT 求解器,采用结合论文讨论、代码实现及审核修订的迭代流程,评估特定配置,发现虽未现错误答案,但性能低于手工设计求解器,总结了相关经验教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14579 2026-07-17 cs.HC cs.CV 新提交

Skeleton: Visual Authoring of Non-visual Data Experiences

Skeleton:非视觉数据体验的可视化创作

Frank Elavsky, Chieri Nnadozie, Lucas Nadolskis, Patrick Carrington, Dominik Moritz

机构 * Carnegie Mellon University(卡内基梅隆大学) UC Santa Barbara(加州大学圣巴巴拉分校)

AI总结 研究非视觉数据体验可视化创作问题,提出Skeleton直接操作创作环境,含Inspector、Dimensions API等技术,经对8名从业者实地研究评估,其使导航结构可见,改变从业者可访问设计方式。

Comments 9 pages core, 2 pages acknowledgements + references, 4 pages appendices. Accepted at IEEE VIS 2026, to appear in November 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14475 2026-07-17 cs.CE cs.LG 新提交

One-Shot Generative Design for Disordered Metamaterials via Self-Organizing Neural Cellular Automata

通过自组织神经细胞自动机实现无序超材料的一次性生成设计

Yujie Xiang, Liwei Wang

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

AI总结 研究针对无序超材料设计难题,提出基于神经细胞自动机的生成设计框架,仅需单个训练模板,能生成多样微观结构并适应不同域,通过操纵局部规则实现特定性能控制,在多尺度机械隐身设计中验证了其有效性,为相关领域提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14346 2026-07-17 cs.LG stat.ME 新提交

Learning Who to Treat When Treatment is Missing

当治疗数据缺失时学习治疗对象

Johnna Sundberg, Rayid Ghani, Eli Ben-Michael, Edward Kennedy

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究在治疗数据缺失时的策略学习问题,通过扩展有效估计器到MAR和MCCAR数据下的策略值及CATE估计,经渐近效率分析和实验验证,证明MAR估计器更优,为从业者提供稳健策略学习工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14240 2026-07-17 cs.AI 新提交

Align AI to Dynamic Human-AI Workflows

将人工智能与动态人机工作流程对齐

Valerie Chen, Cleotilde Gonzalez, Anita Williams Woolley, Michael Lee, Tongshuang Wu, Vincent Conitzer, Aarti Singh

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California Irvine(加州大学欧文分校)

AI总结 研究现实世界中人类与人工智能交互的动态本质,主张从静态模拟对齐转向交互式互补对齐,通过对比现有对齐与轨迹级视图形式化差距,借鉴多学科见解指出挑战,最后概述开发与人类交互对齐的人工智能系统的研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14293 2026-07-17 quant-ph cs.LG 新提交

Real-Time Detection of Charge Jumps in Superconducting Qubits with a Convolutional Neural Network

用卷积神经网络实时检测超导量子比特中的电荷跳跃

Daniel Gaytan-Villarreal, Peter Meiring, Daniel Baxter, Daniel Bowring, Grace Bratrud, Matteo Cremonesi, Giuseppe Di Guglielmo, Grace Wagner, Bowen Xiao

机构 * Department of Physics, Carnegie Mellon University, Pittsburgh, PA 15213, USA Quantum Division, Fermi National Accelerator Laboratory, Batavia, IL 60510, USA Department of Physics \& Astronomy, Northwestern University, Evanston, IL 60208, USA Fermi National Accelerator Laboratory, Batavia, IL 60510, USA

AI总结 研究超导量子比特中电荷跳跃检测问题,提出基于扩张因果卷积神经网络的在线探测器,经训练和量化后在特定平台达到低延迟,检测效率与离线算法匹配且无需超参数调整,推动电荷跳跃检测用于量子计算误差缓解等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13602 2026-07-16 cs.CL cs.LG stat.ML 新提交

Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis

类比深度研究:检索和整合历史类比以进行前瞻性分析

Yongqiang Chen, Guangyi Chen, Yuewen Sun, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究提出类比深度研究(ADR)任务及ADR-bench,发现LLM智能体找类比能力差。基于理论分析提出ADR原则,构建因果类比研究者(CANA)框架,提升历史类比生成效果,超越现有智能体,案例研究证实其利用历史类比的有效性。

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏