RepoRescue: An Empirical Study of LLM Agents on Whole-Repository Compatibility Rescue
RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
RepoRescue: LLM智能体在全仓库兼容性修复上的实证研究
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 研究LLM智能体能否自动修复因环境演化而失效的旧仓库,提出RepoRescue基准,包含315个仓库,评估多种智能体系统,发现跨文件协调是主要难点,且系统间互补性显著。
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
机构 * KR Labs(KR实验室) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; McGill University(麦吉尔大学) ; TU Wien(维也纳工业大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 提出一个统一的跨度级幻觉检测基准,涵盖代码、工具输出、结构化文档和自然语言RAG数据,通过微调Qwen3.5-2B模型在跨域场景下显著优于现有方法。
Comments 8 pages
Antaeus: 通过上下文锚定的LLM推理发现仓库级逻辑漏洞
专题命中 软件智能体 :agentic(abstract)
AI总结 提出Antaeus框架,通过仓库级代码上下文锚定LLM推理,结合函数优先级排序、上下文推理、比较验证和结构化报告,有效检测逻辑漏洞,在28个仓库中检测出15个漏洞,优于基线方法。
联邦主权传输协议 (FSTP):无需披露的可验证协调
专题命中 软件智能体 :agent(abstract)
AI总结 提出联邦主权传输协议 (FSTP),通过编译时类型系统强制数据隔离、上下文无关身份模型和基于Blocklace的事件日志,实现无需暴露内部数据的可验证联邦协调。
Comments 26 pages, 4 figures, 3 tables. Reference implementation in Rust (fstp-core). Protocol specification and code to be linked from GitHub release v0.1.0 upon announcement
代码语义缩放
专题命中 软件智能体 :agent(abstract)
AI总结 提出基于伪代码的CodeZoom方法,通过多层语义抽象迭代探索、理解和优化代码,在用户研究中相比Claude Code显著提升代码理解与控制感。
DigitalCoach:人类与智能体计算机使用辅导中的沟通与基础差距
机构 * University of California, Berkeley(加州大学伯克利分校) ; Technical University of Munich(慕尼黑工业大学)
专题命中 GUI与网页智能体 :agentic(title);分类 cs.AI、cs.CL
AI总结 提出DigitalCoach数据集,包含72次人机辅导会话,评估模型在计算机使用教学中的表现,发现模型在解释、错误诊断和视觉基础方面存在不足。
Xiaomi-GUI-0 技术报告
专题命中 GUI与网页智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出Xiaomi-GUI-0,一种在真实移动设备上训练和评估的原生多模态GUI智能体,通过真实设备主导的混合基础设施、多源训练数据和渐进式三阶段训练,在真实任务中实现72.0%成功率,显著提升执行稳定性和异常状态识别。
面向长时程移动GUI代理的任务状态表示
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; School of Software, Beihang University(北京航空航天大学软件学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 提出任务状态表示(TSR)框架,通过解耦任务状态与屏幕观察,解决长时程移动GUI代理的上下文负担问题,在复杂跨应用任务中成功率提升最高12个百分点。
Comments Preprint. 9 pages, 3 figures
SlowBA:针对基于VLM的GUI代理的高效后门攻击
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)
专题命中 GUI与网页智能体 :agent(abstract);分类 cs.CL
AI总结 提出SlowBA后门攻击,通过强化学习注入触发模式,诱导VLM-based GUI代理产生冗长推理链,显著增加响应延迟,同时保持任务准确性。
Comments Accepted by ECCV 2026. Codes and supplementary materials are in https://github.com/tu-tuing/SlowBA
基于克里金稀疏测量与障碍推断的智慧港口移动基站定位
专题命中 GUI与网页智能体 :workflow(abstract)
AI总结 提出DOCKING框架,利用普通克里金法重建无线环境图并推断障碍物模型,实现移动集成接入与回传部署优化,在稀疏测量下达到高精度与容量增益。
Comments 15 pages, 14 figures. Submitted to IEEE Open Journal of the Communications Society
可对话的复杂性:作为可解释基质的智能体LLM集体
机构 * IT University of Copenhagen(哥本哈根信息技术大学) ; University of Oslo(奥斯陆大学) ; Østfold University of Applied Sciences(东福尔应用科学大学) ; Sakana AI
专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.CL
AI总结 本文提出将智能体大语言模型集体作为人工生命研究的计算基质,利用自然语言通信实现可解释性,并综述了相关实例。
AutoMem:自动化学习记忆作为认知技能
机构 * Stanford University(斯坦福大学)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出AutoMem框架,通过双循环自动优化LLM的记忆管理结构和使用能力,在长时域任务中提升性能约2-4倍。
Comments Project Website: https://autolearnmem.github.io/
NeuroFilter: 基于激活的隐私意识LLM智能体防护栏
机构 * University of Virginia(弗吉尼亚大学)
专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL
AI总结 提出基于激活探测的隐私过滤器,高效检测LLM智能体在单轮和多轮对话中的不当信息泄露,首次系统研究对话轨迹中的模型内部状态变化。
通过迭代元反射实现自主科学发现
机构 * University of Edinburgh(爱丁堡大学) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 记忆与上下文管理 :tool use(abstract);分类 cs.AI
AI总结 提出DiscoPER框架,利用大语言模型进行开放式的自主科学发现,通过动态代码生成、统计检验和二阶推理机制,在iNatDisco基准上以72.7%假设支持率恢复8/9已知模式。
TRACE:面向对话数据的时间证据图状态感知查询处理
机构 * Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学香港人工智能科学研究院) ; Independent Researcher(独立研究者) ; Central South University(中南大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.CL
AI总结 提出TRACE框架,通过构建时间证据图并维护有效性标注,实现对话数据中状态感知的查询处理,提升时间推理和多跳推理能力。
ManimAgent: 用于视觉教育的自进化多模态智能体
机构 * University of Alberta(阿尔伯塔大学) ; Southeast University(东南大学) ; Virginia Tech(弗吉尼亚理工学院) ; Xidian University(西安电子科技大学) ; Vivavia Inc(Vivavia公司)
专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI
AI总结 提出ManimAgent,通过双通道情节记忆库跨任务传递反思经验,无需权重更新或人工种子,在代码生成任务中提升通过率并减少反思轮次。
Comments Project page: https://manimagent.github.io/. Code: https://github.com/jwj1342/Paper2Manim
双模式随机振荡器的同步与集群
专题命中 记忆与上下文管理 :agent(abstract)
AI总结 研究提出一种新型智能体模型,通过空间与内部状态的双向耦合,发现七种形态及量化拓扑吸引子,并推导出宏观标度律,为自主机器人集群设计提供框架。
Comments 9 pages, 4 figures
利用基于LLM的代理系统生成量子应用以优化测试
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.SE
AI总结 提出QPipe,一种基于大语言模型的多代理架构,自动将自然语言需求转化为可执行的量子应用工作流,在测试优化问题上实现高编译率和执行率。
注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps
专题命中 Agent评测 :agent(title,abstract);分类 cs.SE
AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。
GameDevBench: 通过游戏开发评估智能体能力
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI、cs.CL、cs.SE
AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。
技能并非孤岛:衡量智能体技能供应链中的依赖性与风险
机构 * Peking University(北京大学) ; Zhongguancun Laboratory(中关村实验室)
专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE
AI总结 提出智能体技能供应链(ASSC)概念,设计SkillDepAnalyzer工具从自然语言中提取依赖关系,在超143万技能上揭示四种结构模式和安全风险,建议类型化依赖清单和风险预警审计。
映射评估前沿:跨11种评估器-智能体条件的偏差-可靠性权衡的实证调查
专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL、cs.LG
AI总结 通过扩展至11种评估条件,实证验证了LLM评估系统中评估器耦合、策略多样性与小样本测量可靠性之间的权衡,并发布了标准化基准数据集。
Comments 5 pages, 1 figure, 1 table
连续知识代谢:从演进文献中生成科学假设
机构 * Tsingyuai(清华院)
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL
AI总结 本文提出CKM框架,通过滑动时间窗口处理文献并动态更新知识库,提出CKM-Lite和CKM-Full两种变体,揭示了增量处理在预测和效率上的优势,以及知识变化对假设生成的影响。
Comments ICML 2026 AI4Research Workshop
AGI Maze:作为世界建模智能体的基准框架
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 提出AGI Maze框架,通过部分可观测网格迷宫任务评估LLM构建世界状态表示的能力,发现标准LLM在推理时无法内部表示迷宫,即使借助工作记忆也难以可靠求解。
超越专家用户:智能体应帮助用户构建偏好,而不仅仅是引出偏好
机构 * Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本文提出用户通常不具备完整偏好,智能体应通过示例或解释帮助用户学习领域知识以构建偏好,并基于信息经济学引入CoPref模型,在推荐系统中通过CoShop基准测试发现现有智能体表现不佳。
Comments Update URLs
人类与机器在生成式元学习中的协作:模型与算法
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) ; Centre for Machine intelligence, University of Sheffield(谢菲尔德大学机器智能中心) ; ELLIS Institute Finland(芬兰ELLIS研究所) ; Department of Computer Science, Aalto University(阿尔托大学计算机科学系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出生成式元学习与人类反馈框架,通过专家直觉引导数据合成,利用条件神经ODE和强化学习迭代优化生成轨迹,理论证明分布对齐降低泛化误差,实验验证在分布偏移下提升鲁棒性。
LLM引导的ODE发现与小群体聚合数据的参数推断
机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) ; Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) ; Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。
行为自适应对话代理:迈向流动人格框架
机构 * Northeastern University(东北大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出流动人格框架,根据任务上下文、用户目标和情境紧迫性,动态调整代理的隐喻角色和人格表达强度,以提升用户信任和体验。
Comments Presented at Bridging AI and Behavior Change, a Bridge Program organized at the AAAI Conference on Artificial Intelligence 2026 (AAAI-2026)
FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; The University of Tokyo(东京大学) ; McGill University(麦吉尔大学) ; The Fin AI(Fin AI公司) ; Kyoto University(京都大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。
Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench
WorkBench 再探:两年后的工作场所智能体
机构 * Independent researcher(独立研究者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文重新评估2024至2026年间WorkBench基准上智能体的进展,发现前沿模型在能力和安全性上均有显著提升,但开放权重模型降低了高性能门槛。
Comments 8 pages, 3 figures. Follow-up to arXiv:2405.00823