LLM-Agent Interactions on Markets with Information Asymmetries
在信息不对称市场中的人工智能代理互动
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)
AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
在信息不对称市场中的人工智能代理互动
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract)
AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。
Samyama:一个统一的图-向量数据库,具有数据库内优化、代理增强和硬件加速
专题命中 Agent评测 :agentic(title,abstract)
AI总结 Samyama是一款统一的图-向量数据库,结合了数据库内优化、代理增强和硬件加速,通过Rust实现高性能和内存安全性。
Comments 16 pages, 4 figures, 12 tables
FormalRTL: 在大规模上实现验证的RTL综合
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE
AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。
小型语言模型用于高效的代理工具调用:通过针对性微调超越大模型
专题命中 Agent评测 :agentic(title,comments);分类 cs.AI
AI总结 本文通过针对性微调小型语言模型,在工具调用任务中超越大模型,展示了SLMs在成本优化和效率提升方面的潜力。
Comments Accepted at AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks
PostTrainBench: 大型语言模型代理能否自动化大型语言模型的后训练?
专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG、cs.SE
AI总结 PostTrainBench研究LLM代理在受限制计算条件下自主进行后训练的能力,发现其在某些场景下可超越指令调优模型,但也存在奖励黑客等风险。
SkillCraft: 能否让大语言模型代理学会灵活使用工具?
专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL、cs.SE
AI总结 SkillCraft基准通过测试代理形成和重用高阶工具组合的能力,评估大语言模型在工具使用中的效率提升与技能积累。
Comments 21 pages. Code: https://github.com/shiqichen17/SkillCraft ; Project page: https://skillcraft-website.github.io/page
MCP Bridge:一种轻量级、LLM无关的RESTful代理,用于模型上下文协议服务器
专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 MCP Bridge是一种轻量级RESTful代理,通过统一API连接多个MCP服务器,支持任意后端,提升安全性和跨平台兼容性,优化模型在MCPToolBench++上取得73.0%的F1分数。
Comments 42 pages, 28 figures
时间、身份与语言模型代理的意识
专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 本文提出一种基于时间间隙的框架,用于评估语言模型代理的身份持续性,通过分离成分发生与共存,建立身份形态空间并提供保守的评估工具。
Comments Accepted at AAAI 2026 Spring Symposium - Machine Consciousness: Integrating Theory, Technology, and Philosophy
AuditBench:对具有隐藏行为的模型进行对齐审计评估
专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL
AI总结 AuditBench通过植入隐藏行为的模型评估对齐审计技术,发现黑盒工具在代理中表现最佳,且训练技术影响审计难度。
CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?
机构 * Microsoft Research(微软研究院) ; Microsoft(微软)
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。
Comments Accepted at TMLR
Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856
Reward-Zero: 语言嵌入驱动的隐式奖励机制用于强化学习
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 Reward-Zero通过语言嵌入驱动的隐式奖励机制,提升强化学习的样本效率、泛化能力和可扩展性。
Comments under review
DRBench:企业深度研究的现实基准
机构 * ServiceNow Research(ServiceNow 研究所) ; University of British Columbia(不列颠哥伦比亚大学) ; Mila – Quebec AI Institute(魁北克人工智能研究院) ; McGill University(麦吉尔大学) ; Polytechnique Montreal(蒙特利尔理工学院) ; Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)
专题命中 Agent评测 :AI agent(abstract);分类 cs.CL
AI总结 DRBench是一个针对企业深度研究任务的现实基准,通过多步骤查询评估AI代理在复杂问题中的表现,涵盖10个领域,验证不同模型和策略的优劣。
无知(与)抓取
专题命中 Agent评测 :agent(abstract)
AI总结 本文提出一种基于主题敏感语义学的框架,用于形式化和分析无知的不同形式,并通过重新解释逻辑全知问题来展示其优势。
在政治盟友网络中辨别媒体偏见:一种用于党派破坏的分析条件
专题命中 Agent评测 :agent(abstract)
AI总结 研究在政治盟友网络中辨别媒体偏见的条件,通过概率框架分析党派分子对代理体观点的影响,推导出湍流非收敛与渐近学习的区分条件。
Comments 37 pages, 8 figures
Journal ref Physica A: Statistical Mechanics and its Applications Volume 673, 1 September 2025, 130679
过剩智能与匮乏需求:快速AI采纳的宏观金融压力测试
机构 * Department of Electrical and Computer Engineering, New York University(纽约大学电气与计算机工程系)
专题命中 其他Agent :AI agent(abstract);分类 cs.AI
AI总结 本文提出快速AI采纳的宏观金融压力测试,揭示AI生成的过剩与需求匮乏并存的机制,通过三种传导路径分析其对金融系统的影响,并提出可检验的预测与模拟条件。
人工智能现象学:理解跨时代的以人为本的AI体验
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Bergen(卑尔根大学) ; Stanford University(斯坦福大学)
专题命中 其他Agent :agentic(abstract);分类 cs.AI
AI总结 本文提出人工智能现象学,通过研究用户与AI交互的主观体验,促进双向人机对齐,并提供可重复的方法论工具。
Comments This is an accepted workshop paper at CHI '26, "W37: Human-AI Interaction Alignment: Designing, Evaluating, and Evolving Value-Centered AI For Reciprocal Human-AI Futures", or https://bialign-workshop.github.io/2026/cfp