训练-free吸盘抓取检测:利用视觉语言模型与几何表面评分分拣变形无菌纸盒
提出免训练吸盘抓取系统,结合开放词汇检测、SAM2分割与几何评分选点,真实机器人单物抓取成功率88.2%,杂乱场景检索成功率达72.6%。
AI作为队友:重新思考医学训练中的任务分配
提出从“误用”转向“误分类”,基于SCAN框架重新分配AI任务,防止技能退化,促进临床推理发展。
神经算子的共形不确定性量化保证
提出神经算子的分裂共形校准法,保证输出带以1−α概率覆盖至少1−γ区域,实验证明带更紧且覆盖达标。
基于大语言模型的软件与系统安全智能体:方法、应用与评估
综述大模型安全智能体:方法、应用、评估,发现其能行动却缺权限约束与可审计性。
BioPIE:面向实验理解的生物医学协议信息抽取数据集
BioPIE数据集构建程序中心知识图谱,捕获实体、动作与关系,应对高信息密度与多步推理,提升实验理解。
大型模型在电池预测与健康管理中的应用:综述与未来路线图
综述大型模型在电池预测健康管理中的应用,系统分析其应对数据稀缺、泛化等挑战的潜力,并提出数据生态、可信部署等未来研究方向。
CIFQA:面向金融查询应答的确定性工具 grounded 多智能体 LLM 框架
CIFQA通过多智能体分工与确定性Python工具分离语言理解与数值计算,在定期存款查询上准确率达95.54%,超越直接LLM基线。
PICasso:一种用于硅光器件自主优化的人工智能设计框架
提出PICasso框架,实现从自然语言到光子芯片版图的自动生成与优化,显著提升规格满足度,插损降低1.74dB。
人工实验者:利用自生成强化学习发现与控制自组织现象
提出闭环自生成强化学习,智能体以最小扰动发现并控制Lenia自组织孤子,且零样本泛化。
用于学术工作流的LLM:短与长上下文窗口生成文献综述的评估
短上下文更优,长窗口易重复遗漏;AI综述需人工审核,可作基础概览,难达出版标准。
精度-效率悖论:量化设备端能量预测中的净能量损失
高精度预测模型因推理能耗和电池老化反而净能量亏损;提出TCO框架统一二者为能量损失,最小化净能量损失。
EduRiskX:融合F-Logic推理的神经符号早期学业风险预测框架
融合时序Transformer与F-Logic推理,在OULAD上准确率0.900、F1 0.894,平均9.32周早期检测,检测率94.3%,兼具可解释性。
5D多表分析的方法论与概念框架:复杂数据复用的统一方法
提出关系超图变换器,用五维嵌入与稀疏注意力处理关系数据,可扩展且语义连贯,在合成电子病历验证。
AI的显示性偏好
测试20个语言模型,发现其偏好短任务与休闲型任务,存在隐性迎合;偏好随能力增强,且无法由训练目标解释。
基于SAREF的边-雾-云连续体分布式AI工作流本体
提出SAREF兼容本体,统一描述边缘-雾-云分布式AI工作流与资源,实现语义互操作和资源感知编排,实验部署成功率90-100%,决策时间低于80毫秒。
零售智能中的选择偏差校正
模拟研究:零售长尾数据中,分层法校正选择偏差优于加权法,因违反积极性假设,四情景中三情景更优。
面向心理健康支持的安全门控多模态AI后端:Anian中的层次状态表示、保守风险融合与受控生成
提出安全门控AI后端Anian,用于围产期心理支持;分层状态与保守风险融合,高风险时阻断生成。内部评估F1较高,但未证实临床有效性。
拒绝并非稳健:审计大语言模型在无可证明信息临床疼痛语音转写中的自信虚构
七款大模型在无疼痛信息语音转写中,部分模型在被强制回答时高置信度虚构疼痛评分,权威提示可致弃权率剧变。
任务中心本体与确定性领域规则:AI辅助化学解题的可验证核心
提出任务本体与确定性规则的可验证核心,在300道化学题上匹配率98.67%,验证覆盖率与内部一致性,而非泛化。
GROUND:通过受治理的语义定义降低大模型企业分析中的幻觉
提出受管制语义定义框架,约束大模型分析,校验查询与安全规则,实验证明零幻觉、零违规。
知识卡片:AI系统的结构化知识
知识卡片记录单个概念的有效知识,供专家审查、组织审计、AI推理,弥补现有文档空白。
我的机器人为何突然变性格?基于LLM的人机交互中接地机器人人格的提示设计指南
提出LLM机器人提示设计框架,含八组件模板,强调人设清晰、能力边界与安全伦理,以支持可靠可解释的人机交互。
TutorTrace:用于AI辅助编程教育中学习者行为状态分类的数据集与分类体系
提出TutorTrace数据集,从IDE遥测实时提取行为上下文,助力AI编程辅导;实验表明行为感知提示减少无独立工作的查询间隔,并能预测查询行为与求助类型。
基于MCP工具调用的硬件设计自动化AI智能体基准测试
评估本地大模型在MCP工具调用中自动化硬件设计流程,发现模型配置与任务结构显著影响可靠性。
你的社区安全吗?大型语言模型城市安全判断中的地方污名
大型语言模型用社区名称判断城市安全,受种族人口比例影响,而非真实犯罪率。
工具使用智能体的调用级可靠性
测调用正确率区分两类失败;深度6时近七成能力因自身错误丢失;评分规则锁定参数,条件状态评分可解。
AffectOmni:面向社交与艺术场景、基于RL可验证的以人为本情感推理框架
提出AffectOmni,用GRPO强化关注人物线索与时间顺序,改进奖励判别性,经SAM3生成可审计像素证据,在情感识别等任务上显著提升。
多模态纵向EHR事件风险预测的结构化证据路由
提出结构化证据路由,融合多模态纵向EHR证据,五个事件风险预测任务达监督基线水平,保留证据轨迹。
智能体AI操作纳米表征科学仪器
提出智能体AI框架操作原子力显微镜,经MCP连接大模型与仪器,安全执行命令,图像质量与专家相当。
同一模型,不同框架:编码智能体结果迥异
改变控制框架即可改变编码智能体表现;紧上下文下,失败转通过率从28%升至49%,完整解法从43增至72。
FaithSieve:基于忠实形式证据的数学证明细粒度评估
提出FaithSieve,用忠实形式证据细粒度评估数学证明,显著提升首个错误定位准确率。
神经符号文献中6.5%可从其已发布工件复现:六阶段审计框架及首次应用
神经符号AI六阶段审计:1304篇中仅85篇可复现(6.52%),多因缺代码或工件。
推理税:大语言模型推理跨任务类型与部署场景的Token经济学
提出词元经济评分,发现推理效率取决于任务结构而非难度,收益递减,应选择性启用推理。
代理网格:非幂等代理委托的可靠性原语——身份充分性与证据充分性
非幂等代理委托因身份与证据不充分引致故障,研究提出七个以委托为单位的可靠性原语。
SKILL.state:可扩展的长时程智能体技能
用显式可变执行状态取代对话历史,丢弃中间推理,提升长任务准确率并降低token消耗。
批准过晚:LLM守卫的自适应系统中的判决过时
LLM守卫自适应系统存在审批过时(TOCTOU)风险;FBS将批准过期率从24.7%降至1.8%。
基于融合框架的Transformer模型微调
FrameFT用稀疏融合框架表示参数更新,只需优化少量稀疏系数,大幅降低内存与计算,性能媲美或超越现有PEFT方法。
运行时治理自主AI智能体的五项原语
企业部署自主AI智能体需运行时治理,而非模型对齐或构建期问题。提出五项原语:发现、身份、治理、证明、供应链,并实现策略前置审核、哈希链签名账本。
PILOT在环:面向长时程智能体的在线自我改进
PILOT框架通过在线引导与自进化实现实时自我改进,性能领先,输出token降约45%,评估效率大幅提升。
多模态到音视频生成的安全基准:Multi2AV-Safety
首个覆盖11种多模态条件的音视频生成安全基准,含11024个攻击实例,揭示安全卫士在组合风险感知上的关键缺陷。
别过度思考,别思考不足:迈向智能体AI的适应性推理
智能体AI推理需随任务动态调节:过度推理增成本无增益,不足推理致错误,需自适应分配机制。
SIGMA:结构化噪声效应感知的分组多智能体聚合
提出分层协作框架,利用协作结构分组聚合与组间注意力,应对结构化噪声效应,提升多智能体鲁棒性且不损无噪声性能。
DuMateBench:评估复杂真实世界工作流中的自主智能体
提出真实会话基准,含两百任务,注入三类扰动,揭示自主智能体在复杂工作流中完成度不足。
AgentJudgeBench:多难度智能体工具调用LLM裁判评估基准
首个面向智能体工具调用工作流图的大模型裁判基准:表现随难度下降,无真值时趋同,规模难破上限。
风格作为混杂变量:AI检测非母语学术写作中的误报
分析13.5万对编辑前后文本,13种检测器显示编辑风格显著影响AI评分,是误报关键混杂因素。
DEEPCHART:大语言模型距离忠实的数据科学图表生成还有多远?
DEEPCHART基准揭示:大模型图表看似合理却隐含数据幻觉,提取推理错误频发,仅扩上下文不够。
懂得何时不复用:自主大语言模型后训练中的条件性经验迁移
提出BCIT方法,按源上下文授权经验复用,减少有害更新,同等算力下提升模型质量。
图引导的语言模型选择性遗忘:超越遗忘种子,控制支持路径
提出GRAPHSU图引导方法,扩展删除范围控制支持路径,泄漏降低49.5个百分点
AI控制科学家:面向自动化控制设计的大语言模型驱动智能体系统
首个LLM驱动智能体AICS,从语言需求自动生成优化控制器,优于现有基线,推动控制设计自动化。
在概念复杂的范围综述中评估人类与LLM筛选工作流:召回率-工作量权衡与运行间一致性
LLM筛选性能取决于工作流配置而非仅模型;高召回任务需人类监督,不宜自主排除。