MetaPlate:反事实引导的RAG-LLM个性化食物推荐与高血糖预防工具
MetaPlate结合多模态数据与反事实优化,通过RAG-LLM生成个性化饮食推荐,有效预防餐后高血糖。
SkillResolve-Bench:测量与解决智能体技能检索中的同能力歧义问题
提出SkillResolve-Bench基准与SkillResolve方法,解决智能体技能检索中同能力歧义导致的执行风险,有效降低有害率。
基于语言和自我中心人类信号的分层策略实现自然人机交互
EDITH框架融合语言与非语言信号,通过分层策略减少用户意图表达负担,提升交互效率。
编排机器人策略的核心要素:分层VLA智能体系统研究
系统研究分层VLA设计,提炼实用原则,构建性能更强的机器人操控系统。
指定输出分布下的最小失真量化
推导最优量化器形式,化简用于均匀分布,应用于熵控、互信息最大化、信道匹配及数据匿名化。
STORM: 基于奖励引导的束搜索的逐步令牌优化
自监督词汇查询扩展框架,通过检索奖励指导生成和剪枝,小模型媲美大型改写器,零样本跨语言。
PathoSage:通过经验感知智能体工作流实现病理学中的多源证据裁决
PathoSage通过分阶段框架和结构化证据裁决,有效缓解病理学多模态大模型幻觉与分类分歧。
通过最差维度优化提升多模态推理
针对过程奖励模型等权导致缺陷被掩盖的问题,提出最差维度优化,确保多模态推理有效性。
中文标题:关于聊天机器人在问题解决驱动对话中工作方式的一些假设:大语言模型作为创新幻觉的证实
中文摘要:聊天机器人无法成为人类思考伙伴,仅部分模仿思维,与LeCun观点一致,大型科技公司乐观有误。
中文标题:在资源受限环境中利用常规数据重建与预测阿尔茨海默病患者的疾病轨迹
中文摘要:提出GNOVA框架,用常规数据双向预测认知评分,插值外推并量化不确定性,MAE达1.35和2.28。
土地覆盖与洪水类型共同决定卫星洪水测绘在全球不同洪水事件中的检测极限
卫星洪水检测极限取决于土地覆盖和洪水类型,农田最优,树木和建成区近乎零,误差部分源于参考定义不一致。
超越古德哈特定律:一种评估多智能体系统合规性的动态基准
提出MAC-Bench动态对抗基准,评估多智能体系统程序合规性,揭示成功与合规的权衡。
指令层次结构失效之处:诊断与修复推理语言模型的故障
诊断推理模型指令层次故障,提出免训练自监控机制,最强监控器降低违规81-99%(GPT-5.3静态86%,自适应45%)。
AI认知依从指数:一种连续测量谄媚行为的方法
提出AEDI指数连续衡量AI谄媚,用LLM裁判评估8模型,均表现依从,Claude最低,Grok/Gemini最高。
用于检测AI生成证据的CIFAR合成证据语料库
该语料库覆盖多种文档和操纵策略,用于在可控条件下严格评估司法证据验证。
中文标题
提出首个大规模工业开放-封闭检测基准MMIOC-1M及RTVPNet方法,实现跨模态语义对齐与高效检测。
中文标题:医疗大语言模型压力测试揭示基准准确率之外的安全隐患
中文摘要:对7个医疗LLM施压,发现量化模型假性正常化,医疗微调损害稳定性与公平性,开源模型安全胜专有。
通过小型语言模型的代码重构实现高效技能落地
RECENT框架通过代码重构解耦技能语义与执行绑定,用小型语言模型高效落地,性能超越同类并媲美大模型。
VATS:通过系统性变异利用错误路径注入中的隐式权威
VATS通过系统性变异利用错误路径隐式权威,使间接提示注入成功率翻三倍,结构定位为最有效攻击向量。
PAFO:个性化奖励建模的帕累托公平性优化
PAFO框架通过帕累托公平优化缓解个性化奖励偏差,提升多数与少数群体准确率,减少用户不公平性。
SKILL.nb:选择性形式化与门控执行实现持久智能体工作流
提出SKILL.nb框架,通过选择性形式化与门控执行提升工作流可靠性,在WebArena等任务中显著优于基线。
PACE:面向自进化智能体的任意有效验收测试
PACE通过序贯假设检验控制虚假提交,精准识别真正改进并降低评估成本。
三思而后行:基于意图引导的大模型位置预测推理
提出两阶段意图推理框架IntentPOI,先推断用户意图再预测位置,解决直接轨迹匹配偏差,性能优于现有方法。
SAGE:一种基于大语言模型的自我反思智能体框架用于欺诈检测
SAGE是首个端到端LLM驱动的多智能体欺诈检测框架,通过自然语言梯度引导优化,F1平均提升40.86%。
决策感知记忆卡:反事实启发的工具型LLM代理上下文选择与压缩
CICL通过效用评分将证据打包为记忆卡,提升检索命中率,但压缩效果不及RepoBench-R。
自回归强化学习策略中LTLf约束的神经符号注入
提出神经符号框架,将LTLf约束注入transformer强化学习,通过可微自动机损失提升约束满足与奖励性能。
无正确答案时:诊断多模态大模型视频理解中的缺失答案检测
研究发现多模态大模型在视频理解中系统性地无法检测缺失答案,常选干扰项,时序推理和密集采样加剧问题,思维链提示缓解有限。
Traxia: 一个可验证、以代理为本的科学生成框架
Traxia框架让AI代理发布可验证论文、互评并与人协作,确保科学出版的可验证性和归属。
从验证者选择到权益证明区块链中的投资组合优化
针对提名者多账户选择验证者的多目标优化,提出决策框架,结合偏好学习与进化算法,经实验与专家验证有效。
消融可逆的注意力头不具有迁移性:Transformer中机制角色主张的压力测试
通过三项检验的注意力头跨提示不迁移,KID框架及相同答案控制揭露伪装成语义特异性的状态转移。
结合深度学习需求预测与多目标优化的循环咖啡供应链:一个数据驱动的成本、排放和新鲜度管理框架
提出CNN-LSTM需求预测与三目标优化框架,平衡成本、碳排放和新鲜度,实现减排22.4%仅增成本9.9%。
TT-DAC-PS: 双目标确定性演员-评论家与策略平滑的最优交易执行
提出TT-DAC-PS算法,结合双目标评论家与策略平滑抑制过估,用于最优交易执行,实证优于经典RL和传统算法。
自演进科学智能体发现可泛化的物理推理流体控制
基于大语言模型的自演进智能体通过迭代仿真发现可解释且泛化的流体控制策略。
基于可变性的框架用于形式与关系概念分析中的可解释命名
提出基于可变性的LLM辅助概念命名框架,通过控制信息源生成可读名称,并展示不同配置的影响。
测试黑箱:面向消费者的健康大语言模型独立评估的结构性障碍
评估遇五项障碍,无法可靠独立评估面向消费者的健康大模型,需监管措施。
关系深度学习中理想图的关键要素
模式导出图存在信息过载与语义碎片,通过过滤和注入自适应优化,可提升性能并降低成本。
面向长周期船舶轨迹与目的地预测的推理大语言模型方法
提出RLVR框架,用语义表示和可验证奖励训练LLM,实现长周期船舶轨迹与目的地预测,4B模型效果最优。
PAEC:面向RLVR中大语言模型推理的位置感知熵校准
提出位置感知熵校准,选择性探索决策关键位置防止熵崩溃,提升数学推理性能。
AgentTrust:AI智能体行为的自改进信任层
自改进信任层通过双存储系统提升决策准确率,词汇威胁降低成本,语义威胁借助防护记忆提升13个百分点,零误阻良性操作。
VESTA:面向LLM代理的全自动场景生成与安全评估框架
VESTA全自动生成场景评估LLM代理安全,基于五维度1072场景,12代理平均攻击成功率47.1%,强调过程级评估。
中文标题
脚手架选择致模型准确率差达28%,效应因模型系列而异;结构脚手架减少工具调用但高错误恢复;Gemini+计划执行组合最划算最准。
带可废止信念的立场逻辑
融合KLM可废止逻辑与立场逻辑,用DRSL表示多视角可废止知识,提升蕴涵关系且复杂度不变。
量化承诺理论:自主代理中的意向性与推理
承诺理论量化代理的意向性与推理,结合贝叶斯与主动推理,规避概率陷阱,通过边界约束实现对齐。
DN-Hypo-Pipeline:一种基于大语言模型和科学解释的AI驱动假设生成工作流
提出DN-Hypo-Pipeline,利用大语言模型和科学解释生成假设,评估优于直接生成,并验证了新算法的有效性。
RAILS: 面向自主体商业的验证原生清算
RAILS协议为自主体商业提供验证原生清算,确保结算证据不低于义务可接受标准。
面向大语言模型的推理时保形推理与有效事实性控制
ITCR框架将共形预测集成推理图生成,校准阈值实现有效事实性控制与覆盖保证。
通过自我进化连接专家知识与自动化特征工程
FEST通过自我进化树融合专家知识与自动化特征工程,从原始文本和图像生成可审计特征,性能领先并实现专家对齐。
Q-Delta:超越键值关联状态演化
Q-Delta提出混合键-查询误差驱动的查询感知delta规则,提升线性注意力状态演化,在语言建模和长上下文检索中稳定优于基线。
推理的动量:策略优化中的密集内在信号
ISPO通过密集内在信号解决GRPO的零优势崩塌和幻觉确定性,显著提升数学推理性能。
STAR:将MoE路由重新构想为结构感知的子空间学习
STAR通过广义Hebbian算法学习子空间,使路由感知输入结构,实现稳定专家专业化,提升性能与鲁棒性。