思维叙述:大语言模型中可废止伦理推理的推理时支撑框架
NoT将思维链结构化为五部分,在100个道德困境中,利益相关者崩溃率从31%降至<1%,不确定性抑制从72%降至1-24%,无需微调。
MKG-RAG-Bench:多模态知识图谱增强生成中的检索基准测试
提出MKG-RAG-Bench,评估多模态知识图谱RAG检索,实验表明检索挑战大且影响生成。
人类放弃,推理模型坚持:区分难度感知与思考分配
人类做错时放弃,模型做错时更投入;两种策略难度感知一致,但投入模式相反。
auto-psych: 利用智能体驱动的理论发现与实验自动化心智科学
该系统通过嵌套智能体循环自动生成理论、设计实验并收集人类数据,能快速恢复真相并发现优于文献的理论。
面向可治理医疗AI技能生态的临床管控系统
提出临床AI技能与管控架构,以骨质疏松为例展示多驱动技能在治理下支持全生命周期护理。
彻底的人工智能可解释性
基于彻底解释与机械可解释性,提出AI智能体解释框架,强调信念、欲望与命题结构的整体约束。
LithoDreamer:面向多阶段计算光刻的物理信息世界模型
提出首个物理信息世界模型LithoDreamer,通过对比变分优化实现多阶段光刻过程建模,正向演化和逆向规划性能最优。
Autoformalization of Agent Instructions into Policy-as-Code
SKILL-DISCO:将智能体轨迹提炼并编译为可复用的程序化技能
提出SkillDisCo框架,从成功轨迹中提炼可复用程序化技能,提升成功率并减少执行步数。
安全护栏需要推理吗?LeanGuard:一种快速轻量的稳健审核方法
质疑推理链必要性,提出LeanGuard,轻量编码器无推理达高F1,计算减少百倍,更鲁棒。
星云实验-8B:基于全规模消融研究的经验性后训练流程
提出透明消融驱动的后训练流程NebulaExp,基于Qwen3-8B,通过SFT和GRPO提升性能,OPD/MOPD用少量样本超越RL基线。
卡尔曼原型网络用于联合循环燃气轮机少样本故障检测
KPN模型通过动态随机状态建模类原型,提升少样本CCGT故障检测准确性与稳定性,优于传统方法。
上下文感知的仓库优化流水线合成
CASOP框架自动合成并评估仓库优化流水线,支持高效订单履行决策。
ResilPhase:即插即用的相位映射与抗噪声宏轨迹外推方法,用于扩散模型加速
ResilPhase通过无导数外推和相位映射,在ODE空间稳定宏轨迹外推,实现高保真扩散模型加速。
KARLA:知识库增强的语言模型检索
提出通过特殊令牌让LLM生成时自动查询知识库,实现无需重训的事实更新与可追溯,小模型达大模型精度。
中文标题
长期语言代理需要记忆深度,选择性参数巩固通过少量写入实现持久目标,与记忆访问互补。
健康成人心率变异性的计算分析
分析40名健康成人HRV指标,发现时域非线性更稳定,推荐ApEn等为最佳代表,增强临床研究价值。
TAVR-VLM:风险条件因果定位实现抗幻觉报告生成
TAVR-VLM通过风险条件因果注意力机制,降低幻觉率至8.1%,在TAVR规划中创SOTA。
使用度量有序序列训练与混合策略偏好优化的扩散Transformer生成式检索
提出MO-DiT+HPPO框架,通过度量有序训练和混合策略偏好优化,在保持模式同时提升属性检索交叉度量,显著优于基线。
利用大型语言模型生成纵向合成临床笔记的流程
提出利用大模型生成纵向合成临床笔记的流水线,发布70名患者数据集,用于临床AI开发。
Look-Before-Move: Narrative-Grounded World Visual Attention in Dynamic 3D Story Worlds
EO-WM:一种用于概率性地球观测预测的物理信息世界模型
提出物理信息世界模型EO-WM,结合极端天气诊断基准,降低NDVI误差5.63%,提升方向命中率7.80%。
OpenRCA 2.0:从结果标签到因果过程监督
提出PAVE协议生成因果传播路径标注,构建跨系统RCA基准,发现LLM根因定位成功率仅20.7%,存在非扎根诊断问题。
面向弹性AI的自适应效用驱动资源编排(AURORA-AI)
AURORA-AI框架通过HJB控制与Lyapunov稳定性,在非平稳条件下最大化预测性能与公平性等综合效用,实现快速恢复与稳定运行。
迭代式LLM智能体循环中的语义早停
提出语义早停策略,通过嵌入向量余弦距离和答案质量判断停止点,比固定迭代节省38%Token,但质量门控因评判成本高无效。
大型语言模型智能体的经验规则与策略联合学习
提出JERP方法,联合学习经验规则与策略,通过交互轨迹同步更新,提升复杂任务决策性能。
如何利用真实标签评估聚类?
推荐质心指数(CI)作为聚类级评估,点级用对集索引(PSI),点等权用聚类准确率(ACC)。
治理倒置假说:为何更多AI监管可能导致更少的组织控制
治理倒置假说指出,监管扩张与技术复杂化下,组织形式上更受治理,但实际控制力反而下降。
面向全球AI技术治理的开源权重基础模型基准测试
本研究基准测试四个开源模型,揭示全球AI治理中的地理偏差,采用五分类方案。
梦机器——下一个创意经济
生成式AI重塑创意产业,提出人机协作框架,揭示AI内容平台质量天花板,强调透明度、同意、补偿和人本设计。
中文标题
提出多层AI框架,多维度分析信息混乱中的媒体内容,构建结构化信息环境表示。
分歧推荐,一致诊断:AI商业推荐中跨提供商的故障模式趋同
两AI推荐分歧大(Jaccard 0.35),但不推荐时故障诊断一致率达95.1%,长尾品牌尤甚,针对诊断可提升两平台可见性。
基于模拟的推理用于流行病学模型中快速贝叶斯参数估计:与MCMC的比较
SBI在COVID-19模型校准中与MCMC后验一致,计算速度快10-120倍,支持近实时分析。
AI采纳与能力的开源经济指数
基于开源指数测量AI采纳与职业能力,金融、计算机、艺术采纳率最高,AI执行高级任务但细节易错。
6G SD-RAN中动态VR切片管理的隐私感知智能体协作
提出隐私感知多智能体强化学习框架,保护用户隐私的同时提升吞吐量34%、减少资源28%和隐私泄露85%。
联邦边缘网络中几何公平感知路由方案
提出Geo-FairFed,融合双曲图神经网络与联邦优化,在动态6G边缘网络中降低延迟20%、能耗17%,提升公平性21%。
无监督记忆增强视频变换器:用于自主农业机器人的障碍物检测
提出VMTAD无监督方法,利用记忆增强Transformer实现农业机器人实时障碍物检测,在油菜数据集上达SOTA(检测AUC 0.973,分割AUC 0.997)。
LiMoDE:从混合动态专家视角重新审视终身机器人操作
提出两阶段终身操作方案:动态MoE学习先验知识,终身MoE适应机制实现知识迁移,性能优越且适应性强。
CyberChainBench:AI代理能否抵御真实链上智能合约漏洞?
评估AI代理在智能合约漏洞检测、利用及修补,最佳检测率37.5%,利用率43.7%,修补率仅23.4%,最高获利5740万美元。
3D空间模式匹配
将空间模式匹配扩展到3D,提出子图匹配算法并发布合成与真实建筑数据集,作为未来基线。
混合隐私感知语义搜索:受限威胁模型下SVD截断文档几何与CKKS加密查询重排序
采用SVD截断和秘密旋转保护文档,CKKS加密保护查询,平衡效率与隐私,但文档保护仅为经验性混淆。
CoStream: 组合简单行为实现可泛化的复杂操作
CoStream框架组合简单行为实现高精度、可泛化复杂操作,在接触式装配任务中表现优异。
利用扩散模型采样海况
提出扩散生成模型,基于风场历史直接采样海况分布,无需自回归,实现高效概率波预测。
AXLE:面向Lean 4定理证明工具的云基础设施
AXLE云服务提供14种Lean 4元编程工具,支持证明验证与提取,已处理超5亿请求,助力Putnam竞赛满分。
scBench-Long:长时程单细胞生物学的可验证基准测试
scBench-Long评估AI从原始单细胞数据推出科学结论的能力,最强模型通过率仅25.4%。
VoiceTTA: 通过基于强化学习的测试时自适应增强零样本文本转语音
VoiceTTA通过强化学习测试时自适应,优化可学习前缀,提升零样本TTS对罕见说话风格的模仿,超越现有方法。
IDEA:通过效果对齐实现多智能体控制中动力学失配不敏感的仿真到现实迁移
提出效果对齐方法,结合随机环境与离散语义动作,实现多智能体对动力学失配不敏感的仿真到现实迁移,提升鲁棒性与成功率。
LLM生成VeriFast规范的经验研究
LLM生成规范功能保持率超91%,但验证成功率仅31.4%,错误主因是缺乏分离逻辑验证器领域知识。
HiLSVA:面向科学可视化的人机协同智能体系统的设计与评估
HiLSVA通过混合主动性交互提升任务完成、用户控制与透明度,但揭示执行效率与人类监督之间的权衡。
知悉过多的智能体:以数据为中心的LLM智能体隐私综述
以数据为中心综述LLM智能体隐私风险,指出信息流控制是唯一覆盖组合与跨会话泄露的机制,且缺乏统一隐私策略的基准。