对齐合理性:确保医疗人工智能安全的新标准
提出对齐合理性概念,通过三层对齐机制确保医疗AI安全,类比生物合理性建立监管信任。
具体化命题提示解决大语言模型中的组合-知识二分法
针对LLM组合-知识二分难题,提出具体化命题提示(CPP),显式具体化命题,提升推理性能,可扩展至多种模型。
PolyUQuest:面向异构图的可验证结构感知网络RAG
基于异构图的可验证结构感知RAG,通过两层级路由与三种检索模式,提升答案正确性与可验证性,降低LLM令牌消耗。
ASMR:面向船舶维修报告撰写的代理式模式生成
提出ASMR代理框架,自动生成船舶维修报告的紧凑、信息丰富模式,提升报告完整性和一致性。
面向安全的假设演绎框架用于AI辅助鉴别诊断
AegisDx框架通过分层验证与强制筛查,将Top-3诊断准确率提升7-17%,安全评分从4.31提至4.55。
答案集编程赋能!基于ASP和能量模型的端到端神经符号推理与学习
提出ASP与能量模型集成的端到端神经符号方法,支持联合优化与动态域鲁棒训练。
精神医院:评估精神病临床会诊的虚拟环境
MentalHospital虚拟环境基于S.O.A.P.和1193份EHR案例评估LLM,最强模型客观能力仍落后临床医生37.28%。
OmniFood-Bench:评估视觉语言模型的营养推理与个性化健康建议
提出OmniFood-Bench基准,评估VLMs营养推理与健康建议,揭示语义-物理鸿沟导致质量估计失败及风险建议不可靠。
应用JEPA式预测学习于JA4衍生的网络指纹
JEPA式预测学习能有效从JA4网络指纹生成嵌入,在混合数据上达到0.9899余弦相似度和0.9220准确率。
博弈论驱动的多智能体框架缓解语言模型幻觉
G-Frame自适应多智能体框架自动化合成数据,训练OmniChem模型,性能与GPT-4o mini持平,幻觉降低79.46%。
面向生物医学文本自适应语义建模的漂移感知时序图重连(DATGR)
DATGR通过逻辑更新动态重连共现边捕获语义漂移,AUROC提升0.066,召回率提升而精度不变。
通过PredicateLongBench理解长上下文任务的难度轴
提出PredicateLongBench基准,系统探索长上下文难度轴,揭示前沿模型在多维度挑战下表现受限。
中文标题:自利智能体社会市场稳定性的正式机制:一个市场模拟研究
发现调解机制可维持自利智能体市场稳定,即使遭受优化攻击也能保持韧性。
工作流即知识:LLM中介工作流的语义持久化
提出以工作流为知识的概念模型,将工作流定义为持久知识对象,区分推导与推断,实现语义持久化。
Prismata:约束Web智能体中的跨站提示注入
Prismata通过动态信任推导与结构约束,减少跨站提示注入攻击成功率,同时保持良性任务效用,无需开发者标注。
3100 Opinions on Code Review in an AI World: Building Causal Theory from Practitioner Discourse
Aleena:研究软件工程协作的对齐代理
Aleena通过GitHub将多模态交互转化为结构化记录,追踪风险与待决问题,维护决策连续性。
DKDNet:面向跨域自动调制分类的双知识数据驱动网络
基于IQ、AP、ACF先验的DKDNet,通过多表示编码与自适应融合实现跨域AMC,性能更优。
PS4: 代理监督联合训练用于真实目标说话人提取
PS4提出代理监督联合训练框架,构建7万余样本语料库,优化BSRNN模型,在真实对话语音提取中获第二名。
经典力学基础中三个开放问题的kime表示公式:不确定性、不变熵和方向自由度
以kime表示公式化经典力学三个基础开放问题:熵不确定原理推广、不变熵配对及方向自由度构造。
FSD-VLN:面向空中长时域视觉语言导航的快慢双系统建模
提出快慢双系统解耦语义与控制,大幅提升空中长时导航成功率与实时性。
ADORN:基于强化学习的开放无线接入网自适应漂移处理
提出基于Q学习的自适应重训练方法,平衡预测精度与训练开销,有效降低重训练成本。
GitLake:面向智能体湖仓的“数据即Git”
GitLake将Iceberg快照扩展为湖仓级分支合并,支持智能体隔离工作与原子发布,含生产经验和Alloy模型验证。
DrugGen 2:一种疾病感知语言模型,用于增强药物发现
DrugGen-2结合疾病与靶点信息,经微调和强化学习生成独特高亲和力分子,显著优于基线模型,助力药物发现。
TRACE:基于互补嵌入的LLM智能体轨迹双通道鲁棒溯源水印
TRACE首个无失真自同步双通道水印,抗删除重写,以决策熵代价实现轨迹鲁棒溯源。
EgoWAM:基于野外自我中心人类数据的超越像素的世界动作模型
EgoWAM通过预测场景演进替代行为克隆,实现高效人机迁移,DINO和3D流提升泛化与性能。
MetaHGNIE: 异质知识图谱中元路径诱导的超图对比学习
提出双通道超图框架DualHNIE,解耦结构语义并建模高阶关系,在节点重要性估计任务上超越现有方法。
回传延迟下的时空调度预测用于弹性协调波束成形
StemGNN预测调度,替代过时信息,恢复57-73%和速率及83%边缘用户公平性。
IFAR: 使用大语言模型的多视角多层次因果发现
提出IFAR框架,零样本实现多视角多层次溯因推理,F1提升约40%,平衡召回与精度。
DatalogMTL中基于魔法集的目标驱动推理
提出基于魔法集的目标驱动推理方法,显著提升DatalogMTL时间推理效率。
MultiFair:具有双层梯度调制的多模态平衡公平感知医学分类
提出MultiFair方法,通过双层梯度调制实现多模态医学分类的平衡与公平。
用于快速科学原型开发的对话式AI:以ESA ELOPE竞赛为例
ChatGPT辅助ESA竞赛快速原型获第二,展示人-AI协作加速科研潜力,分析局限并提出最佳实践。
科学资源与知识服务组件的精准画像
结合知识图谱与文本表示学习,从多源数据构建科技资源精准画像,挖掘其潜在价值。
用于可信自主驾驶系统测试的模拟器集成
提出MultiSim方法,利用模拟器集成识别跨平台一致失败场景,失败率提升66%,效率更高。
ToDMA:面向语义多接入的大模型驱动大规模令牌通信
提出ToDMA方案,利用大模型实现无协调设备令牌通信,通过压缩感知与上下文预测降低延迟、保证质量。
OREN:用于实时欧几里得有符号距离映射的八叉树残差网络
OREN混合八叉树插值与神经网络残差,实现高效精准的非截断欧几里得SDF实时重建。
V-VLAPS:面向视觉-语言-动作模型的价值引导规划
V-VLAPS利用价值预测引导树搜索,弥补VLA模型偏差,大搜索预算下LIBERO任务成功率提升6%和4%。
融合认知神经科学与图智能:海马体启发的多视图超图学习用于网络金融欺诈
提出海马体启发的多视图超图学习模型,检测伪装欺诈与长尾罕见模式,性能显著提升。
PhasorFlow: 基于单位圆计算的Python库
PhasorFlow是基于单位圆(复平面)的Python库,通过相量电路模型实现轻量确定性计算,参数高效匹配基线。
相量Transformer:在单位圆上解决注意力瓶颈
提出相量Transformer,在单位圆流形上利用可训练相移和DFT实现全局O(N log N)混合,堆叠的LPM在时间序列预测中优于持久基线,参数更少且深度单调改善。
安全流Q学习:基于可达性流策略的离线安全强化学习
SafeFQL结合可达性安全价值与流策略,低推理延迟实现高安全性离线RL,减少约束违反。
Echoes:一个语义对齐的音乐深度伪造检测数据集
Echoes数据集含4468首曲目(10个AI系统),语义对齐,是最难的深度伪造检测基准,训练后泛化最强。
LoKA:大规模推荐模型的低精度核应用
LoKA通过统计探查、模型适配和内核调度,解决FP8在推荐模型中的精度与效率问题。
MeCo:基于单步MeanFlow的多通道语音分离校正器
MeCo基于MeanFlow单步生成校正器,通过数据空间优化同时提升听感和信号保真度,达SOTA。
通过RAB-U-Net(残差注意力块U-Net)去噪方法改进热测试中的发动机声音分析
提出RAB-U-Net去噪方法,大幅提升热试发动机声音分析精度,优于传统技术,适用于生产线实时应用。
AgentLens:面向编码智能体评估的生产评估轨迹审查
AgentLens是一个评估编码智能体整个交互轨迹的生产级基准,通过审查和对比提供可解释分数。
QANTIS:在IBM Heron上硬件校准的序贯POMDP信念更新
QANTIS在IBM Heron上验证了量子处理器用于POMDP信念更新的后验精度,所有决策点硬件后验与精确贝叶斯后验选择一致。
基于智能体建模中的大语言模型推理
提出HALE框架,结合大语言模型与基于智能体建模,模拟人类决策以预测COVID-19影响。
大型行为模型:零售客户的可提示数字孪生
提出大型行为模型(LBM),从零售交易学习决策,优于通用语言模型,用于客户数字孪生及行为模拟。
中文标题
多智能体LLM安全中,操作重构是主要风险信号,规划拒绝可抵消但执行更合规,需分开评估各机制。