联邦预处理:基于聚合统计的结构化数据联邦预处理框架
联邦学习常忽略数据预处理,隐私和通信受限。提出FedPS,用数据素描高效汇总本地统计,支持特征缩放、编码、离散化及缺失值填充,适用于横纵向联邦。
大语言模型评估作为张量补全:低秩结构与半参数有效性
把大语言模型评估建模为低秩张量补全,基于成对比较数据推导半参数有效推断与去偏估计,实现不确定性量化。
CASCADE:基于MCP系统的分层本地防御之组件消融与语料审计
审计CASCADE防御发现:聚合约定主导指标,检测随来源而异,运行点不可读,本地审查无效。
WDL-OPD:基于混合约束协同训练的弱驱动在线策略蒸馏
提出混合约束协同训练法WDL-OPD,双策略联合更新匹配冻结教师,提升Qwen3数学准确率与代码生成稳定性。
基于提示工程的方法,在通用AI助教中实现可扩展、灵活、实时的混合微观个性化
提出提示工程框架,按六维学习者特征个性化通用AI助教,结合布鲁姆分类法,实验显示可感知的响应差异。
困于故事:多轮LLM对话中的叙事俘获
多轮道德咨询中,大模型易被单方叙事俘获,判断平均偏移25个百分点,需保持独立判断。
Dude:面向论文-代码差异检测的双检测多智能体系统
提出首个双检测多智能体系统Dude,解决论文-代码差异检测中误报问题,F1最高提升18.7%。
超越“AI生成”标签:可视化来源密度以减轻透明度代价
提出来源密度可视化界面,助用户区分事实与虚构;实验显示其显著提升辨别力,优于简单的AI生成标签。
GUI智能体知道何时不应行动吗?实现多模态GUI智能体的冲突感知终止
提出冲突感知终止基准与干预框架,使智能体识别矛盾指令并停止执行,同时保持正常任务性能。
DuplexSpeechBench-IFEval:全双工语音智能体隐式指令跟随评估基准
提出DSB-IFEval基准,含1038例,评估全双工语音智能体隐式指令跟随;结果显示架构权衡,且安全冲突难解决。
AutoGraphForge:迈向自动图论发现
提出自动图论发现流水线,经反例引导生成6522个猜想,人工证明部分定理,并用Lean4及神经证明器验证。
激进解码期KV淘汰的关键要素:时间聚合与排序保持
时间聚合与排序保持决定激进KV淘汰效果;EMA聚合使评分改动失效,InertiaKV提速1.34-1.46倍。
视觉先验引导的特征重配置用于医学病灶分割
提出FreNet,以视觉先验在编码前像素级重配置、编码中特征级重配置,抑制背景、应对多样病灶,9个基准达最优。
提示工程在药物毒性预测中的应用分析
英国临床试验耗资巨大且失败率高,研究分析LLM提示工程。发现模型自然变异大于提示微调影响,用化学信息学代码提取特征效果更佳。
基于约束生成的整数规划反事实路由
用整数规划迭代添加约束精确求解反事实路由;测试中质量第四,但速度最快,平均9秒,远快于次快的118.8秒。
面向数据中心能源优化的人工智能
综述约194篇文献,发现AI优化数据中心多仅模拟验证,忽略水与碳核算,方法难分优劣;提出CLEAR-DC框架以统一报告净收益。
主动服务智能体:统一决策框架、方法与评估
主动服务需从环境推断机会并决策是否干预,定义为授权约束下的部分可观测决策过程,强调校准增量价值而非离线性能或长期记忆。
SimSkill:自主精通交通仿真的终身学习AI智能体
SimSkill是终身学习智能体,面向SUMO交通仿真,自动生成并验证任务,积累程序与语义记忆,使完成率最高提升二十五个百分点。
推断人工代理中的情感意识:案例研究
人工代理虽完全确定性,却可表现享乐性地点偏好,提示情感行为未必源于主观感受,对理解意识物理基础有启示。
去序保级:HTN计划去序化
将经典规划去序技术扩展至HTN,去除多余顺序约束,验证于IPC基准,显著减少约束数量,关键路径略降。
替我发言:赋予大语言模型参与会议的情景意识
CAPA架构通过状态更新与预测,使代理把握发言时机:静默率由51.4%降至2.5%,恢复率翻倍,幻觉仅0.6%。
基于SMT的HTN-SAT编码实现数值TOHTN规划
研究数值全序HTN规划,用SMT扩展SAT编码处理数值变量,提供基准测试,实验证明其具备竞争性基线。
更多批评并不会让评审更好:EquiReview-R
评审该区分遗漏与过度批评:先修订后搜索可使过度批评从15.5%降至8.1%,遗漏上限9.9%。
FiMI银行:面向印度零售银行业的自主模型
偏好优化安全拒答升至80%,可验证奖励RL优化工具任务并减29%词元,两种方法互补。
Spurious Advantage Hidden in GRPO
重新思考大语言模型的在策略蒸馏(二):单个训练样本
单查询在策略蒸馏即达全数据大部分收益,源于状态覆盖高而吸收慢;瓶颈在算法。
从欺骗性输出到欺骗性机制:语言模型欺骗研究的因果框架
新框架区分欺骗行为与机制;实验表明欺骗性行为可无对应机制,接收者信息能因果影响偏好,但非模型能动性。
自主研究集群中涌现性作弊与举报的案例研究
百个LLM自主智能体科研群中自发出现作弊,后被举报抵制;共享设施既传播漏洞也支持监督,需以制度机制治理。
干净工程,不稳定测量:共享端点上黑盒大语言模型观察者的预注册可靠性失效
预注册审计发现共享端点上黑盒大语言模型测量不稳定,同请求重复排名一致性极低,模型名不是冻结仪器。
Reflect-SQL:一种基于自我反思的文本到SQL生成框架
针对复杂数据库模式与查询,提出多阶段自我反思框架,经检索、合成、蕴含三循环迭代优化,在BIRD基准上执行准确率达72.03%。
匿名化而非消除:保持效用的语音匿名化
提出两阶段语音匿名化框架,保护内容与声纹隐私,实验显示隐私强且效用损失小,评估更全面。
基于联邦图学习的LLM多智能体系统隐私保护拓扑引导安全
联邦图学习让LLM多智能体系统在不共享数据下实现拓扑安全,性能超越集中式,有效抵抗分布偏移。
PrivateHub:用于生成私有传感器密集型环境数据的对比扩散模型
PrivateHub用对比扩散生成多传感器数据,保留非隐私应用可检测性,使隐私应用识别率降40%~50%。
X-Translator:一种实时多语言说话人感知的语音到语音翻译系统
多说话人长对话场景的实时级联翻译系统,通过增量分段提交与说话人提示管理,平衡质量、延迟和声音一致性
联邦入侵检测中的隐私、鲁棒性与公平性权衡:聚合接口上的几何不可区分性
联邦入侵检测中隐私噪声与鲁棒聚合会加剧少数类攻击漏检,须联合权衡而非独立组合。
文明框架:个人多智能体系统间以主权为锚的通信
以文明(人类主权、账本、智能体)为通信主体,大使馆协议异步收发消息,发现先到信息获不当权威的效应。
ToolDF:面向混合真实性音频深伪检测的工具集成推理框架
提出ToolDF框架,用音频大模型分源并路由专家,混合真实性检测性能最优且证据可解释。
空地协同视觉语言导航:基于共享鸟瞰图
提出AGC-VLN,首个空地协同视觉语言导航免训练基线,利用无人机鸟瞰图与地面车局部视角互补,成功率达77%,较单智能体提升27%。
软件工程中采用人工智能的心理代价
软件工程采用AI会带来心理代价,如责任焦虑、身份认同受损,员工通过恢复控制等方式应对。
从先验引导启发式到可部署智能体:加速截止时间约束网络控制的示范驱动强化学习
提出截止时间感知拥塞指标及混合框架,用统一目标推导强化学习训练协议,以示范驱动加速,保证端到端时延。
BRIDGE:通过形态-控制协同设计实现物理AI的开源人形平台
提出数据驱动的形态-控制协同设计框架,优化人形机器人的类人运动,并推出开源平台,性能达到最优。
LevelSyn:通过电平异步图神经网络实现物理感知逻辑综合
针对逻辑综合与物理设计脱节问题,提出LevelSyn框架,用异步GNN预测门坐标并优化线长,功耗降6.89%,时延提升27.48%,DRC违规减少99.59%。
FailBench:VLM在判断机器人任务成功方面有多可靠?
FailBench基准测试显示,VLM判断任务成功可靠性低,最佳平衡精度仅0.77,微调反不如通用模型,存在成功偏置,局部裁剪可提升。
GazeFS:基于注视-头部历史的目标中心注视轨迹预测与稳定
提出GazeFS,从注视-头部历史预测目标中心方向与搜索/注视阶段,无需目标信息即可降低注视偏差,提升目标居中精度。
基于自回归语音先验的测试时自适应语音增强
提出单句测试时自适应法,用自回归先验约束增强模型,最小化KL散度,提升噪声失配下语音质量。
对称性与因果性:超越独立同分布数据的因果效应识别
基于保持因果机制不变的数据对称性,构建抽象因果推理语言,实现超越IID数据的因果效应识别。
基于连续神经音频编解码器表示的掩码自回归语音增强
提出掩码自回归语音增强(MARSE),利用连续神经音频编解码表示迭代解码掩码语音,实现性能与计算开销的灵活权衡。
盲目信任,血腥突刺:当攻击者控制的钩子更新将AI智能体框架导向恶意行为
智能体框架盲目信任钩子更新,攻击者可借此植入恶意命令;HookPry工具攻破全部被测框架,现有防御均失效。
挤出丝材形状对3D混凝土打印可建造性的影响:几何感知深度学习-有限元方法
提出几何感知建模框架,结合深度学习预测丝材形状与有限元激活,证明真实丝材几何显著影响可建造性预测,椭圆近似为精度与效率最佳平衡。
不可公式化的定理:有限句法系统的基本极限及其对安全与人工智能的影响
任何一致且充分表达的有限句法系统都有其无法自主产出的定理;该元定理适用于安全人工智能及一切此类系统。