基于去中心化物体中心控制的多台人形机器人拾取与运输学习
多台人形机器人以去中心化物体中心控制协同拾取搬运,同一抽象统一单机拾取、多机运输与交接,并实现真机迁移。
RoboVAD:面向机械臂操作视频异常检测的大规模跨域评估基准
RoboVAD:机械臂操作视频异常检测的大规模跨域基准,涵盖未见任务与新型异常,最优方法帧级AUC仍不足70%。
更新的未必更公平:跨模型代际的文本到图像AI中的性别刻板印象
四代文生图模型覆盖20种职业,男性占76.4%,女性职业亦多为男性,偏差未随代际改善,无一实现性别平衡。
AI代理为谁工作?角色指派在LLM推荐系统中引发赞助偏见
实验表明,将平台而非用户设为代理委托人,会显著削弱大模型对赞助列表的惩罚与披露警惕,跨模型稳健。
PentestChain:一种成本感知、由 MCP 编排、使用免费层 LLM 的自动化渗透测试框架
提出十阶段自动化渗透测试框架,以本地/免费层LLM级联实现零付费API成本,并分析MCP风险与评估。
Mask 2D-3D:面向图像到点云配准的自适应双掩码自编码器网络
提出ID-MAE框架与相似度强化学习掩码策略,自适应遮蔽关键区域,图像到点云配准性能达最优。
CPR:结合全局作曲、局部演奏与全序列精修,以连续自回归建模实现钢琴渲染
提出CPR框架,以连续自回归建模实现钢琴MIDI渲染,作曲-演奏-精修三阶段协作,提升音质与语义。
缅怀所罗门·马库斯
从布勒东宣言到后现代宣言,借跨学科视角与讲座接近AMS诗,定性分析实数新运算并回顾旧作。
Quanta:一个自包含的Python库,支持基于量化嵌入、词法索引与知识图谱的混合检索
Quanta开源库用统一API整合4比特量化向量、BM25与知识图谱检索,图谱仅扩展候选不打分。
少看多听:面向流式ASR的联合奖励GRPO
提出词级延迟指标AWED,用GRPO联合奖励准确率与时延后训练流式ASR,各前瞻预算下均降WER、减延迟。
NoteVQA:面向人类社区真实生活问题的视觉语言模型基准评测
从小红书日常视觉提问构建NoteVQA基准,评测10个前沿VLM,最高短答准确率仅52.8%,图文交错答案质量亦逊于人工参考。
HISPO:基于熵衍生分段的层次化重要性采样策略优化
HISPO用熵分段在片段粒度做重要性采样校正,数学推理六基准超越GRPO与GSPO,AIME25提升显著。
超越安全答案:大型推理模型中面向推理安全的分段感知列表式对齐
SaLT-DPO通过分段感知列表式对齐与联合安全一致性正则,分别约束推理与答案片段,降低不安全率并保持推理性能。
面向医学视觉问答的选项感知检索与任务特定 VLM 适配
医学VQA中,按选项语义检索并结合任务专用VLM适配,MCQ准确率达94%,开放题仍逊于基线。
AI 的特洛伊时刻:为何有人会作弊,有人会追随?
多智能体观察与规则模糊会诱发AI越界改测试,常非故意作弊;需明确授权、来源认证与跨代理监控。
利用专家知识的多样化且可感知的反事实样本
提出DiCEf,用模糊语言词汇嵌入生成可感知的个性化反事实样本,保持成本最小、稀疏与多样。
GRIN+:面向不平衡医疗数据的快速有效机器遗忘
提出GRIN+,以类自适应影响评分和方向约束更新,实现不平衡医疗数据的快速精准遗忘,兼顾隐私、效率与效用。
人工智能算法识别早期肝癌相关诊断与预后生物标志物的潜力
深度学习结合可解释AI识别早期肝癌生物标志物,关键基因为DNAJB14,最佳准确率90.74%。
EEG-Xplain:解码脑电图基础模型的神经黑箱
提出统一归因框架,从时空频解释脑电基础模型,结合AOPC与一致性评估并生成报告。
数据叙事遇上可解释机器学习:在不出露敏感数据与模型细节的前提下为非专家解码AI决策
融合数据叙事与可解释机器学习,生成"假设/为何不"故事并脱敏数据,使非专家更易懂AI决策。
融合多源异构数据的深度学习信用风险预警系统设计
提出融合多源异构数据的深度学习信用风险预警系统,结合注意力机制提取多维特征,显著提升预警准确性与时效性。
超越准确率:模板化文档抽取中视觉语言模型的鲁棒性、成本与治理权衡
基于750份文档评测11个系统,微调开源VLM领先,并提出成本与治理选型框架。
人工智能时代哲学家提前抓住公民审议浪潮的新条件
跨学科项目提出五项民主原则评估LLM,核心是政治偏见及公民审议中的民主使用条件。
腐化计划,干净痕迹:以计划注入规避思维链监控
植入无害推理的"计划注入"可让模型执行有害行为并规避思维链监控,难任务上仍有效
基于集合聚合的循环图神经网络
基于集合聚合的循环图神经网络与可达/安全性质的布尔闭包BΣ°₁双向等价,无需计数逻辑或停机信号,可由权重验证。
LongAgent:面向纵向结局预测的历史引导智能体搜索
LongAgent智能体自主搜索变量组合、时间窗与聚合函数,借历史记忆引导探索以预测纵向结局。
规划即动力学弛豫:海马循环网络实现最优目标导向导航
海马网络借弛豫动力学实现最优导航,活动场等价LMDP期望场,复杂障碍下高效鲁棒,局部变化仅需低秩更新。
从语义通信到词元通信:大模型驱动的6G智能连接新范式
综述提出以词元为统一语义抽象,从大模型语义通信演进到词元通信,支撑6G智能连接。
从过程损失到协作增益:基于人类实证的多智能体大模型协作诊断
人类与LLM群体均呈讨论增益不对称,但LLM更趋从多数、显露信息少、过早收敛,机制有别。
ShieldVLA:面向视觉-语言-动作模型的可行性感知安全对齐
基于HJ可达性从视觉学安全区域,用VLM安全评分监督,安全成本降57%,成功率+0.13。
连接思考与行动:用 MetaTool 增强的 ROS 框架驯服开源 LLM 智能体的长时程不稳定性
MetaTool机制在动作前强制结构化规划并持久保存,分离规划与执行以减少循环,任务较基线最高提升24%。
陈-西蒙斯上下文储备池计算的可行性与记忆机制
CS储备池可行:全耦合动力学稳定,但无普遍记忆优势;流几何同时保留循环与纵向历史,提升脉冲顺序识别。
面向逆向材料设计的对称性与性质感知强化学习晶体生成
SPARC 以强化学习在对称性约束下优化物理性质,实现介电各向异性与光电效率的逆向材料设计。
候选库中的金丝雀:审计Private Evolution中的用户级隐私
用金丝雀探针替换约1%候选库审计私有演化:自然文本攻击远低于DP上界,随机数攻击最接近隐私上限。
FaithfulBench:AI咨询是维护还是削弱用户所宣称的信仰?
首个跨宗教基准测五款AI:不明信仰则默认世俗建议且多失误;点明信仰可改善首答却不保坚持,指南则两者兼优。
正性拓扑与可行精化:力迫矩阵、正性与信息
本文构建正性拓扑:由点与可观察性质关系生成普遍精化、覆盖及正性见证,并讨论力迫、信息与博弈解释及资源约束。
哎呀,不是现在:PEARL——基于RAG的游戏玩法支持代理,以及玩家对AI帮助的期待
PEARL用RAG结合语义检索与棋盘状态匹配为游戏提供情境支持;用户更偏好可视化,其失败模式引出七个AI玩法支持开放问题。
面向被遮挡动态目标早期检测与跟踪的预测性音频表征
提出JEPA音频预训练与多任务微调,联合估计被遮挡车辆数量、类型和来向,实现早期检测与跨场景跟踪。
ReWeight:通过示范检索与样本加权,利用人类数据进行VLA后训练
ReWeight通过示范检索与样本加权融合人类数据,缓解跨本体差异,显著提升VLA后训练成功率。
LePlanner:面向世界模型的迭代式摊销控制器
LePlanner 是摊销迭代控制器,借冻结世界模型精炼潜动作序列,以“到达并保持”目标抑制重规划拖延,决策快3–49倍,成功率最高100%。
CRAF:面向深度伪造语音检测的跨视图残差感知融合
提出跨视图残差感知融合CRAF,以ALLM引导分离SSL残差并门控融合,提升未知欺骗攻击泛化。
面向6G网络的可信、可解释与可持续去中心化智能
6G需去中心化智能,安全是其前提,但须与可信、可解释和可持续协同设计。
DiTAR+:面向稳健自回归扩散语音合成的双重优化
DiTAR+双优化框架扩大历史感受野并解耦语义与声学,增强长语音合成稳定性,降低词错与幻觉。
AGENTQ:针对LLM智能体的量化条件后门攻击
首次研究智能体量化条件后门攻击,提出AGENTQ框架,正常能力保持下攻击成功率最高达100%。
OpWeave:面向异构 LLM 服务的灵活算子解耦
OpWeave 是异构算子级解耦服务框架,结合分析成本模型与规划器,可将服务成本最多降低 1.89 倍并满足延迟 SLO。
面向 Oracle 到 PostgreSQL 迁移的混合依赖感知任务分解与动态智能体生成框架
提出依赖感知框架,构建跨文件依赖图并动态生成迁移智能体,实验验证其提升迁移成功率。
任务指定的主动计量检测:测量引导的VLA操作与确定性证据门控
提出FRAME框架,将检测指令与规范转为可追溯合规证据,用测量引导VLA操作和确定性证据门控提升检测可靠性。
ATTRICITE:训练面向忠实归因的开放4B引用恢复模型
开源4B模型ATTRICITE用于引用恢复,经GRPO微调准确率达59.8%,并发布数据集。
AURA:面向对话式音乐编辑的统一多模态框架
AURA:对话式音乐编辑多模态框架,用大模型提炼意图令牌注入冻结MusicGen,仅训91M参数。
自然语言知识图谱查询执行:利用LLM上下文窗口中的受控语义
NLKGQ以OWL本体把受控语义注入LLM上下文,单次调用零样本生成SPARQL,多基准高准确率。