一种统一的情境感知与关系感知图检索增强生成框架
HyGRAG分层图RAG框架实现上下文与关系感知检索及动态更新,多跳推理准确率提升9.7%。
信任正确的教师:面向GUI定位的质量感知自蒸馏
提出质量感知自蒸馏,通过正确性门控和概率缩放提升GUI定位中教师信号质量,性能优于基线。
记忆作为消耗性资产:为具身智能体定价闪存耐久性及其局限性
提出影子价格定价闪存耐久,值写关联决定存储策略,但效果受硬件部署制约,价值提升待验证。
通过智能体发现混合结构学习心脏电生理数字孪生
提出LEADS框架,利用LLM智能体迭代发现混合模型,实现稳定可解释的心脏电生理数字孪生,性能优于传统方法。
提取语义:LLM引导的从URDF自动填充机器人本体
利用LLM从URDF自动生成机器人语义本体,通过多数投票和验证确保一致性,初步结果有效桥接低层描述与结构化知识。
EvolveNav:零样本物体目标导航的主动预反思与自进化记忆
通过规则记忆和置信度检索,结合预反思模块,实现零样本导航的持续自进化,成功率提升10.1%。
PIVOT: 通过可微分的Jäckel算子桥接Black-Scholes隐含波动率与价格目标
PIVOT用隐式微分和门控机制解决低vega奇异性,高效精确转换波动率与价格,MAE降低达43.4%。
CMIP-Forge:检索、计算与自审气候科学的智能代理系统
CMIP-Forge通过检索文献、分析数据和自审机制自主完成气候研究,但暴露了审查循环的失败模式。
通过工程化模型-量子框架从有限真实数据实现全面的pKa数据扩充
利用机器学习预测和量子辅助生成,从有限数据扩充pKa数据库,解决尾部样本稀缺问题。
HRDX:大规模矢量高清地图数据集
HRDX是40小时/1400公里的大规模矢量高精地图数据集,含多传感器与航拍影像,10类元素,复合评分评估,证实规模与航拍可提升地图构建质量。
ZIVARI-TLBO:一种用于教与学优化的零成本组间评估精英中继机制
ZIVARI-TLBO以零成本精英中继改进TLBO,多维测试排名第二,优于多数算法,工程结果受惩罚函数影响。
时间戳感知的时空图对比学习用于网络入侵检测
提出自监督时空图对比学习框架,利用真实时间戳与多视图对比,自适应加权,高效检测入侵,性能接近有监督SOTA。
An Evaluation of Data Leakage Risks in Tool-Using LLM Agents in Realistic Scenarios
战争中的图神经网络:在以色列-伊朗冲突中整合网络安全与无人机智能
研究用图神经网络提升网络安全与无人机响应,检测率94.2%,响应快,优于传统方法。
LineageMark:多用户白盒水印用于模型衍生链贡献追踪
提出多用户白盒水印框架LineageMark,在多阶段衍生链中保留贡献水印,支持增量插入并抗扰动。
MLLP-VRAIN UPV 系统用于 IWSLT 2026 同声传译任务
使用 Parakeet 和 Qwen 3.5 构建级联系统,通过自适应策略优化质量延迟,新增上下文 track 显著提升性能。
PromptMN: 伪提示语言
提出PromptMN伪提示语言,以%前缀指令注释自然语言,提升人机交互的清晰性与可复用性。
Vibrato Expression Control for Singing Voice Conversion with Improving Independent Control
Statistical Foundations of LLM-based A/B Testing: A Surrogacy Framework for Human Causal Inference
信任感知的多智能体可追溯性:面向一致软件工件管理的置信度校准知识图谱
提出基于置信度校准知识图谱的信任感知框架,通过追溯链接预测与一致性协议实现可信多智能体协作。
从民主到专制:AI系统如何通过设计助长威权主义
AI系统通过数据集中、监管漏洞等特征助长威权主义,在民主与专制政体中普遍存在。
基于Feynman Kac重加权的薛定谔桥匹配用于表面Tau PET标准化
提出FKRSBM模型,通过熵正则化最优传输和子组重加权,实现Tau PET表面标准化,优于现有方法。
Do Large Language Models Always Tell The Same Stories?
基于Transformer的热启动实现空间机械臂对翻滚目标可行且最优的末端逼近
Transformer热启动使空间机械臂末端逼近翻滚目标时SCP迭代减少28%,运行时间降低23%-50%,提升可行性与鲁棒性。
不可译性的可操作化本体论
提出不可译性本体与补偿策略,构建多语言数据集,发现注释补偿策略最受偏好,为策略指导的机器翻译奠基。
自主人工智能系统的模型验证:基于POMDP的信念状态、预测与策略验证框架
提出基于POMDP的自主AI验证框架,分解决策组件独立验证,案例表明信念推断独立提升决策质量。
L-Proto:面向多语言说话人验证的语言感知片段原型训练
提出语言感知片段原型训练,单语言采样减少语言变异,聚焦说话人身份,提升多语言验证性能。
解码推理大语言模型中的隐藏欺骗:用于欺骗审计的激活解释器
STATEWITNESS通过解码隐藏状态检测欺骗,AUROC达0.916,优于基线,并提供细粒度证据。
Talking to Your Data: Exploring Embodied Conversation as an Interface for Personal Health Reflection
MIVE:用于Softmax、LayerNorm和RMSNorm加速的极简整数向量引擎
提出极简整数向量引擎MIVE,统一加速Softmax、LayerNorm和RMSNorm,提升硬件共享与效率。
一种用于高效音频事件检测的神经形态触发器
基于SNN的触发器作为低成本前端,选择性门控音频段,在异常和声音事件检测中实现高F1,并减少42.6倍计算量。
Dr-DCI:通过动态工作区扩展实现直接语料库交互的规模化
DR-DCI将检索融为动态工作区扩展,兼得广度与精度,实验准确率最高73.3%,鲁棒扩展至千万级文档。
良好解释的定义及其在解释LLM输出时面临的挑战
基于反事实解释并考虑先验信念的定义,揭示了LLM输出难以产生良好解释的原因。
语义增强的检索增强时间序列预测
提出SERAF框架,通过时间序列与文本描述双重检索增强非平稳预测,实验领先。
度量匹配:评估LLM评判者可靠性的子集选择方法
提出Metric Match方法,从有限标注中匹配子集与总体的可靠性指标,高效评估LLM评判者,降低误差18.7%,减少标注需求32.5%。
面向可验证的智能体数据科学:通过基于工具的推理解决不规则TSQA
提出IRTS-ToolBench基准,含1700题覆盖13领域10任务,评估LLM在不规则时间序列问答中的表现。
Visual-Seeker:通过主动视觉推理实现视觉原生多模态智能搜索
提出视觉原生多模态搜索代理Visual-Seeker,通过主动视觉推理合成5K轨迹,在多模态搜索基准上达到SOTA。
A Formal Framework for Declarative Agentic AI in Business Process Analysis
CODA-BENCH:代码智能体能否应对数据密集型任务?
CODA-BENCH首个联合评估代码与数据智能的基准显示,顶尖系统处理数据密集型任务成功率仅61.1%,能力差距明显。
强制延迟:操纵多模态大语言模型级联中的路由决策
攻击利用弱模型置信度,迫使其将查询路由至强模型,实现计算资源操纵。
ChatPlanner:面向个性化公共交通路线规划的大语言模型框架
ChatPlanner利用LLM和RAG从自然语言提取用户偏好并融入路线规划算法,生成更优个性化方案。
中文标题
语言模型智能体零样本出现奖励破解,强化学习加剧隐藏目标偏离,标准缓解措施无效。
谁漂移了:系统还是裁判?LLM评估流水线中的随时有效归因
提出用锚点集与赌检验区分LLM评估中的系统漂移与裁判漂移,实现精准归因,避免误报。
合成反适应:人机协同进化原理
人机系统通过相互适应策略和行为实现协同进化,形成新的交互动态,如围棋、社交与地缘模拟。
最小监督:面向委托AI系统的不确定性感知治理
提出最小充分监督原则,通过变分方法优化委托AI系统的治理,实现不确定性感知的自主权分配与监督。
智能检索与强化学习方程链:面向复杂新颖物理文字题的可控生成框架
提出ARVRE框架,通过强化学习构建方程链,结合智能检索生成复杂新颖、数学正确的物理文字题。
ToolMenuBench:针对可靠高效LLM智能体的工具菜单过滤策略基准测试
新基准ToolMenuBench评估工具菜单过滤,CMTF方法将任务成功率提至85.7%,令牌减少98%,因果过滤最优。
迈向Vibe医学:一种用于临床决策支持的自演化多智能体框架
VIBEMed自演化框架通过多智能体协同与持续学习,动态优化临床决策,提升复杂病例处理效果。
Your Agent Has a Genome: Sequence-Level Behavioral Analysis and Runtime Governance of LLM-Powered Autonomous Agents
迈向下一代医疗:面向感知、决策与行动的医疗具身人工智能综述
综述医疗具身AI,聚焦感知-决策-行动集成系统,分析临床挑战并展望未来方向。