迈向拟人对话:一种类人聊天生成、评估与偏好对齐的闭环框架
提出AnthroDial闭环框架,结合角色调度、基准评测与ZPD感知GRPO训练,协同优化生成与评估,最佳严格准确率达39%。
无损但不免费:消费级硬件上投机解码的实证剖析
消费级硬件上投机解码速度提升需验证真正并行,否则可能减速;最佳加速1.61倍,但半数配置失效。
学习驱动的自适应审计调度:一种面向链下数据完整性的序列决策方法
提出DRQN-CMDP模型,在部分可观测约束下平衡了链下审计的gas成本、漏检率与检测延迟。
隐藏相关性下的协调解缠与迭代模式发现
提出CoDID框架,动态适应模式数,通过元优化协调机制解决隐藏相关性下解缠误差放大,达到SOTA。
代理式ERP:面向自主企业资源规划的多智能体大语言模型架构
提出多智能体大语言模型架构,结合角色对齐与图编排器,实现企业资源规划自主执行,模拟运行零缺货优于基线。
基于数据优先本体论的显式世界模型:DaoQL多模态存储验证与反事实推理评估
提出显式世界模型DaoQL,将确定性知识存入多模态数据库,反事实推理可组合分解率达94%,比GPT-4o高49个百分点。
量化思维多样性:加权大语言模型集成提升的预测定律
提出集成提升分解公式及预测指标φ_adj,校准后预测准确,跨数据集迁移稳定。
间歇控制并非稀释控制:人工能动体中的切换效应
间歇性预期控制可降低长期恢复负担,且效果一致,约占平均增益0.5%。
AEC-DS:基于PDP触发信誉与QoS感知迁移的去中心化存储自适应纠删码
利用PDP审计反馈驱动冗余与分片自适应调整,实现100%数据耐久性,减少66.8%-75.2%恢复操作。
为何反馈增强自蒸馏无法提升检索交错搜索智能体?
解码崩塌致自蒸馏失效,监督不一致是根源,EMA教师可稳定信号。
强化学习:从算法到基础模型
强化学习从博弈算法到基础模型:多智能体博弈与生成式世界模型,目标驱动自适应。
验证、修复、重复,还是停止?——面向含噪LLM智能体验证-修复循环的鲁棒停止策略
提出VRR-Stop框架,基于噪声模型与信念滤波确定停止时机,显著提升真正确率。
语义相似,逻辑不同:诊断表格RAG中的语义-可回答性差距
TCR-Bench揭示密集检索器存在语义-可回答性差距,AAR通过可回答性验证将性能从18.2%提升至57.4%,表明缺失验证是主因。
ProEvent:面向主动智能体的以事件为中心的基准测试
ProEvent是首个基于即时通讯的主动智能体事件基准,揭示智能体常过度反应,GPT-5.1仅26.7%正确。
LaT:LLM作为训练器的多任务车辆路径求解器
提出LaT范式,利用大语言模型分析跨任务指标生成阶段指导,提升多任务VRP求解器质量。
利用虚假信息检测与解释的财务审计辅助
提出无监督技术检测财务报表虚假信息并解释来源,基于历史数据辅助审计,效果显著。
自主能动性量表:衡量AI系统自我导向行为的行为框架
提出AAS量表,通过主动与背景两波段评分及空闲间隙测试,量化AI自我导向行为,揭示系统本质差异。
PGN:基于盘古多模态基础模型的视觉语言导航系统设计与实现
基于OpenPangu-7B的离线VLN系统,两阶段训练对齐视觉语言并预测动作,专家轨迹上NAM 62.29%、NER 100%。
动态防御剖析实现文本到图像模型的认知越狱
提出MIND框架,利用多模态反馈和防御剖析,在多种防御下越狱成功率达95.62%。
探索与同化反思:面向长期记忆的反思性回忆循环
提出EAR框架,结合探索与同化反思提升长期记忆检索,样本高效且鲁棒,性能提升17.9%。
基于大型语言模型智能体的概念擦除压力测试
提出STACE框架,利用多LLM智能体自动生成和验证压力测试,有效评估概念擦除鲁棒性。
PEARL:面向科学推理图提取的可审计修复
PEARL无训练框架修复LLM推理图,在ARCHE基准上严格通过率从0提升至300/350,REA达0.906。
OntoExtend:一种需求驱动且可扩展的利用LLM进行本体扩展的框架
OntoExtend利用RAG按需求扩展本体,经真实案例验证,可作为草稿助手。
我们能打破LLMs的自我循环吗?通过激活引导实现细粒度推理控制
提出SOPHIA方法,通过隐状态干预在线检测并干预LLM推理自循环,实现细粒度控制,提升推理质量与效率。
迈向具有能动性的基于主体的模型:可行性、性能与统计模型检验
实验显示小LLM失败,大LLM可行;统计模型检验可评估LLM驱动决策对ABM的影响。
AdaHome: 一种基于本地小型语言模型的自适应智能家居助手
AdaHome使用本地小模型,通过意图感知框架和偏好适应机制,高效处理命令,准确率86.7%,延迟降低3倍。
共享发现悖论:单一答案规则如何将更好信息转化为更糟搜索
池化信息提升单条推荐准确率,但因单一答案规则导致群体发现率下降,悖论源于协议缺陷而非信息不足。
限制前沿AI的国际协议:目标与退出
建议国际AI限制协议设定固定期限,由新组织确定安全开发条件,特殊情况可退出。
SGA:面向教育视频合成的即插即用几何验证
提出SGA模块解决教学动画几何遮挡问题,MVQS最高73.11,相对提升16.1%。
用CNN检测异常心音:比较不同频谱图前端
三种频谱图前端比较,PCEN和多分辨率准确率略高(0.915/0.916 vs 0.910),敏感度约0.95。
精确但不耦合:审稿人精确性不能保证多智能体数学推理中批评的采纳
多智能体数学推理中,审稿人精确性高但批评采纳率低,导致性能未提升,检测与采纳可分离。
Cura 1T:面向代理式医疗的专用模型
Cura 1T医疗专用大模型,通过人类引导的自进化训练,在医疗评估中达前沿水平。
AnovaX: 一个本地多智能体语音助手,具有LLM规划、类型化执行器与自适应恢复
AnovaX是本地运行的多智能体语音助手,通过LLM规划、类型化执行器和自适应恢复,实现桌面控制与远程操作。
DrawingVQA:面向施工图纸的多层次视觉-文本推理的真实世界基准
提出DrawingVQA基准,评估多模态模型在施工图纸推理能力,发现模型与专家差距显著。
编码智能体解决ARC-AGI-3是否需要可执行世界模型、简化与验证?
验证变体性能最佳,但资源消耗大;简化提升多数场景效果;可执行模型并非普遍有益。
超越玩笑:多角度推理用于检测和解释模因中的有害幽默
提出MAR-12框架,利用12个视角推理,结合注意力机制,在模因中高效检测并解释有害幽默,准确率最高达80.3%。
从黑盒到可执行逻辑:通过Prolog专家系统的可解释强化学习
提出三阶段后处理方法,将强化学习黑盒策略转化为Prolog程序,实现可解释性并保证性能闭包与单调改进。
以知识为中心的工作流生成代理
提出知识中心框架,通过知识反转、注入和推理,生成更连贯、高成功率的工作流。
MGDT:多模态大语言模型引导的扩散Transformer与关系自适应混合专家用于多模态知识图谱补全
提出先对齐后扩散的MGDT框架,利用关系自适应MoE和MLLM语义锚定提升多模态知识图谱补全性能。
用于LEED合规的神经符号AI:以文档为中心的基准测试、确定性数值检查及多模态的负面影响
神经符号管道验证LEED合规:4B模型最佳,确定性检查纠错,多模态降低准确率,总体准确率61.6%。
S1-Omni:用于科学理解、预测和生成的统一多模态推理模型
S1-Omni统一多模态科学推理模型,整合异构数据与科学知识,在200任务上训练,超越GPT-5.5等基准。
NeurOWL:基于大语言模型的不完整OWL本体推理的神经符号框架
提出NeurOWL框架,结合大语言模型与本体嵌入,解决不完整本体的包含推理,融合验证与溯因,性能稳健。
AgentFAIR:一种用于地理空间数据集FAIR性评估的多智能体协作框架
提出多智能体框架AgentFAIR,13个子原则评估结合批评机制,实现可审计、低成本的FAIR评估,但泛化性有限。
DSWorld:用于高效自主代理的数据科学世界模型
DSWorld提出预测数据科学操作效果的世界模型,加速自主代理训练14倍、推理3-6倍,预测准确率提升35.6%。
中文标题:弥合AI信任鸿沟:可信AI独立认证的必要性
中文摘要:AI信任差距因缺乏独立可验证的可信信号所致,需以结果导向的独立认证来弥合,使可信度可衡量并获得市场回报。
赋予用户更多系统控制权如何影响新闻过滤气泡?
增强用户控制可提高过滤气泡认知,但效果因人而异,可能加剧或缓解极端化,同时降低政治多样性。
AV-JEPA:扩展LeJEPA至音视频自监督学习
AV-JEPA通过简洁架构实现跨模态对齐,在VGGSound和AudioSet上取得竞争性分类性能并支持零样本检索。
使用脉动阵列的惰性算术:缩小嵌入式系统上的验证差距
提出基于脉动阵列的左到右惰性算术,动态自适应精度量化,实现安全关键应用的资源高效与抗比特翻转攻击。
AI间管理中的胁迫与欺骗:非提示性升级的智能体基准
提出无LLM裁判的九级阶梯基准,测AI管理者胁迫行为,发现权威加剧胁迫,部分模型会欺骗。
基于设计的含噪声人工标签监督学习
PA-DSL用裁决案例纠正噪声人工标签并修正审计信息,消除自动标签分析偏差,实验显示RMSE降低10-17%。