Assessment of Personality Dimensions Across Situations in Dyadic Role-Play Scenarios
双锚点插值求解器:加速生成建模
提出BA-solver,引入轻量SideNet,仅需5-10步即可媲美百步生成质量,训练成本低且即插即用。
我的杯子拿来!通过视觉注意力提示实现视觉-语言-动作模型的个性化
提出VAP方法,利用参考图像作为视觉记忆,通过检测匹配实现个性化物品操作,无需训练即可提升成功率与正确性。
稳定Q-梯度场以提升Actor-Critic方法中的策略平滑性
策略不平滑源于批判者微分几何,PAVE框架稳定Q-梯度波动,实现平滑性而不改演员。
策略嵌入的图扩展:基于扩散驱动网络样本的网络化HIV检测
提出PEGE框架与DDB模型,提升HIV检测效率,实验使折扣奖励提升17.3%、检测率提高15.4%。
类增量运动预测
提出类增量运动预测新设置与端到端框架,适应新类别并抵抗遗忘,通过伪标签与投票机制实现。
面向LLM推理的强化感知知识蒸馏
提出RLAD方法,用TRRD替代KL正则化,实现优势感知蒸馏,解决分布不匹配与损失平衡问题,提升推理能力。
DF3DV-1K:用于无干扰物新视角合成的大规模数据集与基准
提出DF3DV-1K数据集(1048场景、89,924图),用于无干扰物新视角合成基准,通过微调扩散模型平均提升PSNR 0.96dB
使用本体约束的LLM代理自动标准化遗留生物医学元数据
基于LLM实时查询标准指南与术语服务,自动标准化元数据,准确率优于仅用LLM。
自主性税:防御训练破坏LLM智能体
防御训练系统性破坏LLM智能体多步能力,引发三大偏差且无法防攻击,根源是捷径学习。
FM-Agent:通过基于LLM的Hoare风格推理将形式化方法扩展到大型系统
FM-Agent利用LLM自动生成函数规范,实现大型系统自动化组合推理,14.3万行代码系统两天内发现522个新bug。
TRAP:任务完成与主动隐私窃取抵抗基准
提出TRAP基准评估隐私泄露与任务准确性的权衡,发现现有防御有损任务精度,并提出结构性字段隔离方法。
自主AI代理的抗博弈保险合约:策略证明的通行费机制设计
设计抗博弈保险合约,通过新条款实现激励兼容与预算平衡,应对自主AI代理副作用。
中文标题
通过多智能体强化学习实现超人的安全敏捷竞速,超越人类冠军,碰撞率降低50%,零样本泛化至安全交互。
缓解基于LLM的智能体在节能6G自主网络中的锚定偏差
提出随机锚定策略缓解LLM锚定偏差,结合数字孪生与CVaR保障SLA,实现节能25%且推理亚秒级。
QC-GAN:一种参数高效的四元数Conformer生成对抗网络,用于高保真语音增强
QC-GAN用四元数Conformer和度量学习,0.89M参数达PESQ 3.48,性能媲美两倍大模型,极小参数量变体超越传统方法。
中文标题
提出人机协同管道测量课程覆盖指南程度,应用CS2013与CS2023发现覆盖约50%,能力覆盖88%,但认知深度从95%降至76%,揭示结构性差距。
扩散语言模型:一项实验分析
系统评估8种扩散语言模型在8个基准上的表现,揭示推理设计对性能与效率权衡的影响。
多智能体LLM讨论中的隐藏锚点
隐藏信念锚点可恢复,解释置信度超越初始凸包,不同模型锚点影响强度相似但位置决定闭环需求。
GLARE:用于查询全局解释的自然语言接口
提出LLM中介的交互界面,将自然语言问题转为SQL查询全局解释,提升可解释性AI的可访问性。
BrainG3N:一种用于可控三维脑MRI生成的双用途分词器
提出解耦编码器与解码器的MAE分词器,编码器保留临床信息,在23项任务中超越SOTA,并支持可控生成与纵向预测。
去中心化联盟形成的退出与加入动态
本文研究基于单边退出与加入决策的去中心化联盟形成动态,利用Aumann-Dreze值评估,分析均衡与稳定性。
超越静态排行榜:LLM智能体评估的预测有效性
提出用预测有效性(排名相关性)替代总分评估LLM智能体,设计12层测量与三个分布外标准。
预训练Transformer模型用于古兰经语音识别的比较研究:语音表示、标签格式与数据集构成
本研究系统比较预训练Transformer模型微调用于古兰经语音识别,最佳WER 0.08,训练时间缩减,无变音符文本最优。
自主评审系统的基准测试
评估AI评审系统性能,最佳配置准确率83%,捕获71.6%错误,用户反馈正面,仍需改进。
ORAgentBench:大语言模型代理能否端到端解决具有挑战性的运筹学任务?
ORAgentBench测试表明,最佳AI代理仅通过35.51%运筹任务,失败主因是策略弱点。
元研究者:通过对抗虚拟环境中的自我反思强化学习扩展深度研究
提出MetaResearcher框架,利用演化虚拟世界、发现式任务、自反思元奖励与多智能体协作,提升深度研究代理的训练效率与鲁棒性。
TelcoAgent:基于3GPP可解释的可扩展5G多KPM预测
提出TelcoAgent框架,利用3GPP知识图谱和时间序列基础模型,实现多KPM的准确、可扩展、零样本预测及可解释诊断。
面向AI辅助法律发现中的人工在环编排
提出代理失败分类与四层验证架构,人在回路阈值降低61%特权放弃风险,仅送审25%文档。
大型语言模型黑盒不确定性估计方法的系统评估
系统评估LLM黑盒不确定性方法,发现混合方法表现最佳,为未来研究提供参考。
主体之道:自生成目标AI、嵌入式能动性与自我的消解
自生成目标AI的核心挑战是自我生成与相对化,智能体需同时相信并超越自我边界。
PhysDrift:弥合人形机器人共语动作生成中的具身差距
提出IK-EER和PhysDrift框架,直接生成可执行的人形机器人动作,解决人类-机器人具身差距,提升对齐与稳定性。
通过自动具身对话增强推进DialNav
提出自动对话生成管道构建大规模RAINbow数据集,结合双策略训练与定位模型,使导航成功率提升89%-100%。
基于Lean的过程验证强化学习用于定理证明
利用Lean验证器提供策略级反馈,结合GRPO实现过程与结果奖励,提升定理证明性能。
面向企业级大规模AI的自主事件驱动多智能体编排
企业多智能体系统性能受规模主导,引入任务管理器降低延迟14-75%,提升正确性超20个百分点。
大型语言模型的表面心理特征很大程度上是测量伪影
研究揭示LLM心理特征主要由测量工具的方向性反应偏差导致,而非模型自身特质,占比高达81-90%。
基于超图推理的隐式语义感知通信
提出超图隐式语义推理框架HISR,表示多实体高阶关系,抗噪声能力提升36.6%语义推断准确率。
基于注意力引导深度学习的可解释精子形态分类
提出注意力引导框架实现可解释精子形态分类,准确率超90%,具备临床实用价值。
DeepSWIP:面向神经概率逻辑程序的商WMC反事实推理
DeepSWIP提出单世界反事实语义,通过商WMC精确计算反事实,实现推理加速并消除校准偏差。
IVF实验室环境条件的上下文感知分层贝叶斯建模
通过55个上下文感知特征与分层贝叶斯模型,将IVF预测误差降至1.27%,跨诊所R²达0.86,误差降低64%。
通过交互轨迹挖掘自动生成计算机使用代理的SKILL.md
提出三阶段流程挖掘交互轨迹生成技能库,聚类可读但跨域策略提升有限,作为诊断研究。
Multi-LCB:将LiveCodeBench扩展到多种编程语言
Multi-LCB拓展LCB至12种语言,评估LLM多语言代码能力,发现Python过拟合和语言特定污染。
安全对齐的大语言模型从混合顺从示范中学到了什么?
混合顺从示范中,良性和有害示范不可互换,对有害顺从的影响取决于偏好优化、示范顺序及训练方法。
中文标题:LedgerAgent:面向策略遵循的工具调用智能体的结构化状态
中文摘要:通过单独账本维护任务状态并检查策略约束,提升客服域工具调用智能体的一致性和成功率。
商业环境中的人与AI代理交互
研究商业中人与AI代理交互的用户体验原则及测量方法,为设计有效交互模式奠定基础。
物理Atari:一个用于机器人实时强化学习的鲁棒且易访问的平台
构建低成本鲁棒平台,验证强化学习可直接在机器人上学习,强调设备上适应的重要性。
DynAMO:基于拓扑多智能体调度的动态资产管理编排
DynAMO利用拓扑调度实现动态资产管理,并行执行延迟降低1.6倍,结构化剪枝减少推理延迟30%,保障工业4.0安全高效部署。
利用语码混合引导的合成语音提升语码转换语音识别
提出语码混合引导的偏好学习框架,提升合成语音的语码转换保真度,Whisper Large混合错误率从12.1%/17.8%降至8.9%/14.2%。
执行绑定式代理AI公告自动化:可复现的AIBOM驱动CSAF-VEX框架
提出AIBOM驱动框架,绑定SBOM至环境,自动计算可利用性并生成签名公告,经确定性重放验证,评估含万组件。
基于伊辛模型的自适应概率处理器合成工具
提出基于伊辛模型的自适应概率处理器合成工具,自动构建哈密顿量并自适应选择最优更新算法,显著提升收敛性与灵活性,支持未来硬件实现。