双焦扩散语言模型:用于并行生成的非对称双向上下文
提出R2LM模型,融合因果注意力和反向Mamba侧边栏,实现非对称双向上下文,兼顾高吞吐与生成质量。
论共享嵌入序列模型中指令与数据的不可分离性
共享嵌入架构中指令与数据不可分,完美防止提示注入数学上不可能,需架构分离。
中文标题
利用单细胞RNA测序重建人类脂肪细胞发育轨迹,揭示IGF和FGF通路为关键调控网络。
误差空间:空中声学攻击的大规模模拟
大规模模拟揭示声学感知使词错率提升94.5%,提出双形式信噪比解耦攻击效能。
通过激活放大与衰减提升对抗鲁棒性
A3轻量模块通过可学习缩放机制联合放大/衰减对抗扰动,提升鲁棒性且计算开销小。
SEADA: 一种在多精度空间架构上优化混合精度深度神经网络的高效方法
SEADA通过系统级成本模型与熵精度选择,高效解决混合精度DNN在多精度架构上的映射优化问题。
智能体AI驱动的重识别:移动微数据隐私面临的新兴可扩展威胁
实验表明,智能体AI从位置数据自动重识别72%的个体,成本仅分钟级,隐私威胁加剧。
ProMSA:用于知识型视觉问答的渐进式多模态搜索智能体
提出渐进式多模态搜索智能体ProMSA,迭代选择搜索或停止,用序列级RL优化,提升KB-VQA准确率。
SHARD:基于单元密钥的残差分割,用于抗对齐的私有密集检索
Shard通过分裂嵌入为公共前缀和带密钥残差,用CKKS重排序,以少量加密查询大幅增加对齐攻击难度。
像素空间自回归图像生成的并行展开近似方法
提出并行展开近似(PRA),生成低维中间状态缓解误差累积,在ImageNet生成上FID 1.94,创像素空间自回归模型新SOTA。
CPAgents:用于心脏疾病关联的智能体复合表型生成
CPAgents自动构建可解释复合表型,在心脏影像队列中显著提升疾病关联发现能力,优于专家特征选择。
ToolPrivacyBench:面向使用工具的大语言模型代理的目的约束隐私基准测试
提出ToolPrivacyBench基准,审计多工具轨迹中隐私披露,发现任务完成未必隐私合规。
BiDeMem:面向可解释图像修复的双向退化记忆
提出双向退化记忆BiDeMem,通过可检索记忆槽实现可解释图像修复,兼具修复质量与可证伪解释机制。
Mind the Gap: Quantifying the Domain Gap in Cross-Sensor Diffusion Super-Resolution
物理强化:面向机器人操作的物理增强世界模拟器
PhysisForcing通过联合优化像素与语义特征强化物理一致性,解决视频生成物理不可靠问题,提升机器人模拟与操作性能。
高阶傅里叶神经算子:用于非线性偏微分方程的显式模式混合器
提出高阶傅里叶神经算子,通过高阶谱卷积显式混合模式,高效处理非线性PDE,单层效果优于16层传统FNO。
基于概念引导的鲁棒上下文分割
提出CG-ICS方法,通过高层概念与视觉范例引导冻结SAM3,实现高精度鲁棒分割,显著降低参考选择方差。
作为存储库级代码演化的自主硬件设计
HORIZON框架将硬件设计视为代码演化,实现100%基准完成率,但硬件设计代理AI仍未完全解决。
用AI“生成”工作的未来:来自在线劳动力市场的实证证据
AI导致在线劳动力市场总体萎缩,供应降幅小于需求,加剧竞争,并促进高技能者向编程领域转型。
哪个纳什均衡?零和纳什多面体上的求解器依赖性选择
零和博弈的纳什均衡选择由算法决定:正则化方法选最大熵,遗憾平均漂向低熵面,且影响下游表现。
DexCompose:利用单手复用灵巧策略进行多任务操作
DexCompose通过手指级动作所有权和双残差模块组合灵巧技能,平均成功率77.4%。
联合奖励建模:将思维链内化以实现高效的视觉奖励模型
提出联合奖励建模,内化思维链至判别表示,高效评估视觉任务并达到SOTA。
面向多模态大语言模型选择性遗忘的良性记忆遗忘方法
提出SMFA框架,在移除隐私知识时保持模型图像理解能力,实现良性遗忘。
Health-ORSC-Bench:衡量健康情境下过度拒绝与安全完成度的基准
首个健康LLM过度拒绝与安全完成基准,测试30模型,安全优化模型过度拒绝达80%。
GAIA:训练GUI测试时缩放批评模型的数据飞轮系统
GAIA通过直觉批评模型迭代优化GUI代理,实现测试时性能自增强。
直接提问:好奇的代码智能体揭示前沿大语言模型的系统提示
JustAsk框架通过自主交互,无需人工干预即可完整提取前沿模型隐藏的系统提示,暴露了此类安全漏洞。
AgentPSO:基于多智能体粒子群优化的推理技能演化
提出AgentPSO,通过粒子群优化演化多智能体推理技能,提升问题解决能力并实现技能迁移。
SEA-TS: 面向时间序列预测算法自主代码生成的自进化智能体
SEATS框架通过自进化循环自主生成并优化预测代码,结合MA-MCTS、代码审查与全局推理,在多个数据集上超越强基线。
智能体即路由器:面向编码任务的智能模型路由
提出Agent-as-a-Router框架,通过执行反馈循环动态路由,在编码任务中降低累积遗憾并泛化。
POTracker:优化大语言模型以生成符合标准的停电报告
提出POTracker损失函数,兼顾文本与结构相似性,生成停电报告结构准确率达86.47%,优于其他方法。
SIDA:合成图像驱动的零样本域自适应
本文提出SIDA,利用合成图像进行零样本域自适应,通过域混合和块风格转移模拟真实变化,实现高效先进性能。
通过多任务学习校准葡萄物候预测的生物物理模型
提出多任务学习与循环神经网络混合模型,参数化生物物理模型,实现跨品种共享学习,提升葡萄物候预测精度。
面向公平性感知属性表示的无偏分箱
提出无偏分箱与ε-偏分箱问题,通过动态规划和局部搜索算法高效求解,消除分箱偏差并保证公平性。
LinkAnchor:基于LLM的自主式问题-提交链接恢复代理
LinkAnchor是首个自主LLM代理,采用懒访问架构动态检索数据,突破上下文限制与逐对评估局限。
受微分方程启发的深度神经网络
从微分方程视角统一深度神经网络,综述ODE/SDE模型,提升可解释性与泛化。
推理增强的罕见事件预测与平衡结果校正
LPCORP两阶段框架结合推理增强与置信度校正,变罕见事件预测为平衡校正任务,提升精确率,成本降低超40%。
MetaBreak:通过操纵特殊令牌破解在线大语言模型服务
利用特殊令牌绕过LLM安全对齐与内容审核,难以防御,与提示工程协同可显著提升破解率。
使用级联线性特征检测和控制谄媚行为
通过级联线性特征隔离样本,有效检测和引导模型远离谄媚行为,优于基线且计算成本更低。
基准测试饱和之后的生活:以CORE-Bench为例
基准准确率饱和后,应关注构造有效性、效率、人机协作等六维度,CORE-Bench案例显示其仍具评测价值。
加速国际象棋技能评估:漂移扩散增强的Elo评级系统
基于漂移扩散模型,利用走棋数据加速技能评估,更快适应变化且兼容传统Elo系统。
验证视界:编码智能体奖励无银弹
对现代编码智能体,验证比生成更难;奖励信号需兼顾可扩展性、忠实性与鲁棒性,验证必须与生成器共进化。
中文标题:拒绝存在于聊天模型的人格下游
中文摘要:人格门控拒绝,其方向位于人格下游后期层,改变人格可抑制或恢复拒绝。
AlgoEvolve:LLM驱动的算法交易程序元进化
提出AlgoEvolve框架,用LLM进化交易策略,元进化循环改进提示,在噪声环境中持续优化。
知识增强型智能体AI用于心理健康药物信息查询
构建知识图谱多智能体框架,整合患者社区与FDA报告,实现药物信息溯源,区分证据与传闻。
治理行动而非智能体:机构认证作为自主AI系统的治理模型
提出通过独立认证关键行动条件来治理自主AI,不监控推理,保留自主但限制高风险执行权。
COrigami:一种用于协同设计可平折且视觉可识别的折纸的AI流水线
提出COrigami端到端AI流水线,从自然语言生成可平折折痕模式,结合算法优化与美学评估,辅助人类艺术家协同设计。
估计分类器性能的不确定性:在大语言模型与嵌套数据中的应用
评估社会科学文本分类中置信区间方法,发现默认方法不准确,推荐调整有效样本量和特定区间估计。
工具增强的LLM代理在真实能源分析任务中的表现如何?
评估工具增强LLM代理在真实能源市场分析中的表现,涵盖243个专家问题与多维评分。
数据驱动的机器学习无法达到符号级逻辑推理——尺度定律的极限
数据驱动机器学习因训练数据不完整及端到端映射矛盾,无法实现严谨符号逻辑推理,即使准确率达100%仍会出错。
可解释集成学习机器学习模型检测丙型肝炎患者的肝硬化
采用四种集成学习模型检测丙肝患者肝硬化,极端随机树最优:准确率96.92%,召回率94%,精确率99.81%,AUC 96%。