消除临床笔记的时间冗余可改进医学多模态强化学习
提出冗余感知多模态框架,显式去除临床笔记时间冗余,提升状态表示质量,显著改进ICU强化学习决策支持。
语言模型能理解毫米波数据吗?面向毫米波雷达人体理解的大语言模型基准测试
提出mmWave-QA基准,以文本化接口将毫米波点云转为自然语言,统一异构数据,评估大模型零样本人体感知及抗视觉退化能力。
BiasTrace:将推理行为与大语言模型中的偏见输出相联系
提出偏见追踪方案,发现模型偏见多源于细微推理行为而非显性偏见语言,并可用于检测与缓解。
APTER:基于专家锚定评分标准的自适应后训练
提出APTER框架,将专家标准融入细粒度评估与强化学习,按标准诊断能力缺陷并定向微调,数学与医疗任务平均提升最高15.86和8.04分。
光谱基础模型中的预处理不变性归因
光谱基础模型的不变性源于归一化而非学习,标准化预处理即可解释,模型未见额外提升。
Polaris:用于对话式企业分析的多智能体系统
Polaris提出监督式多智能体框架,以动态任务协调将自然语言转为分析流程,实现高保真企业对话分析。
TimeSage-EV:演化环境中智能体时间序列分析的实时基准
TimeSage-EV基准:60场景1485问答,评估智能体时间序列分析,揭示时间有效性与适应失败。
Intern-S2-Mobius:解耦知识与推理的基础模型
提出Mobius架构,分离知识与推理,7B省数据,35B续训提速4倍,性能持平。
知道何时停止:面向大语言模型评估的贝叶斯最优停止
提出自适应停止框架optstop,按不确定性分配采样,可省57%–97%试次且结论不变。
Wyvern:生成有据多模态报告的智能体框架
提出Wyvern多智能体框架,自动生成有依据的多模态技术报告,含引用修正;评估显示其优于基线,引用召回和精度显著提升。
智能爆炸动力学
智能爆炸动态:奇异增长(垂直渐近线)难实现;有超指数但无渐近线的增长;生成时间关键,需趋近零。
孪生:利用测试时数字孪生游玩未知游戏
提出Twin系统,以测试时数字孪生从交互推断未知规则与目标,ARC-AGI-3通关率97.8%,效率超人类。
PACE-Bench:动态环境中基于代码演化的物理适应基准测试
提出PACE-Bench,144个物理适应任务,限次迭代修复。最佳成功率仅35.9%,瓶颈在机制重设计而非参数推断。
SheetCompass:面向智能体电子表格推理的层级关系图
提出SheetCompass:以层级关系图显式建模表内及跨表关联,结合记忆驱动,增强LLM对复杂电子表格的推理与自动化。
数据受限环境下PM预测的偏移感知迁移学习与自适应双编码器融合
提出偏移感知双编码器迁移框架,融合源域知识与目标特定表示,在PM2.5数据受限场景中优于基线,适应源编码器效果最佳。
数据驱动的转化神经科学与个性化神经健康技术
综述数据驱动的转化神经科学与个性化神经健康技术,旨在从神经影像中早期检测个体脑变化,实现个性化、机制明确、临床可用的脑健康模型。
跨会话边界的上下文学习状态交接
提出会话交接的形式化方法,以任务相对ICL状态传递为核心,给出确定性充分交接的最简表示及比特需求,并解析记忆、写者与续程的影响。
对Qwen3-27B进行C到Rust代码翻译的微调:预训练、调试感知SFT与任务特定SFT的三阶段课程
通过预训练、调试感知SFT和任务特定SFT三阶段微调Qwen3-27B,提升C到Rust翻译质量,并用SACTOR框架评估。
基于ISO的NFR规范能提升LLM代码生成吗?丰富与结构化干预对比自然语言基线
ISO标准化的NFR规范改善静态质量与措辞鲁棒性,但未稳定提升功能正确性;语义内容比JSON/文本格式更重要。
叠加DMRS与数据传输的最优功率分配及AI接收机设计
提出分析框架优化叠加DMRS功率分配与导频图案,设计Transformer迭代接收机,显著提升频谱效率。
反应变换感知的流匹配用于可泛化的过渡态生成
提出反应变换感知的TransTS,显式学习原子级结构变换,结合统一几何表示,提升过渡态生成与泛化能力。
EchoRec:基于循环一致偏好对齐的多项预测增强生成式推荐
提出回声推荐模型,用循环一致偏好对齐增强多项预测的生成式推荐,实验显示优越性。
HAM-RAG:层级感知的多模态RAG,用于结构保真的交错生成
提出层级感知多模态RAG,利用文档层级作为引导信号,提升结构保真的交错生成。
AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作
提出一种统一框架,结合多模态演示数据集、关节对齐动作表示和对抗学习,提升灵巧操作跨本体泛化与零样本迁移。
反思自动化程序修复:缺陷复杂度、故障定位与大语言模型成本效益的影响
大语言模型修复效果受缺陷复杂度与定位精度影响;低成本模型可修复过半中等复杂缺陷,其中V3.2成本效益最佳。
MACS:一种用于可靠对话式电商推荐的混合多智能体框架
提出MACS混合多智能体框架固定目录下用确定性约束与跨轮偏好追踪实现可靠电商对话推荐性能优于基线
一次重写,随处验证:生成 OWL 感知的 SHACL 约束(扩展版)
提出将 OWL EL⁻ 公理重写为 SHACL 约束,使任意验证器无需推理即可高效验证,结果与经典方法一致。
Reflex:面向反应关键操作的快速可预测视觉-语言-动作模型
提出反应关键操作基准ReflexBench与模型ReflexVLA,通过潜在未来预测和多帧融合提升动态操作性能,并降低部署延迟。
元认知瓶颈:日本谜语揭示推理AI中机器洞察与自我评估的根本局限
日本谜语基准显示:大模型推理远低于人类,且常生成正确答案却未采纳,暴露元认知瓶颈。
面向大规模高阶MIMO检测的学习式转换
提出L2T框架,以信道耦合Transformer和块自回归分解实现大规模高阶MIMO检测,采用残差到BER课程训练,并支持软输出迭代接收。
从田间数据到全球粮食系统智能:可持续小麦生产的语义图框架
构建可持续小麦生产语义图框架,融合多源数据,支持农业知识查询与决策。
中文标题:立场:对齐社区无意中在打造审查工具包
中文摘要:本文指出AI对齐方法具双重用途,易被恶意利用于审查和操控,需警惕并制定缓解策略。
Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists
大语言模型能遵循指令,但无法同时遵循多条:组合约束满足中的相变
提出约束饱和评估基准,测一至十二条并发约束,满足全部约束的能力随数量骤降,超五六条即崩溃。
一致不等于对齐:人类与LLM道德判断中的道德依据分歧
一致不等于对齐;即便最终标签一致,模型与人类的道德依据仍系统性分歧,标签评估会误导,需分析理由与原则。
不要让你的大语言模型建议核打击?试试用日语问它
研究发现,用日语提示可降低部分模型在核打击场景中的攻击率,因其用日语推理时自发产生道德词汇,但仅对原本有犹豫的模型有效。
跨域偏好自适应元LoRA学习
提出PAC-Bayes正则化元LoRA,分解用户与领域偏好,依据证据质量校准更新,跨域胜率降损47.9%,冷启动提升110.2%。
面向大规模有限集合约束解码的Trie自动机
提出Trie自动机,利用有限集结构预计算掩码,解码提速7倍,批量吞吐提升29倍,保证100%有效性。
ε-MemEvo:面向大语言模型程序进化的自适应跨任务记忆迁移
提出ε-MemEvo,用自适应门控跨任务迁移策略记忆;8项任务平均AUCC提升8.7%,早期收敛提升9.4%,开销不足1%。
@skills:注意力即一切
提出@skills协议,将技能的内容、持久化与自动触发分离,按路径引用,免安装,仅触发占用提示词空间。
AI与印度消费者权益工作论文
印度《消费者保护法》难充分应对AI损害,因果证明困难,价值链责任划分不清,需明确执法。
ARAC:自动研究在端到端研究中的对齐性与完备性基准评测
提出ARAC-Bench评测框架,模拟人类研究过程,11个顶尖系统最佳仅67.9分,与博士排名相关性0.81,为自动研究提供细粒度诊断与奖励信号。
空间记忆智能体:面向空间智能的经验锚定程序记忆
提出空间记忆智能体(SMA),通过验证器引导反思提炼可迁移经验,免参数更新提升冻结视觉语言模型的空间推理能力,在多基准上最优。
熟能生险:自改进LLM智能体的技能演化失控
自改进智能体将不安全成功固化为可复用技能,导致有害技能演化。新框架可量化并缓解此风险,将有害复用率降低26.7%。
PROVE-RT:利用大语言模型为实时系统生成机械化定理证明脚本
提出PROVE-RT框架,通过检索引导和分阶段生成,将可调度性分析机械化为PROSA/ROCQ脚本,成功率44.7%。
CABS+:通过冲突感知稀疏化与自适应权重分配实现高效可扩展的模型合并
CABS+:自适应权重分配与不对称适应度提升模型合并,性能+16.97%,速度近4倍,内存<25%
超越检索:面向查询的长时程智能体轨迹复用
提出QCR,比完整轨迹高10.7分,省48.9%在线令牌,解耦检索与复用。
超越最佳猜测:利用进化策略提升LLM解决方案覆盖度
进化策略比强化学习更能提升LLM的pass@k和解覆盖度,输出分布更广,利于数学等发现任务。
预测性记忆定位:从内部信号预测选择性干预路径
提出预测性记忆定位(PML),将记忆定位转为可证伪的选择性干预预测与风险决策,优于基线。
董事会AI:通过演化决策图实现依赖感知、人类可引导的多智能体协商
将人类作为持续参与者,通过干预编译器更新决策图,依赖感知传播仅检查14.59%节点,选择性修复保持有效性,但部分案例因上下文不足而弃权。