生存的数字声音:从社交媒体披露到对家暴受害者的支持提供
提出计算框架,从在线自我披露到支持提取,推进对家暴受害者求助与社区支持机制的理解。
YAC:利用生成式AI连接自然语言与交互式视觉探索以支持生物医学数据发现
YAC原型系统融合自然语言与交互可视化,通过多智能体生成声明式输出,支持数据过滤和调整,用户研究揭示改进方向。
场景分割策略下的文本到视频模型越狱攻击
提出SceneSplit方法,将有害叙述分解为多个良性场景,组合后限制输出空间生成有害视频,在五个模型上攻击成功率达68.6%-84.1%,揭示安全漏洞。
HiDe:通过层次化解耦重新思考高分辨率多模态大模型中的放大方法
HiDe框架通过解耦关键令牌与背景干扰,零训练提升高分辨率MLLM性能,在V*Bench等基准达SOTA,内存减少75%。
视觉-语言-动作模型的混合训练
HyT框架使VLA在训练时利用思维链提升性能,推理时可跳过思维链直接预测动作,兼顾效果与效率。
噪声校正的GRPO:从噪声奖励到无偏梯度
提出噪声校正GRPO,建模伯努利噪声并修正,实现无偏梯度,数学与代码任务准确率分别提升6.7%和1.5%。
NORi:一种机器学习增强的海洋边界层参数化
NORi用神经ODE增强物理基参数化,后验训练捕获卷挟,稳定高效且泛化性强。
通过自对弈SWE-RL训练超级智能软件代理
SSR方法仅需源码仓库,通过自对弈强化学习迭代修Bug,无需人工数据,在SWE-bench上显著提升,迈向超越人类能力的超级智能。
MaxShapley:迈向具有公平上下文归因的激励兼容生成式搜索
MaxShapley高效公平归因生成搜索内容贡献,多项式时间计算,资源消耗降低9倍,归因质量与精确Shapley相当。
信息论指导下的奖励模型归纳偏见消除
提出DIR方法,基于信息瓶颈优化互信息,消除复杂归纳偏见,提升RLHF性能与泛化能力。
伴随匹配Q学习
提出QAM算法,通过伴随匹配避免不稳定反向传播,实现无偏策略优化,在稀疏奖励任务中表现优异。
FreeOrbit4D:基于前景完整4D重建的单目视频免训练任意相机重定向
通过前景完整4D重建提供结构引导,解决单目视频大角度重定向的几何模糊及时空不一致。
SuperInfer:面向超级芯片上大语言模型推理的SLO感知旋转调度与内存管理
SuperInfer通过SLO感知旋转调度与NVLink-C2C全双工KV传输,在GH200上将TTFT达标率提升74.7%。
WIND:用于零样本大气建模的天气逆扩散模型
WIND是首个无需微调的统一大气基础模型,通过自监督视频扩散学习先验,以逆问题求解实现零样本天气气候任务。
学习率至关重要:基础LoRA可能足以微调大语言模型
调优学习率后,多种LoRA方法性能接近,基础LoRA即够用,无需复杂改进。
更长的时序上下文如何增强大脑对多模态叙事视频的处理?
更长视频片段提升多模态模型与大脑对齐,较长时序匹配高阶整合区域,叙事任务提示调节区域依赖对齐。
工具增强的闭环优化、仿真与建模编排智能体
提出COSMO-Agent框架,用强化学习教大模型闭环CAD-CAE,通过多约束奖励和工业数据集,显著提升小模型设计可行性与效率。
SOLAR: 一种自优化开放式自主代理,用于终身学习和持续适应
提出SOLAR自主代理,利用参数级元学习和多级强化学习实现终身自适应,平衡可塑性与稳定性,性能优异。
OSCToM:强化学习引导的高阶心理理论对抗生成
OSCToM利用强化学习生成对抗样本,在信息不对称基准上准确率达76%,数据合成效率提升6倍。
AgentCo-op:基于检索的可互操作多智能体工作流合成方法
AgentCo-op通过检索与局部修复合成可互操作多智能体工作流,在开放科学场景和基准测试中高效协调现有工具与智能体。
学习交接:界面约束下可证明收敛的工作流学习
提出界面约束半马尔可夫决策过程及IC-Q算法,理论证明收敛,实验验证效果。
POLAR-Bench:针对LLM代理隐私-效用权衡的诊断基准
POLAR-Bench评估LLM代理隐私保护,前沿模型守住99%,小模型泄漏过半。
渐进自主即偏好学习:智能工具使用中信任校准的形式化
将信任校准形式化为偏好学习,用高斯过程分类动作空间为允许/阻止/询问区域。
How Far Are We From True Auto-Research?
并非所有不确定性都相同:波动性、随机性与探索
研究发现,波动性促进探索,随机性抑制探索,这一不对称性源于噪声推断的差异。
幻觉即漏洞:携带证据的多模态智能体
提出证据携带多模态智能体(ECA),用证书门控阻断幻觉驱动的工具调用,实现0%不安全动作率。
大规模语言模型能否革新调查研究?灾害准备响应实验
提出LLM五阶段框架,A-TLM模型在灾害调查块缺失插补中优于经典方法,建议子组偏差审计。
MOCHA:面向智能体技能优化的多目标切比雪夫退火算法
MOCHA用切比雪夫标量化和指数退火,在多技能优化中全面突破,平均正确率提升7.5%,发现更多帕累托最优解。
生成式递归推理
GRAM将递归推理转化为概率多轨迹计算,支持多假设和推理时扩展,在结构化推理任务上优于确定性方法。
基于符号图建模的冲突鲁棒多智能体推理
提出SIGMA框架,用符号图建模智能体间信任与冲突,经冲突感知消息传递实现鲁棒预测,性能领先。
BLINKG: 一个用于LLM集成知识图谱生成的基准
提出BLINKG基准评估LLM映射能力,发现复杂场景下性能有限,定义了半自动化构建要求。
融合统一建模与探索的生成式自动出价
提出GUIDE框架,融合定向探索与安全回退机制,在淘宝大规模部署中实现广告GMV等指标显著提升。
面向多模型LLM调度器:卸载与抢占的实证洞察
多模型LLM调度中,卸载和抢占导致非线性性能退化,开销主因模型状态重载,需考虑模型敏感性。
超越模式崩溃:面向多样化推理的分布匹配
提出DMPO方法,通过前向KL近似实现分布匹配,防止模式崩溃,在多种推理任务上提升9%-12%性能。
生成-评估一致性:大语言模型自适应评估的必要效度标准
提出GEA效度标准,衡量LLM评分与生成一致性;两步自适应测评中仅恢复一半方差,强一致性限于语法技能,建议细化评分标准。
CogScale:序列处理的可扩展基准
CogScale含14个可扩展合成任务,评估序列认知记忆能力,发现仅注意力机制与状态空间模型在高难度下保持高性能。
EMO-BOOST: 情感增强的视听特征用于提升深度伪造检测的泛化能力
提出Emo-Boost框架,融合情感增强视听特征,利用情感语义线索提升伪造检测跨操作泛化性,AUC提升2.1%。
用于CAD生成的记忆增强强化学习智能体
提出记忆增强强化学习框架,含双轨记忆与动态检索,提升复杂CAD生成的成功率和几何一致性。
将约束程序转化为局部搜索的输入
建立约束优化对称性与局部搜索邻域的联系,自动生成邻域,经六问题验证可行。
通过枚举解上CNN模式识别实现精简约束推理
枚举可行解,CNN对比学习检测模式,LLM生成精简约束,硬化模型性能大幅提升。
中文标题:GroupAffect-4:一个四人协作互动的多模态数据集
中文摘要:发布10组40人的多模态协作数据集,涵盖生理、眼动、音频等信号,支持个体、人际与群体层面的情感分析基准。
从SGD到Muon:基于Schatten-p范数的自适应优化
提出动态LMO几何选择准则,从SGD到Muon自适应插值,性能领先,仅3%额外开销。
OpenComputer:面向计算机使用智能体的可验证软件世界
提出OpenComputer框架,构建可验证软件世界评估智能体,覆盖33应用1000任务,验证器优于LLM评判,前沿模型仍有差距。
从提示到路面穿越时间:智能场景到规划推理中的时间基础
研究时间条件对自动驾驶推理的影响,虽无统计改进,但定性显示预测性危险推理等,建立首个时间场景规划基准。
先验知识还是搜索?LLM智能体在硬件感知代码优化中的研究
LLM智能体代码优化高度依赖预训练先验,迭代反馈效果有限,CUDA改进而TVM IR退化。
可解释的废水数字孪生:自适应上下文条件化结构化模拟器与自我证伪决策支持
开发可解释数字孪生,通过上下文混合专家和自证伪决策,在真实污水厂减少不安全动作43.6%,阻止93/187次N2O误报。
受机器人学启发的基础模型在社交敏感领域中的护栏机制
借鉴机器人学,提出运行时行为控制框架,约束社交敏感领域模型交互轨迹,防止不良漂移。
概率性小型递归模型
PTRM通过注入高斯噪声实现随机探索,无需重训即大幅提升推理准确率(如数独达98.75%),参数仅7M,成本极低。
AutoResearchClaw:自我强化自主研究与人类-AI协作
提出多智能体自主研究管线,整合辩论、自修复与人机协作,性能提升54.7%。
STAR:面向图增强生成的语义调优与尾部自适应检索器
STAR通过令牌交互与路径加权对比学习,缓解语义与长尾偏差,检索和QA性能分别提升1.8%和2.2%。