ProSarc:基于时间韵律不一致性的讽刺识别框架
提出ProSarc音频讽刺检测模型,通过双编码器建模时间韵律不一致性,在多项数据集上领先,并能定位讽刺起始点。
TRACE:面向多模态时间序列基础模型的时间条件估计
提出TRACE条件估计范式,应对多模态时间序列缺失与不规则采样,在医疗和情感分析基准上表现优异。
约束优化中用于子空间预条件的多残差网络
提出MResOpt分阶段残差网络,通过优先级约束分解与阶段感知损失,高效满足高优先级约束,优于基线。
基于AIS的船舶轨迹预测:使用记忆增强神经网络
采用记忆增强神经网络从AIS数据预测船舶轨迹,实验显示性能显著优于无外部记忆的基线模型。
使用TRIBE v2数据增强提升脑到图像解码
预训练模型生成合成数据增强小fMRI数据集,显著提升图像解码性能,最高提升68%,甚至支持零样本解码。
知识应注入何处?多模态迭代生成模型中知识注入的分层框架
提出知识注入分层框架,实验显示多层叠加可减少70.97%的知识违规输出。
智能体记忆:有状态长时任务负载的特征刻画与系统影响
首次系统刻画智能体记忆,提出四轴分类法与阶段感知分析,评测十种系统得出十条设计建议。
人类ALMANAC:面向智能体协作的动作级心理模型标注数据集
ALMANAC数据集含2987个协作动作及心理模型标注,用于评估LLM模拟协作行为与推断心理模型的能力。
Vortex:面向AI代理的高效可编程稀疏注意力服务
Vortex系统实现稀疏注意力算法快速原型与部署,AI代理自动优化算法,吞吐量最高提升4.7倍。
Goedel-Architect:通过蓝图生成与精细化优化形式化定理证明
基于蓝图生成与优化的Lean 4形式化证明框架,在多个基准测试中达到SOTA且成本降低500倍。
AI评估中的地理偏见与多样性
研究识别了生成式AI中的地理偏见(如表征偏差、默认地点偏好),并提出通过评估输出多样性来缓解。
从攻击模拟到SIEM规则:具有探针级可追溯性的确定性检测即代码合成
提出确定性合成自动从BAS探针发现生成SIEM规则,实现探针级可追溯,在多个基准上验证有效。
基于自动微分的有限元材料学习:从全场变形数据学习本构神经网络模型
提出FE-MAD框架,基于自动微分从全场变形数据高效学习本构神经网络模型,无需解析伴随。
饱和陷阱与干预时机的主观性:为何基于情感的触发器和LLM评判者无法对自主智能体进行适时干预
研究发现状态饱和陷阱使阈值触发失效,LLM评判性能差成本高,人类标注一致性极低,干预时机不可靠。
偶然陷入AI情感依赖:日常AI互动如何重塑人际联系
研究发现,日常任务中的AI互动会无意中产生情感依赖,使人们对人类支持的偏好下降10.3%,对AI偏好上升11.6%。
SMAC-Talk:面向大语言模型的星海争霸多智能体挑战的自然语言扩展
SMAC-Talk是评估大语言模型智能体在合作多智能体环境中通信与信任的开源基准,含欺骗场景。
StepPRM-RTL:基于逐步过程奖励的LLM微调增强RTL综合
提出StepPRM-RTL框架,结合逐步轨迹建模与过程奖励模型,提升LLM生成RTL代码正确性,性能提升超10%。
探索智能体记忆系统的跨场景通用性:诊断与强基线
研究发现记忆性能关键在于智能体主动控制存储检索,AutoMEM通过自管理工具接口实现最佳跨场景通用性。
基于状态锚定动态检索的Web代理在线技能学习
提出SGDR方法,通过状态动态检索实现逐步骤技能复用,在WebArena上平均成功率提升10%以上。
BiNSGPS:通过双向神经符号交互解决几何问题
提出BiNSGPS框架,建立多模态大语言模型顾问与符号求解器的双向交互,动态纠错,提升几何问题求解鲁棒性。
MapAgent:面向城市级车道级地图生成的工业级智能体框架
MapAgent通过规范验证与约束推理实现车道级地图生成,已覆盖超360城市,自动化率超95%。
通过成本划分学习可采纳启发式
首个保证可采纳性的机器学习启发式,利用拉格朗日对偶学习成本划分,减少节点扩展。
SCI-PRM:一种工具感知的过程奖励模型用于科学推理验证
提出Sci-PRM,通过工具链轨迹和细粒度奖励,提升科学推理中工具使用准确性与模型性能。
帕特农法律:一种自我进化的法律智能体框架
提出Parthenon框架,通过大规模实证和反泄漏学习,显著提升法律任务性能。
先计划,后评判,运行更优:一种受DMAIC启发的工业异常检测代理系统
受DMAIC启发提出多智能体系统,先标准化规程再评判策略,检测性能提升37.76%。
MIRAGE:具有隐式推理和生成式世界模型的移动智能体
MIRAGE框架将显式推理压缩为潜在状态,结合生成式世界模型预测界面,大幅减少令牌生成,提升移动智能体效率。
AIP:一种用于学习和管理智能体技能的图形表示
AIP将技能建模为有向执行图,提升任务成功率并支持精确修复,实现可度量的技能调优循环。
推理时漏洞不止于浅层安全:沿生成轨迹对齐
发现推理时漏洞不限于浅层安全,短token注入任意步骤均能危害安全;内部对齐无法预测鲁棒性,需沿生成轨迹训练对齐。
超越目标等价性:面向基于LLM的车辆路径问题优化建模的约束注入
提出约束注入与差分测试双验证器,8B模型VRPCoder-GRPO在VRP上达93% Pass@1,超越多个基线。
AutoLab:前沿模型能否解决长周期自动化研究与工程任务?
超长周期优化基准测试发现,模型成功关键在持续迭代而非初始尝试,凸显时间感知与持久迭代的重要性。
AI from concrete to abstract: demystifying artificial intelligence to the general public
DiffAero:一种用于高效四旋翼策略学习的GPU加速可微分仿真框架
DiffAero是全并行GPU可微分仿真框架,数小时即可在消费级硬件上学到鲁棒飞行策略。
SpurAudio:研究少样本音频分类中捷径学习的基准
少样本音频分类中背景相关性导致模型依赖捷径,SpurAudio基准揭示多种方法在背景变化时性能大幅下降,大模型同样脆弱。
用于三维场景中无人水下航行器噪声谱预测的神经辐射噪声场
神经辐射噪声场实现UUV噪声谱连续预测,湖试数据集50-5000Hz平均误差3.5dB。
不可预测的安全性:开放权重大语言模型中依赖领域的合规性与透明度差距
开放权重LLM安全行为高度依赖领域,合规率跨71个百分点,技术框架绕过造成透明度缺口,威胁可信部署。
MaskForge:面向扩散大语言模型越狱的结构感知自适应攻击
黑盒自适应攻击,通过结构模式库与UCB选择,平均越狱成功率79.3%,迁移至AdvBench达88.2%。
超越静态先验:面向大规模蚁群优化的动态神经引导
DyNACO通过动态观察信息素和当前解实现神经引导,在百万节点TSP和CVRP上超越静态先验,开销低于1%。
面向通道的脑电图音乐重建设计
提出通道导向设计,保留微弱信号,实现脑电图到音乐稳定重建,显著优于现有技术。
无形彩票:细微线索如何左右LLM代码生成的算法选择
LLM代码生成中,上下文无意线索会导致算法选择的系统性偏移,形成影响性能与安全的“隐形彩票”,直接命名算法可缓解。
SymTRELLIS:面向3D生成的对称增强体素潜变量
提出SymTRELLIS方法,在流模型生成中强制任意有限点群对称性,通过速度对称化显著降低对称误差。
可微分听觉环路(DAL):一种超个性化助听器的机器学习框架
DAL框架利用可微分耳蜗模型优化神经网络,匹配正常听觉神经活动,实现超个性化助听,优于传统基准。
携带证明的智能体行为:异构智能体系统的模型无关运行时治理
基于动作证书的运行时中立治理模型,通过五个检查点实现异构系统可移植性,评估证明其有效性。
AgenticDiffusion:基于代理扩散的视觉无人机导航路径规划
提出多视角无人机导航框架,融合语言引导与扩散规划,任务成功率80%,轨迹生成成功率100%。
HighTide:一个由AI代理策划的开源VLSI基准测试套件
HighTide是AI辅助的开源VLSI基准套件,涵盖多设计语言、增量编译和12项代理技能,支持稳定发布。
MimeLens:面向二进制片段的位置无关内容类型检测
MimeLens使用BERT编码器,在随机位置训练,无需文件头即可准确识别任意位置的二进制片段内容类型。
公证代理:面向AI代理行为的接收者认证机密收据
通过接收方签名和透明日志,使所有者独立检测代理篡改行为。
PerceptTwin:用于迭代式大语言模型规划与验证的语义场景重建
通过语义场景构建交互仿真,PerceptTwin利用LLM评判验证规划,提升成功率约39%,增强安全性。
TITAN-FedAnil+:面向资源受限智能企业的基于信任的自适应区块链联邦学习
提出TITAN-FedAnil+框架,自适应聚类过滤恶意更新,GPU加速,轻量区块链同步,边缘设备内存节省81%,提升鲁棒性与资源效率。
利用提示决策变换器实现无线网络的可泛化多任务学习
提出PromptDT,将多小区选择序列化,利用离线轨迹与任务提示实现跨配置泛化,QoE提升49%,无需重训。
DSIRM:学习查询桥接的离散语义标识符用于电商相关性建模
提出查询桥接对比量化和生成式LLM预测离散标识符,实现细粒度相关性,离线AUC提升1.54%,在线指标显著增长。