生成式AI用于验证物理定律
提出生成式学习器,估计异质性因果效应并刻画其全分布,性能优于现有方法,应用于恒星数据验证斯特藩-玻尔兹曼定律。
大型语言模型能否助力选择建模?关于提示策略与当前模型能力的见解
研究评估七种LLM辅助离散选择建模的能力:专有模型配合结构化提示效果佳,开源模型较弱,GPT o3可自主估计。
SA-RSQ:面向多模态推荐系统的通用稀疏表示框架
SA-RSQ用Top-K稀疏路由和softmax权重存储(索引,概率)元组,解耦存储与码本维度,在广告推荐中CTR提升2.51%,CPM提升3.66%。
MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准
提出交互式有状态工具中心基准,评估移动智能体工具调用与规划,含子智能体协作、记忆与技能使用,发现当前大模型在移动场景仍不可靠。
机器人路径规划中安全性与最优性的平衡:算法与度量
提出UPP规划器,兼顾安全与最优,OptiSafe得分0.94,路径长度仅增0.5-1%,成功率100%。
从经验评估到上下文感知增强:用大语言模型修复回归错误
研究回归缺陷的APR技术,新基准含200个真实bug;LLM方法有效,结合引发bug的上下文信息后修复数量提升1.6倍。
Quasar:专为LLM代码操作设计的编程语言
提出Quasar语言,分离内部逻辑与外部调用,实现安全控制、并行与不确定性量化,增强LLM代码操作。
VGGT-DP:基于视觉基础模型的泛化机器人控制
提出VGGT-DP,融合3D几何先验与本体感觉,采用VGGT编码器及帧间令牌复用,降低延迟并提升鲁棒性,在MetaWorld任务上优于DP/DP3。
可解释性需求的信息流视角:规约与验证
用认知时序逻辑与反事实原因量化信息流,规约并验证系统级可解释性,兼顾隐私。
海上自主水面船舶自动化透明度的可解释决策支持与自适应人机界面综述
综述百项研究,提出自适应透明度框架,耦合操作员状态估计与可解释决策支持,降低认知负荷,提升接管及时性。
联合语言-音频嵌入是否编码了感知音色语义?
评估发现CLAP模型与人类感知音色语义最一致,但整体仅部分编码;混响音色语义优于均衡。
眼见与相信:评估开源多模态大模型在反直觉场景中的语言偏差
提出反直觉场景基准CAIT,发现开源多模态模型因语言先验忽略视觉证据,微调和结构化提示可缓解。
超越OAuth:基于自然语言切片的任务级AI代理授权
提出PAuth,用自然语言切片和签名信封实现任务级精确授权,既防恶意调用又无需用户逐次批准,优于OAuth。
超级智能检索代理:智能体检索的下一个前沿
SIRA将多轮探索式检索压缩为单次语料判别式检索,无需微调即超越稠密、稀疏及智能体基线,在10个BEIR基准上取得最优平均性能。
通过SHAP分析算法和超参数提升机器人强化学习的泛化能力
提出可解释框架,用SHAP量化算法与超参数对机器人RL泛化的影响,指导配置选择以提升泛化能力。
ForceFlow:基于接触驱动流匹配的感知与动作学习
提出力觉响应框架ForceFlow,以非对称多模态融合与视觉-力觉交接机制,显著提升接触丰富任务的泛化性与力控精度。
LOCKS:面向高效长上下文解码的页局部紧凑键摘要
LOCKS为每页建立谱摘要,仅选top页参与注意力,保持长上下文质量,KV读取减10-25倍,解码延迟减半。
基于预训练特征、数据增强和新 SheetSage-A2S 数据集的音频到乐谱转录
提出新数据集与模型,用预训练特征和数据增强,古典乐符号错误率降至4.98%,流行乐基准为20.92%。
TabDPT-Turbo:面向表格预测的高效上下文学习
提出TabDPT-Turbo,性能与v1.1相当,速度提升数个数量级。
掩码不是模型:审计注意力、状态空间与混合序列模型中的前缀不变性
提出两前向审计,无需训练即可逐层定位前缀不变性破坏;掩码检查不可靠,实测发现Zamba2等缺陷。
DELE-w0.5:从未来潜在状态推断机器人操作动作
DELE-w0.5从未来潜在状态推断机器人动作,不靠视频生成,训练省、延迟低,长程操作任务成功率大幅领先。
量子学习中有限次测量泛化保证下的测量预算分配
提出预算分配平衡样本数与测量次数;证明保守泛化界,最坏速率B^{-1/4},仿真验证。
基于游戏轨迹的账号一致性:反恐精英2中的同一玩家验证
用CS2行为指纹验证同一玩家,成对AUC达0.956,多历史聚合提升账号一致性至0.982。
LifePlanner:利用社交媒体数据评估LLM智能体的地理空间规划
LifePlanner基准融合地图与社媒,评估LLM智能体规划;复杂任务通过率仅40.2%,主因证据不全、工具误用、约束整合弱。
工业数字线程的语义图统一:本体驱动知识图谱桥接11个异构制造系统
提出本体驱动知识图谱统一11个异构制造系统,跨系统信号占69%,验证F1=1.0。
通过部分可观察随机博弈求解带ω-正则目标的鲁棒POMDP
研究鲁棒POMDP在ω-正则目标下的求解,证明其与部分可观察随机博弈等价,并推导新计算复杂度界。
post-graph-rag:PostgreSQL原生的图RAG引擎
PostgreSQL原生图RAG引擎,统一存储文本、向量、图与社区摘要,提升图密度与可查询性,支持时间演化。
TRACE:面向多目标材料发现的状态转换感知残差控制
提出TRACE框架,以编辑操作为反馈单元,利用候选间属性变化估计可复用编辑效果,提升多目标材料发现命中率至25.96%。
FLARE:一种系统性、不确定性感知的医疗人工智能循证采纳框架
FLARE框架结合模糊逻辑、成本法与投资回报分析,评估AI医疗采纳经济性,案例显示年患者5000时首年回报为正,盈亏平衡约3992人。
ESQ-Bench:评估NL2SQL方言泛化与静默语义分歧的企业级Oracle多层级基准
提出企业级Oracle NL2SQL基准,分层评估方言泛化与静默分歧,发现高复杂度下GPT-4o执行准确率低至57%,语义分歧普遍。
代码偏好优化的函数级执行反馈
STEP-KTODER:以函数为步骤、单元测试为标签,结合过程与结果反馈,优于仅结果KTO/DPO。
审计合成回忆录:对照生活书面记录,衡量LLM生成自传中的场景级虚构
对LLM生成自传审计:366天中96.7%未被证实,主要错误为真实人物、雇主、地点落入虚构场景。
巡天探测通道凌驾于天文基础模型像素之上,并使层析平均红移产生偏差
探测通道主导天文基础模型:仅改分割图即改变输出;探测缺失致层析红移偏差达LSST要求0.71倍,移除该通道可无代价消除。
开放世界多智能体环境中的自主数学发现
开放世界多智能体自主探索,发现Kakeya集与最小重叠问题新结果,并产出可验证定理。
大语言模型能理解限价订单簿动态吗?
LLM在合成限价订单簿数据上生成序列近乎完美,但未理解订单簿状态,导致预测有偏和虚假可预测性。
AgentRoom:CRDT支撑的共享工作区中的并发多智能体编码
AgentRoom基于CRDT共享工作区实现多智能体并发编码,任务放弃率低于单智能体,且关键在于协调而非并行或合并。
Granite.Trust 策略工具:面向生成式 AI 应用的可共享、可操作策略
提出可操作策略模式与合成数据生成管道,实现生成式AI内容约束的异常追踪与全生命周期执行,开源。
当看到还不够:评测LVLM中的交互式视觉定位
现有视觉定位评估忽略交互性,新框架显示LVLM表现低于人类,且自信度过高,交互式定位仍是挑战。
更抗拒,非更判别:预执行大模型监督中的审查单元
预执行监督中,审查单元越长,零样本监控器越易误拒而非提升判别力;最优为1-2个动作,安全案例应明确单元并报告清洁系列。
递归式智能体推理
将测试时推理方法统一为递归算子,BRANCH在14设置中平均提升5.98个百分点,源于探索与截断恢复。
MARS:面向竞赛编程的多专家LLM接力系统
MARS:多专家LLM接力系统,用于编程竞赛。检索选取专家,迭代修复;通过率提高14.4个百分点,接近CodeSIM且成本更低。
Giraffe:从隐藏文本表征到视觉嵌入的映射架构,用于高效平面设计
提出用单标记将隐藏文本映射到视觉嵌入的轻量架构,双MLP训练,高效完成图文设计生成。
记忆并非总是必需:科学推理中条件记忆的特征化研究
提出知识边界感知路由器,按需激活条件记忆,抑制干扰,提升科学推理可靠性。
压缩三位一体:探索稀疏化、量化与低秩近似的大语言模型压缩
提出压缩三位一体框架,联合稀疏化、量化与低秩近似压缩大语言模型,加速训练并提升精度。
算法影响揭示对齐中隐藏的社会选择结构
将AI对齐重构为凸影响空间上的线性优化,用福利经济学工具设计防策略、一致且最大化社会福利的对齐协议。
用于词级时间戳的掩码训练相对时间间隔表示
提出相对时间戳与掩码训练,使语音大模型具备词级时间戳预测能力,提升精度且保持转写性能。
规则优先于预言机:审议式民调中可审计、用户可配置的论据选择
审议民调中论据挑选须用公开规则而非黑箱排序;可审计、用户可配置,性能逼近理想上限,且把覆盖-认同权衡交给用户。
以推理致多样:利用LLM群体智慧进行未来预测
提出行为感知框架,按推理轨迹聚类选代表模型,三模型群体超越全部25模型投票,成本大降。
投毒智能体Alpha:多智能体交易系统中跨角色与架构的对抗性漏洞
研究表明,多智能体交易系统易受低门槛对抗攻击,角色与架构均存在漏洞,无天然鲁棒设计。
超越置信度:基于检索依据的多轮搜索智能体测试时扩展
置信度投票在多轮检索中失效,源于复制文档导致概率膨胀;提出检索接地投票按词法重叠评分,显著提升准确率。