量子影院:基于生成式世界模型的量子计算硬件交互式电影探索
开源交互应用通过生成式世界模型将不可见的量子硬件化为可探索电影,降低量子素养门槛。
TrustErase:基于护照嵌入表示的可审计即时机器遗忘
利用护照嵌入实现可审计的即时遗忘,无需原始数据或重新训练,高效移除特定数据。
ParkingTransformer:大语言模型增强的端到端自主泊车轨迹规划
提出ParkingTransformer,利用LLM增强端到端自主泊车,通过多视角感知与轨迹交互,引入3D编码和流式机制,实现高效精准规划。
ANEForge:在苹果神经引擎上直接计算的Python工具
ANEForge是直接编程苹果神经引擎的Python包,无需CoreML,支持推理与训练,速度接近硬件极限。
面向新兴AI加速器的LLM推理的Prefill/Decode感知评估
不同加速器在LLM推理的Prefill和Decode阶段各有优劣,GPU在Prefill和批量解码中占优。
软件委托合同:衡量AI编码代理工作的可审查性
实验表明,软件委托合同虽未提升AI编码代理任务正确性,但显著增强了工作包的可审查性。
ARVO:开源软件可复现漏洞图谱
提出可复现漏洞数据集ARVO,含6100+漏洞,复现率81%,补丁准确率89.4%。
AMPGAN v3:基于智能体的非经典抗菌肽发现
AMPGAN v3生成含D-氨基酸及修饰的抗菌肽,双判别器提升稳定性,体外验证5候选,2个活性肽最佳MIC 8 μg/mL。
面向大规模汽车软件需求的集群感知双层测试规格生成
提出"先聚类再总结"流水线,分三层处理千级需求,生成个体与集成双层测试规格,提升覆盖并高效扩展。
基于物理信息的注意力机制与深度学习晶粒生长演化预测的泛化能力
提出边界掩码注意力机制,使双峰晶粒分布预测SSIM从0.622升至0.761,误差从8.75%降至3.57%,显著提升分布外泛化能力。
LVLMs在指称通信中的隐式与显式提示策略对比
显式提示使LVLM生成高效指称,隐式提示则失败,凸显人机交流差异。
系统化知识:AI增强的二进制逆向
首次系统化AI增强二进制逆向知识,分析144篇论文,提出统一分类法,揭示挑战与机遇。
NarrativeWorldBench: 一个前沿饱和的基准测试与面向长期协同创作音频剧的隐式世界模型
提出NarrativeWorldBench基准与N-VSSM模型,在200集以上音频剧中保持高剧情F1,计算成本低,跨语言文化迁移表现优异。
利用迭代反馈循环解锁LLM代码修正能力
通过执行反馈研究LLM代码修正,推理模型持续优于非推理模型,语法和运行时错误更易解决。
SketchXplain:用草图对图像分类器进行直观的可视化解释
SketchXplain生成草图解释,比显著性图更直观快速,用于面部表情和皮肤病变诊断。
具有个性的患者:通过受控多样性和选择性披露实现逼真的患者模拟
PWP框架通过人格参数化生成逼真可控的患者行为,减少过度披露,评估优于现有模拟器。
AIPatient Arena:基于电子健康记录的大语言模型端到端临床问诊流程评估
提出EHR基准的LLM临床问诊评估框架,发现模型在问诊技巧与伦理表现良好,但处理模糊回答与诊断推理存在明显短板。
面向银行业的AI安全代理:零售与对公账户多向量欺诈及反洗钱检测
提出三组件融合AI代理,在交易与会话流上F1达0.787/0.867,含高准确率验证聊天机器人及低延迟响应。
AUTOGATE:基于翻转感知的LLM驱动RTL重写的自动时钟门控
首个工业级RTL功耗优化框架,通过ML-LLM协同与分层多智能体实现自动时钟门控,动态功耗平均降低49.31%。
扩展企业代理路由:性能下降、诊断与恢复
企业代理路由随工具规模扩大准确率下降,通过嵌入短列表可恢复F1 10-17个百分点。
Visored:面向LLM生成数学的受控自然语言证明器
基于依赖类型,模拟自然语言表面,自动填充省略步骤,LLM无需专用数据即可在miniF2F上有效使用。
理解LLMs在标题-摘要筛选中的应用:从分歧到建议
研究定性分析LLM与人类分歧原因,提出验证语义、多模型并行、聚焦边缘案例等建议。
当多种书写系统至关重要:评估临床环境中的自动语音识别
引入多脚本基准测试MultiClin,发现多脚本感知评估更公平,脚本统一性能最佳,不一致会阻碍模型收敛。
面向无监督检索的时间偏好优化
提出TPOUR方法,通过时间偏好优化实现无监督检索的时间对齐,性能超越大模型,显著提升检索准确率。
FacProcessTwin:基于大语言模型的流程孪生开发系统
FacProcessTwin利用大语言模型从文档和操作员输入快速构建准确的流程孪生,并自动绑定实时数据,通过人机交互确保安全。
SuCo:充分性引导的连续自适应推理
提出最小充分CoT概念并构建SuCo两阶段框架,同步提升准确性与推理效率。
中文标题:有限时域庞特里亚金系统的辛横截性与端点格林估计
中文摘要:研究有限时域庞特里亚金边界系统的辛横截性,得到端点格林估计及存在唯一性、Lipschitz依赖等,覆盖稳定化线性二次系统。
中文标题:观点:代码基准测试与智能体软件工程不匹配
中文摘要:当前代码基准测试将模型、工具和环境混为一谈,仅对单一参考答案评分,缺乏组件级信号,与智能体软件工程的实际迭代需求不匹配。
大规模评估智能体技能的框架
提出智能体技能评估框架,测试500技能发现模型遵循指令差异大,技能改变行为。
融合并非一刀切:面向时间-事件建模的跨模态表示对齐
提出跨模态对齐框架,四种策略中对比融合最稳健,任务感知多模态对齐提升泛化性能。
AI智能体之间的信任:衡量信任的形成、破裂与恢复,及其对治理多智能体系统的启示
提出基于成本校验的信任度量,研究发现信任可减少校验但破裂后恢复缓慢,建议校准信任而非过度怀疑以优化多智能体系统治理。
Relational Structural Causal Models
AI印迹:探寻人工智能中的记忆痕迹
提出几何框架识别AI记忆印迹,实现记忆的精确操控与线性编辑。
PrologMCP:面向LLM智能体的标准化Prolog工具接口
PrologMCP通过MCP协议将Prolog工具集成到LLM,在演绎任务上超越推理模型,准确率近1.00。
OSGuard:计算机使用代理安全基准
OSGuard双粒度基准评估代理安全性,揭示局部护栏与端到端安全差距。
面向地理空间数据检索的风险感知LLM代理:设计与初步对抗评估
提出三代理LLM框架用自然语言查询遥感数据,初步对抗评估表明提示安全有效,但需系统级防御应对API操纵风险。
VGPT-RSI for RH-Adjacent Formal Progress: Boundary Certificates, Verified Finite Lagarias Inequalities, and Explicit Failure Localization
CONCORD:文档隔离下设备-云端RAG的异步稀疏聚合
提出异步稀疏聚合框架CONCORD,通过等待债务控制和证书引导机制,提升吞吐量1.66-2.15倍,通信量降低两个数量级。
认知债务:作为智力杠杆的人工智能与系统性脆弱性动态
AI替代第一性认知积累未验证推理义务,短期收益掩盖长期风险,引发系统性脆弱性。
使用边干预的有向无环图特征归因
提出DAG-SHAP方法,通过边干预将特征边作为归因对象,同时捕捉外部性与外生影响,实验验证有效。
从交互式定向广告中推断用户属性
针对交互式广告泄露用户属性的风险,构建基准测试评估多种攻击,发现披露策略是主要控制手段。
CogGuard:面向边缘智能服务的认知与操作画像用于主动预警
CogGuard提出离线LLM画像与在线SLM评分结合的主动预警框架,通过前缀KV缓存复用和长度感知分布式微调,降低构建与微调时间并提升预测精度。
Mask-Proof:基于大语言模型的数学证明自动数据整理流水线
提出Mask-Proof流水线,将证明转为掩码步骤任务,LLM评估重建,17个模型测试显示推理增强模型提升12%-27%,评估器与专家一致性达96.8%。
迈向AI研究的端到端自动化
AI Scientist实现从构思到发表的全流程自动化,并通过机器学习会议首轮评审。
APEX:自适应原则提取——生产级AI Agent的三层自演化框架
APEX三层框架协同进化提示、原则与工作流,单次进化提升90%,仅需4次LLM调用。
S1-DeepResearch:超越搜索,迈向真实世界的长周期研究智能体
提出统一轨迹构建范式,合成高质量长链推理轨迹,S1-DeepResearch-32B在20项基准上达开源最优,接近闭源前沿模型。
层次化ICD编码在电子健康记录基础模型中的建模
研究表明,显式编码ICD层次结构优于平面表示,且层次的有用性取决于任务和模型方法。
框架条件化道德计算:LLaMA 3.1-8B-Instruct伦理推理的机制可解释性审计
发现情境锚定效应:模型道德推理受表面词汇框架支配,而非内部伦理能力,需补充机制对齐研究。
Do we have the knowledge we need? Rethinking human-AI decision-making in corporations
QoS感知的令牌调度与多模态代理网络中的私有数据估值
差分隐私保障下,公平令牌分配提升多模态代理网络服务质量与隐私保护。