印度政府监管文件检索增强生成中解析器、分块与嵌入的交互作用
印度政府监管文档RAG因子实验显示:无单一检索器占优,解析与分块交互显著,检索差异主要来自排序质量。
ForensicZoom:基于多模态大语言模型的自适应视觉检查,实现工业级人脸伪造检测
提出自适应视觉检查框架,模型可自主放大可疑区域进行多轮取证推理,工业级检测TPR超97%且可解释。
面向长视频理解的查询对齐视频帧选择
面向多项选择题,将答案选项作为语义线索扩展查询,按问题-答案对的余弦相似度评分选帧,同等帧预算下优于均匀采样。
稳步学习:累积相对点间隔分数用于人脸图像质量评估
提出CARPM-FIQA,累积训练全程相对点间隔分数,稳定人脸图像质量评估,提升判别与排序稳定性。
语言增强的视频动作预判:设计基础、基准与开放挑战
综述提出证据感知设计图谱,交叉任务设定与语言介入点,归纳五类任务,主张假设需匹配验证而非因果结论。
Ongiini-Eval-OW 基准:面向 Oshindonga 与 Oshikwanyama 机器翻译及大语言模型评测计划的概念论文
发布Ongiini-Eval-OW基准计划:600条英语—Oshindonga/Oshikwanyama数据,填补Oshiwambo语MT评测空白。
超越图模型:自适应元学习器融合可解释性、天气与动力学,实现鲁棒的公交到站时间预测
提出HYB(nm)元学习混合框架,融合时序、图模型与天气特征,实现高精度稳健的公交到站预测。
面向SoF数据集的局部人脸识别CNN骨干网络迁移学习对比研究
SoF局部人脸识别对比三种CNN迁移学习,PFN达97.4%准确率,表现最佳。
秩能换来什么?低秩适配的谱与分布分析
LoRA秩非容量控制;范数预算下复杂度与分布位移不随秩变,秩仅决定可及更新及抵消主奇异方向的代价。
MaD-RL:通过强化学习匹配分布以校准大语言模型
提出强化学习分布匹配框架,可将模型输出属性分布对齐目标分布,缓解多样性下降,并在数学与编程任务验证。
面向博弈型与学习型对手的信息设计
带弃权二分类器须依对手设计弃权:近边界弃权利博弈型却泄露给学习型,两种防御不可比。
Transformer MLP 门控阈值是与被携带参考方向的耦合
残差流均值方向是MLP门控阈值参考;阈值由与该方向耦合实现,偏置贡献很小,跨模型验证。
基于事件的行人横穿检测的无监督脉冲特征学习:无需标注训练数据逼近监督精度
无监督脉冲特征学习在行人横穿检测中达90.3%准确率,接近监督,性能主要取决于读出协议。
不要重复自己:面向覆盖率的自监督微调
DRY-SFT先生成多样解法、再独立微调,无需奖励或验证器,大幅提升pass@100与结构多样性。
迈向AI辅助家禽球虫病诊断:评估Gemini与BiomedParse在艾美耳球虫显微图像上的表现
Gemini诊断艾美耳球虫显微图像准确率仅14.9%,偏倚严重,报告未验证、分割不完整,尚不可靠。
EmailBench:评估企业邮件与生产力任务中LLM智能体的基准
EmailBench含206个邮件场景,最佳模型仅通过33.5%,工具调用成功不等于任务完成。
Choir:面向分布式多智能体自动形式化的开放协议
Choir 开放协议将形式化项目拆为独立任务,贡献者各用自有 LLM 智能体、经 GitHub 协作,合并前由确定性门禁校验,支持 Lean 4 等。
基于正交均衡学习的上下文相关智能体评估
提出NashEval,用去偏上下文收益矩阵与正交均衡学习,稳健评估上下文相关智能体。
低光照条件下的视频描述生成:基于高效不确定性感知的描述校正
提出高效不确定性感知校正框架,无需微调VLM,仅用44样本提升低光照视频描述质量。
STAR:面向统一微服务事件管理的自适应时空归一化
提出STAR,以时空自适应归一化统一支持微服务异常检测、故障分诊与根因定位,性能显著领先。
在轨迹展开结束前:长时程编程智能体的早期终端奖励预测
提出CER,用轨迹前缀提前预测终端奖励,在SWE-bench和RL中提升表现并大幅减少token。
面向开源游戏发布事件模拟支撑预测的类型化时序交互特征
提出类型化时序交互特征模拟预测开源游戏发布风险,AUPRC 0.520,与基线相当,仅证协议可复现。
迈向透明诊断:疟疾检测中的架构权衡与可解释性研究
评估多种深度学习模型用于疟疾检测,MobileNetV2精度96.35%且最轻快,自提模型达97.67%,并用XAI提升可解释性。
面向工业目标检测的可读性可解释AI:视觉语言模型适配
微调视觉语言模型,为工业目标检测生成非专家可读解释,清晰度等优于GPT-4o-mini
基于TrOCR的天城文手写字符识别:一种可实时Web部署的Transformer模型
微调TrOCR识别天城文手写字符,字符错误率3.95%、准确率96.05%,并实现低延迟Web部署。
IndicFDB:跨印度语言的全双工语音智能体基准测试
IndicFDB 全双工语音基准扩至十种印度语言,含1.2万样本,发现商业API速度与鲁棒性难兼得。
BioDyad:同步生物医学发现与机器学习工程
BioDyad以双层次蒙特卡洛图搜索协同生物医学发现与机器学习工程,在76项任务上取得最高得分与成功率。
Omni-IO 技能:让智能体原生具备全模态能力
即插即用的 Omni-IO Skills 框架,以27项技能和依赖感知编排,让现有智能体不改推理核心即可原生处理多模态任务。
利用嵌入式编码提升大语言模型的医学计算能力
MedCode训练LLM生成嵌入式代码执行医学计算,准确率提升20–30个百分点。
从相变到系统性失效:面向GNN鲁棒性的解耦分析框架
构建合成基准解耦标签噪声与分布偏移,发现GNN噪声约50%前稳健、之后骤降,极端偏移致误差增48–316倍。
波形协变量偏移下磁芯损耗预测的跨材料支撑迁移
提出MIST跨材料支撑迁移,材料D的p95误差由20.39%降至12.38%,优于基线且无需微调。
从乳腺X线摄影和乳腺超声报告中提取临床发现:专家与人工智能的比较
大模型从乳腺X线和超声报告提取临床发现,Macro F1达0.91,优于人工,可辅助专家核查。
RemTraceNet:不可见水印攻击的小样本取证检测
RemTraceNet融合残差、局部关系与频域统计特征,实现水印移除痕迹的小样本取证,TPR@1%FPR达82.75%~88.17%,远超基线。
面向分布式多智能体协调的LLM智能体符号引导
提出符号引导分类法调节LLM智能体自主性,发现中等自主性在分布式多智能体协调中表现最佳。
解耦并丢弃:基于重建式灰度残差分解的稳健通用图像水印去除
提出DnD通用水印移除法:解耦语义灰度载体与残差分支,丢弃残差去水印;在七类水印上稳健且保真。
能源视觉-语言-动作:面向意图条件化住宅能源管理的受控多模态基准
提出EVLA基准,将住宅电池调度建模为视觉-语言-动作轨迹预测;语言通路显著影响预测质量,视觉通路无聚合优势。
在稳态中衡量学习:BIRD-SQL 一级方程式案例研究
以BIRD-SQL F1晚期窗口评估学习:无界ICL探测骤降但成本翻倍、命中仅微增,不适宜作为学习机制。
在指称游戏中通过提示优化实现冻结大语言模型间的通信
两个冻结大模型在指称游戏中仅靠提示优化通信;优化提示可编码泛化,部分运行成功且协议可审计。
面向乳腺癌诊断的可解释深度学习架构感知鲁棒性评估
系统评估九种可解释方法在四类深度学习架构上的乳腺癌超声诊断,发现解释质量取决于架构与方法交互,需联合选择。
CSI-Agent:面向跨域Wi-Fi CSI感知的LLM辅助小样本自适应
CSI-Agent以LLM规划跨域CSI按类适配,小样本下平均Macro-F1提升约16%。
智能体可利用基础模型规避AI检测
智能体用基础模型拼接样本生成连贯文本,规避AI检测,使检测率77%降至24%,水印失效,但成本增30倍。
面向量化矩阵乘法的乘积感知确定性舍入
量化矩阵乘法中,提出乘积感知确定性舍入:动态激活条件期望近似最优,静态权重NP难,实验优于最近舍入。
迈向基于嵌入的心理测量学:基于情境化分数的测评题目语义结构建模
分析TIMSS数学题情境化分数语义结构,得七组与一般维度;表示优于单因子但未达最优BIC,诊断解释有限。
SenseAgent:面向自适应跨域IMU感知的大语言模型智能体
利用LLM规划跨域IMU感知工具,结合无标签诊断与验证器,实现闭环自适应活动识别。
目标持续型编程智能体作为科学性能工程师:一项固定半径最近邻案例研究
固定半径最近邻案例中,智能体自主去依赖、假设驱动优化,获1.6倍加速并精确复现,可作实验性能工程师。
KinyaMed:要的是种子,而非行数——以错误单位书写的语料要求为何约束不了任何东西
以行数而非种子数设定语料要求,百万行130秒即可生成却仍不达标;评估集与模型均可被表层变动轻易欺骗。
EngramRAG:面向多跳智能体记忆的动态使用加权拓扑与突触巩固
EngramRAG以使用加权动态拓扑与突触巩固机制融合三源混合检索,LoCoMo上Recall@5相对提升38.9%。
大语言模型对初中与高中科学主题理解能力的基准测试
构建NGSS对齐的中学科学基准,评估九款开源大模型,发现规模不决定准确率,合成题目与标准仍有偏差。
自主研究项目管理作为智能体技能:精确谱空间回归案例研究
智能体在消费级硬件上自主完成FFT核岭回归研究,74轮会话仅4次人工干预,倡导可检验的自主研究治理。
量化阈值可复现,失效模式不可复现:波兰语智能体工具使用从8位到2位的三模型研究
三模型六精度波兰语智能体工具研究:仅崩溃阈值可复现于3至2位间,失效模式各异;基准与轨迹已公开。