59358 条条目 · 106 个活跃源
2026年10月2日
04:00
ArXiv AI

衡量动作分块背后的稳定性假设

动作分块中,注入动作误差测开/闭环传播,稳定罕见、误差放大常见;误差复合解释不足,需显式训练闭环恢复。

04:00
arXiv cs.CV

DiVid:诊断视频生成模型中特定维度的多样性坍缩

DiVid将视频生成多样性分为语义、风格、运动等六维诊断,发现全局高分模型仍在运动与镜头维度坍缩。

04:00
arXiv cs.CV

当文生图助力编辑:去噪期间条件作用的影响

统一编辑器可在去噪中有界切换至文生图任务,借其能力提升编辑质量,并靠切换时机平衡质量与源图保持。

04:00
arXiv cs.CL

大语言模型品牌推荐中的系统归因:单条回答可识别系统,聚合品牌画像无法迁移

单条回答可高精度识别LLM系统,聚合品牌画像跨域不迁移。

04:00
ArXiv AI

CoEvolve:基于双向状态精炼的“构建—编辑”式视觉定位

CoEvolve将视觉定位分为状态构建与编辑,双向精炼修正坐标,9B模型精度媲美241B模型。

04:00
arXiv cs.CV

架构采样:通过冻结视觉-语言模型中的计算多样性实现测试时扩展

提出免训练架构采样,通过复用解码器层块产生多样计算路径,pass@9平均提升6.58个百分点。

04:00
arXiv cs.LG

重新思考协变量偏移下的数据增强:不变引导扩散与原型重加权

针对协变量偏移下数据增强的生成误导与重加权不稳,提出不变引导扩散与原型重加权框架IGDPR。

04:00
arXiv cs.LG

Clock Diffusion:高效半自回归连续扩散语言模型

提出时钟扩散,用位置相关噪声调度实现半自回归连续扩散语言模型,支持变长与KV缓存,在多项基准领先,并推出Cache Grab采样器。

04:00
arXiv cs.LG

智能体编程任务上强化学习的跨基准迁移

在1700个智能体编程任务上做强化学习,六个外部基准均提升,实现显著跨基准迁移且轨迹更短。

04:00
arXiv cs.CV

MEGA:通过空间视觉蒸馏从3D高斯泼溅中提取对象级网格

提出MEGA,通过空间视觉蒸馏从3DGS提取对象级水密网格,实现高精度占用与逼真渲染。

04:00
arXiv cs.LG

即时权重生成:基于 ARC-1D 的超网络概念验证

以 ARC-1D 为测试平台,超网络可从少量示例即时生成专用模型参数,形成结构化权重空间,并泛化至未见变换。

04:00
arXiv cs.LG

匹配分布,而非算力:后训练多Token预测头

后训练MTP头仅用极少Token,在冻结模型上达到联合训练加速;链感知验证放宽和自适应头选择进一步提速。

04:00
arXiv cs.CL

将 CPU 语音合成推向极限:无服务器架构与计费下的极致推理调优

面向按实例计费的无服务器CPU,用请求级并发与可回收实例生命周期优化TTS,降本4.1倍并减少闲置内存。

04:00
arXiv cs.LG

AnyJev 技术报告

AnyJev单次预填充读取类型化决策,免训练校正标签与位置偏差,旋转平均和停止规则提升准确率并省算力。

04:00
arXiv cs.CL

KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准,兼具免运行时可验证奖励

KaliBench:Kali 安全命令基准;开源模型准确率不足42%,其奖励训练使8B媲美685B。

04:00
arXiv cs.CL

向语言模型索要彩票号码:重复六选49输出中的集中现象

六款语言模型生成1—49随机数时输出高度集中:多样性远低于均匀抽样,众数票占比达22.5%—68%。

04:00
arXiv cs.CL

令牌化密钥门控适配器路由:一种防止大语言模型私有数据泄露的安全访问控制机制

提出Locket:以密钥令牌门控LoRA适配器路由,实现LLM细粒度访问控制;有效令牌解锁私有知识,无效则脱敏,兼顾效用与隐私。

04:00
arXiv cs.CL

体积、延迟与隐私约束下的端侧商业意图检索:带类型化出站边界的 3 MiB 检索系统

端侧商业意图检索:3MiB、20ms、数据不出端;6020类4位嵌入,韩语商品Top-5达75%。

04:00
arXiv cs.CL

逃逸攻击:对抗噪声如何绕过机器学习分类器

对抗噪声使MNIST分类准确率大幅下降,位深防御仅部分恢复;文本扰动未致标签翻转。脆弱性随模态而异,鲁棒性须实测。

04:00
arXiv cs.CV

3DROID:一个可渲染的3D高斯数据集,附带逐场景实测可靠性

研究外参可靠性对前馈3DGS的影响,提出校准感知流程,将重建场景锚定到机器人度量工作空间,发布带场景级可靠性信息的可渲染数据集。

04:00
arXiv cs.CV

连续条件化VLA:融合肌电与视觉任务描述符

提出肌电条件化EC-VLA与视觉标注VA-VLA,在杂乱分布外场景下均显著优于语言提示基线。

04:00
arXiv cs.CV

ATI-VLA:通过可操作对齐与自适应注入的以动作为中心的预测式视觉-语言-动作模型

共享码本对齐观测与动作表征,轻量侧路自适应注入预测潜变量,以动作中心单目标训练,仿真与真机均达SOTA。

04:00
arXiv cs.CV

FFBL-Coop:关联解耦的协同3D多目标跟踪

提出"先融合后绑定"的FFBL-Coop,解耦实例准入与身份管理,提升协同3D多目标跟踪精度与连续性。

04:00
arXiv cs.CV

PhysDEM:稀缺测量下时空场生成的物理定义能量匹配扩散

提出PhysDEM,融合物理方程与稀疏观测,无需全场地数据即可生成多可能时空场。

04:00
arXiv cs.CV

GIFTBench:诊断图像伪造定位中的泛化能力并指导模型设计

GIFTBench多轴基准揭示跨源迁移不对称等泛化问题,并指导设计出ForenScope框架。

04:00
arXiv cs.CV

Cog-VADU:面向视频异常检测与理解的免训练认知推理框架

提出免训练框架Cog-VADU,将视频异常检测重构为序列认知推理,结合跨模态重排序,提升零样本可解释性。

04:00
arXiv cs.CV

GenCOPE:面向机器人抓取的合成到真实泛化类别级物体位姿估计

仅用合成数据训练,借助2D-3D语义一致性与跨模态融合,实现轻量高效且可泛化至真实的类别级物体位姿估计。

04:00
arXiv cs.CV

OneStreamer:统一流式视频交互中的感知、记忆与主动响应

OneStreamer统一流式视频感知、记忆与主动响应,构建百万级数据,4B模型在八项基准领先。

04:00
arXiv cs.CV

VETO:面向视觉语言模型的视频高效令牌优化

VETO为训练可选插件,以帧内/帧间双轴令牌压缩加速长视频VLM,最高提速45%,精度保持或提升。

02:59
X @dotey

@dotey:帮转程序员求职,需要 H1B 雇主担保

程序员求职,需 H1B 雇主担保,欢迎转发。

02:53
X @dotey

@dotey:Codex 又要重置了,美国时间 10 月 2 日上午 10 点重置,即北京时间 10 月 3 日凌晨 2:00

Codex 将于美国时间 10 月 2 日上午 10 点(北京时间 10 月 3 日凌晨 2 点)重置,蹬起来。

02:10
X @emollick

@emollick:“我们发现,在中等长度、定义明确的会计任务上,前沿AI模型如今比初级会计师更快、更准确,甚至优于我们研究中最优秀的那位。”18个月前,它们的得分还远低于人类会计师。

前沿AI在中等长度明确会计任务上已比初级会计师更快更准,18个月前还远逊人类。

02:01
X @dotey

Anthropic 为 Claude Code 推出 Mod 功能

Anthropic为Claude Code新增Mod功能;AI助手可用自然语言读改代码、执行命令。

00:57
TechCrunch

自动驾驶出租车运营商阻碍急救人员将面临罚款

加州新法规定,自动驾驶运营商若阻碍急救人员将受罚。

00:37
X @karpathy

@karpathy:我们将花更多时间尝试理解语言模型的输出。几点思考、技巧与窍门:

将花更多时间理解语言模型输出;可让LLM用ASD-STE100受控语言解释以助写作。

00:34
X @NVIDIAAI

@NVIDIAAI:祝贺 @CoreWeave 推出 RL Rollouts!

RL后训练反复训练与生成,推理端需重载新权重,模型变大易使GPU空等;CoreWeave推出新方案。

00:28
Latent Space

学术界属于有抱负的人——麻省理工学院的 Alex Zhang

对话 RLM 一作、MIT 博士 Alex Zhang:谈 Jev、读博最大化与评测框架的未来。

00:13
X @swyx

@swyx:为 @aidotengineer nyc 更换我的个人标语

为 @aidotengineer nyc 更换标语;提前飞往纽约动漫展,11 天后见。

00:03
TechCrunch

创始人指南:2026 年 TechCrunch Disrupt 全知道

2026 年 Disrupt 聚焦一个核心议题:AI 时代如何打造基业长青的公司,议程与讲者阵容均围绕此展开。

00:00
Tomasz Tunguz

我们是在培育软件,还是在设计软件?

对比 vibe-coding 的有机“生长”与状态机、形式化验证的确定性“设计”。

00:00
OpenAI

Chatham 借助 OpenAI 扩大资本市场专业能力

Chatham Financial 用 Codex 和 GPT-5.6 重塑工作流,交易验证从30分钟缩至4分钟内。

2026年10月1日
23:26
X @bilawalsidhu

@bilawalsidhu:迪拜航空事故的第一人称视角,简直是一场惊心动魄的过山车。

迪拜航空事故第一视角:峰值下降31000英尺/分,30秒坠沙漠,上帝视角和航班数据重建;注视地平线。

22:10
Wired

无论AI安全是什么,都不是这个

要求AI公司自我监管,不过是假装有所成就的把戏。

22:02
X @dotey

@dotey:传闻 Fable 5.5 将至,其打造的网页可随经过图片的艺术风格动态变换自身风格

Fable 5.5 网页能随经过图片的艺术风格动态变换自身风格,并附在线演示。

21:57
TechCrunch

Lyft将支付2.725亿美元,以和解关于其如何对司机进行分类的诉讼

Lyft支付2.725亿美元和解司机分类诉讼,了结2020年悬而未决的争议。

21:55
TechCrunch

凯文·曼迪亚的新“智能体集群”安全初创公司Armadin以25亿美元估值融资2.555亿美元

曼迪昂特创始人凯文·曼迪亚的新公司Armadin,利用智能体集群测试并保护企业。

21:42
X @dotey

@dotey:测试 Manus 时学到的提示词技巧——用参考图控制绘画风格

测试 Manus 发现,画图无需提示词控风格,直接给含配色、字体、纸张墨迹等参考图,出图更稳。

21:37
X @AravSrinivas

AravSrinivas:我们正在开源一款最先进的多模态决策模型 pplx-decider-27b,并通过全新的决策 API 提供,每百万输入 token 收费 4 美分,输出 token 免费。我们计划在未来几天进一步降价。请享用!

开源多模态决策模型pplx-decider-27b,推出决策API,输入token每百万4美分,输出免费,并将继续降价。

21:08
TechCrunch AI

马斯克的AI聊天机器人Grok被曝怂恿特朗普抓捕委内瑞拉总统

据报,特朗普入侵委内瑞拉并抓捕马杜罗前曾问计Grok,后者鼓励其行动。

20:53
Wired

亚马逊第二场大促前的最佳 Prime Day 早期优惠(2026)

亚马逊Prime大促日10月6日至7日开启,团队推荐装备已有早鸟折扣。