字节Seed团队发现DeepSeek-V4表现随Token位置周期性波动
字节Seed研究人员发现,DeepSeek-V4系列模型的代码补全和长上下文检索表现会随目标信息在输入中的位置周期性变化。代码补全测试中,前置填充长度每4个Token重复一次,错误答案32与正确答案8的概率会明显反转;在128K Token检索测试中,DeepSeek-V4-Flash-Base不同位置的准确率最大相差40.2个百分点。
字节Seed研究人员发现,DeepSeek-V4系列模型的代码补全和长上下文检索表现会随目标信息在输入中的位置周期性变化。代码补全测试中,前置填充长度每4个Token重复一次,错误答案32与正确答案8的概率会明显反转;在128K Token检索测试中,DeepSeek-V4-Flash-Base不同位置的准确率最大相差40.2个百分点。
DeepSeek Harness 发布 v0.2.1-alpha.1,加入实验性 Claude Code Mods 兼容层,尝试让按 Claude Code Mods 接口编写的扩展接入其插件系统。文中列出 Token Weather、Blast Radius 和 Replay Theater 三个桥接示例,并提到新增“让 Agent 创建插件”的入口及配套开发者工具包。
DeepSeek弹性计算团队正在扩招,并介绍了支撑Agent训练、评测和数据预处理的DSec沙盒基础设施。文章称,一套DSec扩展分片约有160台服务器、3万个CPU核心和250TB内存,高峰期同时在线沙盒超过38万个。
美国企业正将部分 AI 工作负载从 OpenAI、Anthropic 等前沿模型转向开放权重模型,中国公司的模型也进入这一选择范围。AT&T 每天处理约 450 亿 Token,约 40% 的 AI 工作负载已使用开放模型,并计划一年内提高到 70%;Tinder 估算的年度 AI 支出则从 1 月的约 100 万美元升至 7 月的 1000 万美元。