3. 模型与基准 (Models & Benchmarks)
- 每日 AI 研究简报 · 2026-08-25 - CSDN博客
1 day ago · 这与今天 ArXiv 上 SWE Refactor Bench 的研究互相印证——在整库级代码迁移这种长程任务上,顶尖模型也仅有 5.4% 的运行能通过全部评测。 落地没有魔法,约束与评测才是关键。 📰 AI 今日看点
- 2026年AI大模型综合排行榜 - AnyRank - AnyRank
2 minutes ago · 趣事与总结 本月榜单显示, Anthropic 和 Google 在第一梯队竞争极其激烈,二者在编程能力(Code Arena / SWE-bench)与综合指标上交替领先;同时, 国产大模型 (智谱、月之暗面、阿里巴巴)表现异常强劲,稳居全球前20,并在中文特定语境与性价比上确立了护城河。
- AI Benchmarks 2026 - MMLU, GPQA, SWE-bench | LM Market Cap
1 day ago · Compare AI models across 17 benchmarks including MMLU, GPQA Diamond, MATH-500, HumanEval, SWE-bench, and Arena Elo. See current leaders, score history, and interactive charts for 350+ models.
- M42's Blog
1 day ago · 按理来讲这个任务的评测很简单,先前的SWE Bench差不多也都是这么做的:告诉模型做一个怎样的迁移,然后列一堆点来挨个测试,测试通过就满分,测试不通过就按点扣。 但是作为软件工程的基础设施,这些轮子的迁移没有那么高的容错率。
- 微软发布 Agent Lightning v1.0.1:一行命令,让 Claude Code 帮你调 ...
1 day ago · v1.0 大重构:3500 行代码和三个组件 硬核成绩:6K 样本,SWE-bench 涨 14.6 个点 v1.0.1 的新东西:Agent Lightning Skill 怎么上手:有 GPU 和没 GPU 的两条路 社区已经在拿它干什么 核心卖点:零代码改动,用 RL 训练任意 Agent Agent 的强化学习训练一直是块硬骨头。
- Codex接入Deepseek模型 - CSDN博客
1 day ago · 文章浏览阅读77次,点赞5次,收藏2次。codex通过cc-switch接入deepseek或其他国产模型的方法