3. 模型与基准 (Models & Benchmarks)
- AI & LLM Benchmarks 2026: Rankings, Scores & Results
3 hours ago · AI & LLM Benchmarks 2026 Explore live AI and LLM benchmark rankings across reasoning, coding, math, vision, agents, and tool use. Compare composite indexes first, then open individual evaluations for score provenance, coverage, and methodology.
- 2026年AI大模型综合排行榜 - AnyRank - AnyRank
2 minutes ago · 趣事与总结 本月榜单显示, Anthropic 和 Google 在第一梯队竞争极其激烈,二者在编程能力(Code Arena / SWE-bench)与综合指标上交替领先;同时, 国产大模型 (智谱、月之暗面、阿里巴巴)表现异常强劲,稳居全球前20,并在中文特定语境与性价比上确立了护城河。
- 每次让 AI agent 写移动端功能都只能等它交出一份「大概能用」的补丁—...
2 minutes ago · SWE-Bench Mobile 移动端 AI agent 编码基准实测:22 个 agent×模型组合最强仅 12% 任务通过率,同一模型换 agent 框架差距达 6 倍,scaffold 才是决定上限的关键。
- DeepSeek开源昇腾基础组件:计算、通信与编译工具同步发布
2 minutes ago · DeepSeek 表示,相比于 CUDA 语言,TileLang的编程模型能够简化代码逻辑、提高算子开发效率和项目可靠性。 同时,其设计又强调充分利用硬件资源。 团队称,这条技术路线已经在英伟达平台得到验证,目前承载了 DeepSeek V4 系列模型训练中大部分算子的实现。
- Arena AI(LMArena)大模型排行榜·官网镜像 10月1号更新
2 minutes ago · Arena AI 中文镜像 前沿AI大模型双盲评测榜单 基于真实人类偏好(Bradley-Terry 模型)计算大模型 Elo 评分的中文镜像站。数据每 20 分钟自动与官方同步,为您提供最新、最公正的大模型能力排名。
- AI Benchmarks 2026 - MMLU, GPQA, SWE-bench | LM Market Cap
1 day ago · Compare AI models across 17 benchmarks including MMLU, GPQA Diamond, MATH-500, HumanEval, SWE-bench, and Arena Elo. See current leaders, score history, and interactive charts for 350+ models.