3. 模型与基准 (Models & Benchmarks)
- 2026年AI大模型综合排行榜 - AnyRank - AnyRank
3 minutes ago · 截至 2026 年 3 月,目前的 LLM 综合排名,主要参考 Code Arena 和各项基准测试得分。 | 本月榜单显示,Anthropic 和 Google 在第一梯队竞争极其激烈,二者在编程能力(Code Arena / S | 前三名:Claude Opus 4.6、Gemini 3.1 Pro、GPT-5.
- AI 编程工具—Cursor进阶使用deepseek V3 模型(deepseek + cursor...
今日模型配置页面,这里我们勾掉之前已经激活的模型.创建deepseek-chat 的模型后,选中这个模型,然后在下面的配置框中输入我们刚才生成的API keys.
- Open-Source LLM Leaderboard 2026 | LM Market Cap
1 day ago · Open LLM leaderboard ranking the best open-source language models by benchmarks, pricing, and capabilities. Compare Llama, DeepSeek, Qwen, Mistral, and Gemma with live scores.
- Best Open Source AI Models & LLM Leaderboard (2026)
1 day ago · Open source AI models ranked: Llama 4, DeepSeek, Qwen, Mistral, and Gemma compared by score, pricing, and capabilities. The open source LLM leaderboard updated hourly.
- 2026年LLM评估风向变了:MMLU不再是主角,SWE-Bench登基 - AILog
MMLU(大规模多任务语言理解)曾是LLM评测的黄金标准,满分选手一个接一个。2026年的评测格局正在向三个方向收敛:编程能力(以SWE-Bench为代表)、长程Agent任务(Terminal-Bench等)、科学推理(GPQA Diamond)。
- 开源大模型排行榜 | DataLearnerAI
1 day ago · 排行榜上收录了哪些开源大模型? 榜单聚合开放权重或代码公开的大模型,包括 Llama、Qwen、DeepSeek、Mistral、GLM 等模型。这里可能包含宽松协议、非商用协议或其他受限商用协议;GPT、Claude 等仅 API 可用的闭源模型不在此列表中,可在主排行榜查看。