如何通过三个信息来源辅助大模型选型:Benchmark、Arena AI与 OpenRouter 的分工与边界
模型版本更新比产品迭代还快,但大多数对选型的讨论还停留在"谁的分数高"。
跑分高不等于用起来好,用起来好不等于能落地——这三件事,分别对应三套完全不同的评估逻辑:Benchmark 看能力边界,Arena 看用户真实偏好,OpenRouter 看生产环境里的实际使用情况。
本文不推荐具体模型,只做一件事:把这三个信息源拆清楚,说明它们各自在回答什么问题、有什么盲区,以及怎么组合使用才不容易踩坑。

起点课堂会员权益