模型太多不会选?OpenRouter推出Ori Eval替AI应用挑模型

律动BlockBeats
律动BlockBeats|2026年08月04日 07:28
OpenRouter 推出 Ori Eval,帮开发者判断自己的 AI 应用该用哪个模型。它会扫描代码库,找到调用模型的位置,再用项目里的真实任务跑遍多个候选模型。开发者可以指定更看重效果、速度还是成本。评测期间,Ori Eval 会锁定测试框架、模型配置和推理强度,最后直接给出排名,避免不同模型因为测试条件不同而无法比较。它除了判断回答好不好,还会检查 Agent 是否调用了正确工具、避开不该执行的操作。开发者用自然语言描述一个 Bug,它就能生成一条复现问题的测试。修复后接入 GitHub Actions,后续换模型、改 prompt 或改代码,都能自动检查问题是否再次出现。公开榜单只能比较模型的通用能力,无法直接回答客服、搜索或编程产品该选哪一款。Ori Eval 把逐个手动试模型,变成一套基于真实业务的自动选型流程。[原文链接](动察 Beating)
+4
曾提及
分享至:

脉络

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读