Together Evaluations:用开源模型做定制化评测
指南2025年7月28日4 分钟阅读

Together Evaluations 发布早期预览版,这是一个用开源大语言模型当评委的评测框架。无需人工标注,就能快速评估不同模型在你具体任务上的表现。
本文编译自 Together Evaluations: Benchmark Models for Your Tasks,版权归原作者所有。
觉得有用?分享给更多人

觉得有用?分享给更多人
llm 0.33 升级了 OpenAI Python 库并切换 HTTP 客户端,嵌入模型现在支持 --key 参数,llm prompt -t/--template 可重复使用以组合模板,并新增 reasoning_summary 选项用于控制推理摘要的详细程度。
Cloudflare 推出 Bot Preference Sync,自动将 AI 机器人偏好(Search、Agent、Training)同步到 robots.txt,减少手动维护。该功能面向所有用户,并默认开启,同时要求混合用途爬虫提供透明度,否则在禁止训练时仍会被阻止。