Together Evaluations:用开源模型做定制化评测
指南2025年7月28日4 分钟阅读

Together Evaluations 发布早期预览版,这是一个用开源大语言模型当评委的评测框架。无需人工标注,就能快速评估不同模型在你具体任务上的表现。
本文编译自 Together Evaluations: Benchmark Models for Your Tasks,版权归原作者所有。
觉得有用?分享给更多人

觉得有用?分享给更多人
Nous Research 以 15 亿美元估值完成 9000 万美元 B 轮融资,由 Robot Ventures 领投,Nvidia、USV、Menlo Ventures、三星等参投,累计融资达 1.58 亿美元。公司将借助这笔资金推出面向企业的 Hermes for Businesses,让企业部署可处理多步骤工作流且数据私密安全的定制化 AI Agent。
微软在旧金山 Tech Week 活动上公布了两款基于英伟达 RTX Spark 芯片的 AI PC:Surface Laptop Ultra 和 Surface RTX Spark Dev Box,主打本地免费跑 AI 模型。新版 Windows 11 引入“执行容器”功能,方便对 AI Agent 做沙箱隔离,且面向所有 Windows 11 用户开放。戴尔同期公布了 XPS 16 Creator Edition 的预售信息。