创建评测任务,上传 Excel/JSON 数据,并排比较、标注、打分。
支持偏好选择、统计仪表盘。
记录每个模型在此任务中的特征表现
Excel / JSON / 多轮 JSONL
id | category | prompt | ModelA | ModelB | ...id | category | prompt | model_name | responsecategory 列可选{"hash_id":"可选","messages":[{"role":"user","content":"..."},{"role":"assistant","content":"..."}, ...]}在当前任务中添加新模型的响应数据,通过 ID 匹配已有数据条目
id | response 或 id | prompt | response生成一个公开链接,任何人无需登录即可查看本任务的已标注数据和统计结果(只读)。重新生成会让旧链接失效。
生成一个公开链接,任何人无需登录即可查看本条数据的 prompt · 模型响应 · 划选笔记 · 打分 · 特征标签 · 偏好 · 整体备注(只读)。重新生成会让旧链接失效。
协作者可在自己的侧栏看到此文件夹。可编辑者可把任务放入;仅查看者只能查看其中的任务。
添加团队成员共同标注此任务
从其他任务导入相同数据条目的得分、标注等
配置一个 LLM 用于综合分析当前任务的评测数据。API Key 仅保存在本浏览器,不上传服务器。
/chat/completions。默认 https://api.openai.com/v1gpt-4o-mini、gpt-4o、deepseek-chat登录或注册以开始使用
填写评测需求信息
💬 评论沟通