模型与硬件联合评测
统一评估模型效果与硬件表现,支撑端侧模型及设备选型。
端侧 AI 评测基础设施
JishuBench 以统一编排与 Host-Target 分离架构,为端侧 AI 的模型、设备与推理方案提供可复现的评测依据。
查看 GitHubHost
任务编排 · 数据集 · 评分
主流评测
Target
模型推理 · 硬件指标
模型
设备
连接模型效果、硬件表现与真实任务,让每一次技术决策都有可比较的数据支撑。
统一评估模型效果与硬件表现,支撑端侧模型及设备选型。
集成主流评测框架,以统一流程完成多类型评测。
评测运行于 Host 设备便于部署,模型运行在 Target 设备轻量接入。
Host 负责评测编排,Target 只承载模型推理;二者通过 OpenAI 兼容接口连接。
在工作站或服务器安装 JishuBench、评测框架与数据集,负责 preflight、任务编排和结果评分。
在边缘设备启动 llama-server,为 Host 提供推理端点;可选启用硬件指标采集。
Phase 1 实测结果
项目内部设备的单次任务结果,得分仅供参考。
| 模型 | mmmu_val | mmbench | realworldqa | pope | textvqa | mmstar | ocrbench | 总耗时 |
|---|---|---|---|---|---|---|---|---|
| 模型 A-35B-A3B | 49.4% | 86.7% | 77.9% | 88.8% | 84.5% | 69.6% | 86.0% | 263 min |
| 模型 B-26B-A4B | 54.4% | 84.4% | 66.4% | 86.8% | 68.4% | 70.0% | 82.7% | 300 min |
| 模型 C-9B | 43.4% | 83.9% | 74.9% | 89.8% | 83.2% | 68.2% | 85.1% | 271 min |
| 模型 D-27B | 52.6% | 87.7% | 76.0% | 89.0% | 84.5% | 72.4% | 85.8% | 570 min |
| 模型 E-31B | 58.9% | 87.0% | 68.9% | 88.4% | 71.7% | 74.4% | 85.5% | 657 min |
使用 lmms-eval 评测。在 mmmu_val、mmbench、realworldqa、pope、textvqa、mmstar、ocrbench 七项任务上展示主指标得分,并记录 7-task 并行 batch 的墙钟时间。
| 模型 | airline | retail | telecom | pass@1 |
|---|---|---|---|---|
| 模型 A-35B-A3B | 74.0% | 80.7% | 90.4% | 83.5% |
| 模型 B-26B-A4B | 44.7% | 78.4% | 13.2% | 44.2% |
以 pass@1 reward 展示 airline、retail、telecom 三个 domain 的完成情况。