端侧 AI 评测基础设施

让端侧大模型与硬件选型 有据可依

JishuBench 以统一编排与 Host-Target 分离架构,为端侧 AI 的模型、设备与推理方案提供可复现的评测依据。

查看 GitHub
JISHU/BENCHRUN READY

Host

任务编排 · 数据集 · 评分

主流评测

lmms-evaltau-benchterminal-benchclaw-eval...

Target

模型推理 · 硬件指标

模型

QwenGemma...

设备

DGX SparkMac Studio...

从评测到选型,一套流程完成

连接模型效果、硬件表现与真实任务,让每一次技术决策都有可比较的数据支撑。

模型与硬件联合评测

统一评估模型效果与硬件表现,支撑端侧模型及设备选型。

多 Benchmark 统一编排

集成主流评测框架,以统一流程完成多类型评测。

Host–Target 分离模式

评测运行于 Host 设备便于部署,模型运行在 Target 设备轻量接入。

部署方式

Host 负责评测编排,Target 只承载模型推理;二者通过 OpenAI 兼容接口连接。

01 / HOST

部署 Host

在工作站或服务器安装 JishuBench、评测框架与数据集,负责 preflight、任务编排和结果评分。

git clone https://github.com/x-aijishu/jishubench.git
uv sync --extra essentials
uv run jishu-bench preflight
target.inference_base_url: http://<target-ip>:8080/v1
02 / TARGET

部署 Target

在边缘设备启动 llama-server,为 Host 提供推理端点;可选启用硬件指标采集。

llama-server --host 0.0.0.0 --port 8080 --models-dir /path/to/models -np 4
可选监控: edge-eval-agent --bind 0.0.0.0:9090
查看部署文档

Phase 1 实测结果

得分参考

项目内部设备的单次任务结果,得分仅供参考。

VLM Core

模型mmmu_valmmbenchrealworldqapopetextvqammstarocrbench总耗时
模型 A-35B-A3B49.4%86.7%77.9%88.8%84.5%69.6%86.0%263 min
模型 B-26B-A4B54.4%84.4%66.4%86.8%68.4%70.0%82.7%300 min
模型 C-9B43.4%83.9%74.9%89.8%83.2%68.2%85.1%271 min
模型 D-27B52.6%87.7%76.0%89.0%84.5%72.4%85.8%570 min
模型 E-31B58.9%87.0%68.9%88.4%71.7%74.4%85.5%657 min

使用 lmms-eval 评测。在 mmmu_val、mmbench、realworldqa、pope、textvqa、mmstar、ocrbench 七项任务上展示主指标得分,并记录 7-task 并行 batch 的墙钟时间。

tau-bench

模型airlineretailtelecompass@1
模型 A-35B-A3B74.0%80.7%90.4%83.5%
模型 B-26B-A4B44.7%78.4%13.2%44.2%

以 pass@1 reward 展示 airline、retail、telecom 三个 domain 的完成情况。