DeepEval|LLM 评测跑在本地

发布时间:2026/9/9 16:24:20

DeepEval|LLM 评测跑在本地
DeepEvalLLM 评测跑在本地【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval场景引入上次给客服机器人跑回归评测同事问了一句这些测试数据是不是都发去了云端 API不想依赖外部模型、也不想数据出内网的话可以用 DeepEval 做本地评测——它把用例、指标计算都放在你自己的环境里完成。你将跑通什么你能独立完成一整套 DeepEval 本地评测把 Ollama 上的开源模型接进评测流程当打分 judge定义测试用例挂上相关性指标再用一条命令跑完并拿到每个用例的得分和通过与否。整个流程不经过任何云端评测服务。原理一句话本质上就是把打分模型的调用从云端 API 换成本地推理服务指标照常工作只是把 prompt 发给你机器上的模型而不是发往 HTTP 接口。完整实操装好依赖DeepEval 挂在 Pytest 上跑安装只有一条 pip 命令随包带deepevalCLI对应文档见 getting-started。pip install -U deepeval准备本地模型依赖装好后框架需要一个能打分的模型。本地环境里最省事的起点是 Ollama它会在本机 11434 端口暴露一个推理服务若 Ollama 已在后台运行跳过这一步。ollama pull llama3 # 拉一个本地模型 ollama serve # 默认监听 http://localhost:11434接入评测上一步 Ollama 起好后它暴露的推理服务会被内置的 OllamaModel 直接对接不用自己写适配器把它传给指标即可。# test_eval.py from deepeval.test_case import LLMTestCase from deepeval.metrics import AnswerRelevancyMetric from deepeval.models import OllamaModel ... # from deepeval import assert_test case LLMTestCase( inputWhat if these shoes dont fit?, actual_outputYou can return them within 30 days., ) metric AnswerRelevancyMetric( modelOllamaModel(modelllama3), # 打分模型指向本地 Ollama threshold0.7, ) def test_relevancy(): assert_test(case, [metric])跑第一批用例上一步写好的 test_eval.py 就是一个标准 pytest 测试文件直接用随包 CLI 跑终端会逐条打印指标得分和通过状态。deepeval test run test_eval.py还能做什么端到端打分之外DeepEval 还覆盖了离线 LLM 评估的完整链路做本地模型评测时按下表按需取用能力一句话说明对应文档/模块路径LLM 测试用例生成用 ConversationSimulator 模拟多轮对话批量产出用例docs/content/docs/conversation-simulator/黄金数据集生成从你自己的文档自动生成参考答案deepeval/synthesizer/30 内置指标RAG 忠实度、毒性、角色一致性等均支持本地 judge 模型metrics 介绍框架调用追踪捕获 agent 运行的完整轨迹便于做轨迹级评估deepeval/integrations/CI/CD 回归指标写成 pytest 断言模型更新时自动回归docs/content/docs/evaluation-unit-testing-in-ci-cd.mdx踩过的坑OllamaModel 连接被拒确认ollama serve进程活着、模型已拉取默认连http://localhost:11434远程部署时显式传base_url。本地模型 JSON 输出偶尔残缺优先走支持schema参数的结构化输出路径模型实在压不住 JSON 格式就换一个 JSON 能力更强的本地模型当 judge。指标得分时高时低固定 judge 模型版本采样温度保持 0OllamaModel 默认即为 0怀疑模型被更新过用同一组用例对比重跑。接下来可以做的事读 getting-started 快速上手文档多挂几个内置指标对比得分去仓库 examples 目录看完整示例【免费下载链接】deepevalThe LLM Evaluation Framework项目地址: https://gitcode.com/GitHub_Trending/de/deepeval创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

一套代码拿下三大技术栈:考研推荐与分数线预测系统实战复盘

一套代码拿下三大技术栈:考研推荐与分数线预测系统实战复盘

2026/9/9 16:14:20

一套代码拿下三个技术栈:考研院校推荐与分数线预测系统的完整落地复盘 做计算机毕业设计最怕的不是题目难,而是技术栈堆了一堆,最后做出来却像个玩具。今天这个项目刚好是反例:Hadoop、PySpark、Scrapy、推荐系统、分数线预测&…

续费AI监测工具前,团队该查的五类使用指标

续费AI监测工具前,团队该查的五类使用指标

2026/9/9 16:14:20

2. 数据说话:续费AI监测工具前,团队该查这五类使用指标 每次到续费窗口,我都会收到类似的问题:“这个AI监测工具到底还续不续?”问的人往往是团队负责人,手边只剩一封系统自动发来的续费提醒邮件和一个模糊…

测试工程师的Prompt编写框架:用用例设计思维提升大模型输出质量

测试工程师的Prompt编写框架:用用例设计思维提升大模型输出质量

2026/9/9 16:14:20

测试工程师可能是最需要写 Prompt 的人群,这话听起来有点反直觉,但真不是玩笑。我们平时接触的自动化测试脚本、性能测试方案、接口测试用例,本质上都是"给系统下达精确指令",而写 Prompt 给大模型,干的也是…

VC++ MFC中基于TWAIN协议实现扫描仪接入的完整实践

VC++ MFC中基于TWAIN协议实现扫描仪接入的完整实践

2026/9/9 17:14:22

简介:VC下基于TWAIN协议实现的扫描仪完整源码项目,面向Windows应用开发者与图像采集相关技术人员,展示了如何在MFC工程中集成TWAIN库,完成设备枚举、扫描参数设置、图像采集与数据保存等完整流程。资源包共66个文件,包…

深度学习优化实战:从梯度下降到Adam的学习率调参指南

深度学习优化实战:从梯度下降到Adam的学习率调参指南

2026/9/9 17:14:22

1. 这篇读书笔记到底在记什么先说清楚这个编号的来历。我给自己定了一个规矩:读《Deep Learning》(就是那本深度学习领域的“花书”,Ian Goodfellow 等人写的教材)时,每整理一个专题的笔记,就用“书名缩写&…

10款好用的论文降ai工具(2026实测红黑榜!):知网AIGC率从90%降到10%

10款好用的论文降ai工具(2026实测红黑榜!):知网AIGC率从90%降到10%

2026/9/9 17:14:22

现在各大平台查得太严了,大家都在想办法降低ai率。如果数值超标被发现,毕业就会受到很大影响,这是大家都担心的事。所以很多人都在赶紧处理,到处寻找各种免费降ai率工具,希望能够顺利度过难关。 市面上工具虽然多&…

如何快速制作精简版 Windows 11 镜像:用 Tiny11Builder 从原版 ISO 到 tiny11.iso 的完整指南

如何快速制作精简版 Windows 11 镜像:用 Tiny11Builder 从原版 ISO 到 tiny11.iso 的完整指南

2026/9/9 17:14:22

如何快速制作精简版 Windows 11 镜像:用 Tiny11Builder 从原版 ISO 到 tiny11.iso 的完整指南 【免费下载链接】tiny11builder Scripts to build a trimmed-down Windows 11 image. 项目地址: https://gitcode.com/GitHub_Trending/ti/tiny11builder 给老笔记…

SmartBugs 实战:如何用一条命令跑完 25 款工具的合约批量审计而不翻车?

SmartBugs 实战:如何用一条命令跑完 25 款工具的合约批量审计而不翻车?

2026/9/9 17:14:22

SmartBugs 实战:如何用一条命令跑完 25 款工具的合约批量审计而不翻车? 【免费下载链接】ruffle A Flash Player emulator written in Rust 项目地址: https://gitcode.com/GitHub_Trending/ru/ruffle 如果你手里攥着上万份以太坊智能合约&#x…

Cherry Studio 在 Windows 上如何先启用符号链接再克隆仓库?

Cherry Studio 在 Windows 上如何先启用符号链接再克隆仓库?

2026/9/9 17:04:22

Cherry Studio 在 Windows 上如何先启用符号链接再克隆仓库? 【免费下载链接】cherry-studio 🍒 Cherry Studio 是一款支持多个 LLM 提供商的桌面客户端 项目地址: https://gitcode.com/CherryHQ/cherry-studio 如果你在 Windows 上准备从源码运行…

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

中国人民大学杨琳团队《Nature Communications》 | 全球潮汐湿地土壤有机碳时空格局与环境驱动:一项2009-2020年的全球评估

2026/9/9 1:14:29

本文首发于“生态学者”!从“湿地面积”到“土壤碳密度”:为什么需要重新认识潮汐湿地蓝碳变化?潮汐湿地位于陆地与海洋的交汇地带,包括红树林、盐沼和潮滩,是全球重要的蓝碳生态系统。其土壤能够长期储存大量有机碳&a…

adb抓包

adb抓包

2026/9/8 4:55:53

前言 本文介绍如何通过 tcpdump 在 Android 手机上抓取网络数据包,并在电脑端使用 Wireshark 进行分析。适用于需要排查 App 网络请求、分析接口调用或调试网络问题的开发与测试场景。1. 手机要有 root 权限2. 下载 tcpdump3. adb push C:\Users\zhangkuixun\Downlo…

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战

2026/9/8 22:37:26

大模型推理镜像极简瘦身:从 25GB 巨无霸到 3GB 精简镜像实战 在云原生基础设施中,容器镜像体积直接决定了服务的部署速度与弹性扩容敏捷度。对于传统的 Go / Java 微服务,镜像体积通常被严格控制在 50MB 到 200MB 以内,拉取镜像只…

扩散模型图像恢复实战:从DDPM原理到PyQt5可视化系统

扩散模型图像恢复实战:从DDPM原理到PyQt5可视化系统

2026/9/9 0:03:36

简介:面向毕业设计场景的PyQt5扩散模型图像恢复项目,提供完整Python源码与项目说明,适合图像处理、深度学习方向的高年级本科生与研究生参考。项目在模块设计上覆盖图像处理、扩散模型、参数配置、用户界面与结果评估五部分,具体涉…

开关电源环路裕量测试实战:相位裕量与增益裕量详解

开关电源环路裕量测试实战:相位裕量与增益裕量详解

2026/9/9 0:03:36

1. 项目概述:为什么环路裕量测试是电子工程师绕不开的“体检项目”“从零开始的电子工程师生活(6)——环路裕量测试”,这个标题一出来,老电源工程师可能已经下意识摸了摸示波器探头,新同事则大概率在想&…

定时插座芯片怎么选?专用定时IC与单片机MCU选型对比

定时插座芯片怎么选?专用定时IC与单片机MCU选型对比

2026/9/9 0:03:36

拆开市面上不同价位的定时插座,你会发现一个有意思的现象:有的里面躺着一颗黑色的软封装芯片,丝印都看不清;有的则是一块小小的蓝色或绿色PCB,上面赫然印着STM8或者STC的字样。同样叫"定时插座",…

远程协作的工作台整理

远程协作的工作台整理

2026/9/9 16:28:52

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/8 3:19:39

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/8 4:00:23

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…