训练任务
legal-qa-7b-lora-v3
运行中2,140 / 3,000
legal-qa-7b-lora-v2
已完成 · acc 91.23,000 / 3,000
legal-qa-7b-lora-v1
已完成 · acc 84.63,000 / 3,000
cs-dialog-dpo-v1
排队中0 / 1,800
超参数
base Qwen2.5-7B · LoRA r=16
lr 1e-4 · epoch 3 · QLoRA 4bit
Loss 曲线— train 0.41— eval 0.58
评测集准确率68.4 → 91.2
算力占用
GPU 0 · A10096%
GPU 1 · A10094%
GPU 2 · 409061%
数据管线
1原始语料 12.6 万条
2清洗去重 8.4 万条
3指令集构造 5.2 万条
4人工抽检通过 98.2%
基线对比 · 客服领域 1,200 题评测集LLM-as-Judge + 人工抽检一致率 96%
微调模型在风格与流程维度反超通用旗舰模型,业务问答准确率追平 GPT-4o(差距 <1.5pp)
单次推理成本
¥0.003
对比旗舰 API ¥0.028 ↓89%
P50 延迟
0.8s
vLLM + AWQ 4bit 量化
私有化部署
2×4090
数据不出内网
finetune_eval · 垂直领域大模型微调与评测平台
项目背景
通用大模型答不好垂直业务:直接调用旗舰 API 幻觉多、口风不对、成本高;RAG 只能补知识,改不了回答风格与流程遵循;而业务方要的不是「像样」而是「可用」——准确率、延迟、单次成本都有硬指标,私有数据还要求不出内网。
解决方案
提供从数据到上线的微调闭环:业务语料清洗去重,构造 5 万+ 条指令数据(QA / 多轮对话 / 流程遵循样本);基于 7B 级开源基座做 LoRA / QLoRA 参数高效微调,DPO 对齐回答风格;自建领域评测集,LLM-as-Judge 自动评分 + 人工抽检双轨验收;vLLM + AWQ 4bit 量化私有化部署,单次推理成本较旗舰 API 下降约 89%,P50 延迟亚秒级。