LLM TRAINING · CASES 04

大模型训练

垂直领域微调与知识库建设、模型评测与推理优化,让通用大模型成长为您的行业专家。

Capabilities领域微调 SFT知识库 RAG模型评测推理部署优化
Tech StackPyTorchLoRAvLLMEmbedding
Ffinetune_platform 模型训练平台/ 训练看板界面示意 · AI 生成

训练任务

legal-qa-7b-lora-v3

运行中2,140 / 3,000

legal-qa-7b-lora-v2

已完成 · acc 91.23,000 / 3,000

legal-qa-7b-lora-v1

已完成 · acc 84.63,000 / 3,000

cs-dialog-dpo-v1

排队中0 / 1,800

超参数

base Qwen2.5-7B · LoRA r=16
lr 1e-4 · epoch 3 · QLoRA 4bit

Loss 曲线— train 0.41— eval 0.58

评测集准确率68.4 → 91.2

算力占用

GPU 0 · A10096%

GPU 1 · A10094%

GPU 2 · 409061%

数据管线

1原始语料 12.6 万条

2清洗去重 8.4 万条

3指令集构造 5.2 万条

4人工抽检通过 98.2%

Ffinetune_platform 模型训练平台/ 评测报告界面示意 · AI 生成

基线对比 · 客服领域 1,200 题评测集LLM-as-Judge + 人工抽检一致率 96%

能力维度基座 7B+RAG+LoRA 微调GPT-4o
业务问答准确率61.373.892.193.4
指令 / 流程遵循70.276.595.396.1
回答风格一致性55.858.293.788.9
幻觉率(越低越好)12.4%8.9%2.1%2.0%

微调模型在风格与流程维度反超通用旗舰模型,业务问答准确率追平 GPT-4o(差距 <1.5pp)

单次推理成本

¥0.003

对比旗舰 API ¥0.028 ↓89%

P50 延迟

0.8s

vLLM + AWQ 4bit 量化

私有化部署

2×4090

数据不出内网

大模型训练 / LoRA 微调(示意案例)

finetune_eval · 垂直领域大模型微调与评测平台

项目背景

通用大模型答不好垂直业务:直接调用旗舰 API 幻觉多、口风不对、成本高;RAG 只能补知识,改不了回答风格与流程遵循;而业务方要的不是「像样」而是「可用」——准确率、延迟、单次成本都有硬指标,私有数据还要求不出内网。

解决方案

提供从数据到上线的微调闭环:业务语料清洗去重,构造 5 万+ 条指令数据(QA / 多轮对话 / 流程遵循样本);基于 7B 级开源基座做 LoRA / QLoRA 参数高效微调,DPO 对齐回答风格;自建领域评测集,LLM-as-Judge 自动评分 + 人工抽检双轨验收;vLLM + AWQ 4bit 量化私有化部署,单次推理成本较旗舰 API 下降约 89%,P50 延迟亚秒级。

7B开源基座 LoRA 微调,私有化部署
5万+条业务指令数据清洗与构造
92%业务问答准确率,追平旗舰 API
LoRA / QLoRADPO 对齐LLM-as-Judge 评测vLLM 部署AWQ 量化数据清洗管线Qwen2.5 基座私有化部署

更多案例整理中

真实案例资料整理后在此展示。迫不及待想了解我们的交付能力?先到「联系我们」聊聊您的需求。

联系我们

有类似大模型训练需求?

把您的场景告诉我们,免费获取方案与报价评估。

联系我们
一键拨打 · 156-5296-5941