最近在尝试用LoRA微调Qwen2-7B,想做一个医疗术语问答的垂直模型。数据集是自己整理的5000条医患对话,清洗过,格式也按alpaca模板对齐了。训练时loss降得还行,但实际推理时总感觉回答很泛,甚至有点“幻觉”,比如把感冒说成肺炎风险。我试过调rank(8/16/32)和学习率(1e-4到3e-4),也加了10%的通用数据混合,但提升不明显。想问问有经验的前辈:这种小规模垂直领域微调,是不是应该先做继续预训练(domain-adaptive pretraining)再走指令微调?还是说我的数据量/质量本身就不够?另外,评估时除了BLEU和BERTScore,有没有更靠谱的人工评估维度?有点迷茫,求指条明路。