大模型问答质量评测与分析课程项目 · 独立研究
针对开源模型在实际应用中表现不稳定的问题,独立完成 3 个主流开源模型(Qwen-7B、ChatGLM3-6B、DeepSeek-7B)在 280 余条高质量测试样本上的对比评测。从公开数据集收集并人工校验 280 条测试题,覆盖事实问答、逻辑推理、代码补全、安全合规 4 大核心维度;设计多维度评分规则(Rubric)与自动化计算流程,实现评测全流程标准化与可复现;独立执行 n-gram 重叠校验剔除 5% 疑似数据污染样本,固定 temperature=0.7 并进行多次采样平均,有效消除生成随机性带来的噪声。发现 Qwen-7B 在「逻辑推理」准确率(74%)显著高于 ChatGLM3-6B(58%),但在「代码补全」维度相反(62% vs 79%),为不同业务场景的模型选型提供量化依据。独立撰写 8 页《三模型能力对比评测报告》,结合 Matplotlib 数据可视化与典型案例拆解,获课程最高分。
✦ 280 条测试样本 · 4 大评测维度 · 3 模型横向对比 · n-gram 污染过滤 · 8 页量化报告