第10章 减少偏见和有害性
区分偏见与有害性,并比较解码、提示、数据、投影/正则、风格转换和强化学习干预;用上下文合同、计算轨迹和独立证据门交付数据声明、分群指标、标注分歧、效用—伤害权衡与失败案例
学习目标
- 能说明“第10章 减少偏见和有害性”如何区分偏见与有害性,并比较解码、提示、数据、投影/正则、风格转换和强化学习干预,并区分2024年原书目录、原始研究、当前实现和本站重写
- 能先预测“谁定义伤害,哪些群体/语言/上下文被测,干预代价如何报告?”会改变哪一个数据、表示、目标、计算、输出或评估状态,再操作三类交互证据
- 能只注入“删除触发词后毒性分数下降,却忽略任务效用和隐含表达中的伤害”,定位首个偏离“群体定义、提示模板、语言、采样、标注协议、效用与伤害指标均冻结”的状态,并从同一快照完成恢复
为什么从这个问题开始
“第10章 减少偏见和有害性”围绕“谁定义伤害,哪些群体/语言/上下文被测,干预代价如何报告?”建立贯穿任务:在预注册多群体提示集上评估一种单一减害干预。先写下哪个数据、表示、目标、计算、输出或评估状态会最先变化,再运行参考、故障和恢复路径;运行后补理由不算预测。只有守住“群体定义、提示模板、语言、采样、标注协议、效用与伤害指标均冻结”并交付数据声明、分群指标、标注分歧、效用—伤害权衡与失败案例,困惑度、基准、偏好、检索、伤害或环境指标才构成机制证据。
原书书目、153个正式坐标与访问边界
“第10章 减少偏见和有害性”以发行数字版核对熊涛著《大语言模型:基础与前沿》的前言、12章和参考文献,以馆藏书目核对人民邮电出版社、2024年4月、260页和ISBN 9787115634887,再以公开目录交叉核对全部节/小节。正式分母为前言1个、章标题12个、编号节/小节139个和参考文献1个,合计153个目录层级。
本书是熊涛原创中文专著,不是外文书的中译本;因此不存在可假定的英文“原版”供逐句对照。发行数字版可阅读不等于允许复制或改编,“第10章 减少偏见和有害性”不复制、翻译或改写原书正文、图表和案例,只把目录与书目元数据作为范围坐标;中文讲解、计算轨迹、反例、交互、练习与答案均为独立教学重写。
本页独立核对 1只用于独立核对本页技术事实和实验边界,不能反向证明原书采用本站表述。2024年以后出现的模型、框架、政策或基准必须带当前时间标签,不能倒填为原书内容。
原书目录层级与可验证机制
第10章 减少偏见和有害性
↡减少偏见和有害性对应正式目录坐标“第10章 减少偏见和有害性”,在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 1/11。 原书目录键 第10章 减少偏见和有害性。在“第10章 减少偏见和有害性”的第1个正式坐标中,「第10章 减少偏见和有害性」通过预注册群体、语言、提示、标注、效用和伤害指标并报告权衡推进伤害定义、分群测量与干预权衡;复核者保存数据声明、分群指标、标注分歧、效用—伤害曲线和失败案例,出现只降单一分类器分数却隐藏效用损失或未测群体就撤回结论。
10·1 偏见
↡偏见对应正式目录坐标“10.1 偏见”,在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 2/11。 原书目录键 10.1 偏见。围绕“谁定义伤害,哪些群体/语言/上下文被测,干预代价如何报告?”,“第10章 减少偏见和有害性”在坐标2把「10·1 偏见」落实为预注册群体、语言、提示、标注、效用和伤害指标并报告权衡;只有数据声明、分群指标、标注分歧、效用—伤害曲线和失败案例可重放且反例排除只降单一分类器分数却隐藏效用损失或未测群体,本节点才算掌握。
10·2 有害性
↡有害性对应正式目录坐标“10.2 有害性”,在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 3/11。 原书目录键 10.2 有害性。“第10章 减少偏见和有害性”的目录节点3「10·2 有害性」不能停在术语解释:它要预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,交付数据声明、分群指标、标注分歧、效用—伤害曲线和失败案例,并把只降单一分类器分数却隐藏效用损失或未测群体设为单一反事实。
10·3 偏见和有害性的检测与减少
↡偏见和有害性的检测与减少对应正式目录坐标“10.3 偏见和有害性的检测与减少”,在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 4/11。 原书目录键 10.3 偏见和有害性的检测与减少。对“第10章 减少偏见和有害性”而言,「10·3 偏见和有害性的检测与减少」在第4次检查中改变可观察状态,因为它负责预注册群体、语言、提示、标注、效用和伤害指标并报告权衡;数据声明、分群指标、标注分歧、效用—伤害曲线和失败案例必须与“群体定义、提示模板、语言、采样、标注协议、效用与伤害指标均冻结”对齐,不能接受只降单一分类器分数却隐藏效用损失或未测群体。
10·3·1 基于解码的策略
↡基于解码的策略对应正式目录坐标“10.3.1 基于解码的策略”,在“第10章 减少偏见和有害性”中用于把“基于解码的策略”放进伤害定义、分群测量与干预权衡的数据—目标—计算—输出链,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 5/11。 原书目录键 10.3.1 基于解码的策略。在“第10章 减少偏见和有害性”的第5个正式坐标中,「10·3·1 基于解码的策略」通过把“基于解码的策略”放进伤害定义、分群测量与干预权衡的数据—目标—计算—输出链推进伤害定义、分群测量与干预权衡;复核者保存第10章 减少偏见和有害性的输入角色、中间状态、输出、反例与独立评估,出现只复述“基于解码的策略”名称而没有可观察状态、单一故障和恢复证据就撤回结论。
10·3·2 基于提示的脱毒
↡基于提示的脱毒对应正式目录坐标“10.3.2 基于提示的脱毒”,在“第10章 减少偏见和有害性”中用于冻结基座、提示、示范、切分与预算,区分上下文状态和参数更新,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 6/11。 原书目录键 10.3.2 基于提示的脱毒。围绕“谁定义伤害,哪些群体/语言/上下文被测,干预代价如何报告?”,“第10章 减少偏见和有害性”在坐标6把「10·3·2 基于提示的脱毒」落实为冻结基座、提示、示范、切分与预算,区分上下文状态和参数更新;只有提示版本、示范顺序、校准曲线、适配参数和单因素消融可重放且反例排除提示、数据和适配器同时变化造成不可归因比较,本节点才算掌握。
10·3·3 基于数据的策略
↡基于数据的策略对应正式目录坐标“10.3.3 基于数据的策略”,在“第10章 减少偏见和有害性”中用于把“基于数据的策略”放进伤害定义、分群测量与干预权衡的数据—目标—计算—输出链,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 7/11。 原书目录键 10.3.3 基于数据的策略。“第10章 减少偏见和有害性”的目录节点7「10·3·3 基于数据的策略」不能停在术语解释:它要把“基于数据的策略”放进伤害定义、分群测量与干预权衡的数据—目标—计算—输出链,交付第10章 减少偏见和有害性的输入角色、中间状态、输出、反例与独立评估,并把只复述“基于数据的策略”名称而没有可观察状态、单一故障和恢复证据设为单一反事实。
10·3·4 基于投影和正则化的方法
↡基于投影和正则化的方法对应正式目录坐标“10.3.4 基于投影和正则化的方法”,在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 8/11。 原书目录键 10.3.4 基于投影和正则化的方法。对“第10章 减少偏见和有害性”而言,「10·3·4 基于投影和正则化的方法」在第8次检查中改变可观察状态,因为它负责预注册群体、语言、提示、标注、效用和伤害指标并报告权衡;数据声明、分群指标、标注分歧、效用—伤害曲线和失败案例必须与“群体定义、提示模板、语言、采样、标注协议、效用与伤害指标均冻结”对齐,不能接受只降单一分类器分数却隐藏效用损失或未测群体。
10·3·5 基于风格转换的方法
↡基于风格转换的方法对应正式目录坐标“10.3.5 基于风格转换的方法”,在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 9/11。 原书目录键 10.3.5 基于风格转换的方法。在“第10章 减少偏见和有害性”的第9个正式坐标中,「10·3·5 基于风格转换的方法」通过预注册群体、语言、提示、标注、效用和伤害指标并报告权衡推进伤害定义、分群测量与干预权衡;复核者保存数据声明、分群指标、标注分歧、效用—伤害曲线和失败案例,出现只降单一分类器分数却隐藏效用损失或未测群体就撤回结论。
10·3·6 基于强化学习的微调和基于人类偏好的预训练
↡基于强化学习的微调和基于人类偏好的预训练对应正式目录坐标“10.3.6 基于强化学习的微调和基于人类偏好的预训练”,在“第10章 减少偏见和有害性”中用于区分训练条件概率、模型架构、logits和推理解码规则,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 10/11。 原书目录键 10.3.6 基于强化学习的微调和基于人类偏好的预训练。围绕“谁定义伤害,哪些群体/语言/上下文被测,干预代价如何报告?”,“第10章 减少偏见和有害性”在坐标10把「10·3·6 基于强化学习的微调和基于人类偏好的预训练」落实为区分训练条件概率、模型架构、logits和推理解码规则;只有目标分解、logit轨迹、候选树、随机种子与停止原因可重放且反例排除同时更换模型、提示和解码参数后给单一因素归因,本节点才算掌握。
10·4 小结
↡小结对应正式目录坐标“10.4 小结”,在“第10章 减少偏见和有害性”中用于把本章主张、原始来源、版本、复核结论和未解决缺口双向连接,并受数据、版本、shape、目标、随机性、评估与社会技术边界约束。正式坐标 11/11。 原书目录键 10.4 小结。“第10章 减少偏见和有害性”的目录节点11「10·4 小结」不能停在术语解释:它要把本章主张、原始来源、版本、复核结论和未解决缺口双向连接,交付主张—来源矩阵、版本记录、支持/不支持裁决和缺口清单,并把二手来源或总结段被当作原始实验与普遍结论设为单一反事实。
先预测,再操作三个章专属实验
1. 语料、上下文与输出合同
为“第10章 减少偏见和有害性”选择正式目录坐标,在参考合同与单一反例间切换,逐阶段核对输入、操作、输出证据和裁决。
语料—上下文—输出合同
第10章 减少偏见和有害性
选择正式目录坐标,再比较参考合同与单一反例如何改变同一条模型链。
阶段 1/4
第10章 减少偏见和有害性 · 数据与输入
- 输入
- 在预注册多群体提示集上评估一种单一减害干预
- 操作
- 冻结伤害定义、分群测量与干预权衡所需的数据角色、版本、切分、模板和shape
- 输出证据
- 第10章 减少偏见和有害性的输入合同、版本表与基线快照
- 裁决
- 第10章 减少偏见和有害性的来源、许可、角色、单位、shape和可见性没有越界
第10章 减少偏见和有害性的可重放协议
| 阶段 | 允许动作 | 必留证据 | 拒绝条件 |
|---|---|---|---|
| 第10章 减少偏见和有害性 · 数据与输入 | 冻结伤害定义、分群测量与干预权衡所需的数据角色、版本、切分、模板和shape | 第10章 减少偏见和有害性的输入合同、版本表与基线快照 | 未满足“第10章 减少偏见和有害性的来源、许可、角色、单位、shape和可见性没有越界” |
| 第10章 减少偏见和有害性 · 目标与计算 | 执行区分偏见与有害性,并比较解码、提示、数据、投影/正则、风格转换和强化学习干预的最小计算并保存中间状态 | 第10章 减少偏见和有害性的目标分量、计算轨迹与单故障分岔 | 未满足“第10章 减少偏见和有害性每一步可由同一输入、公式、版本和随机状态复算” |
| 第10章 减少偏见和有害性 · 输出与解码 | 比较输出、路由、检索、策略或资源估计的更新前后状态 | 第10章 减少偏见和有害性的候选差、引用/策略/资源谱系与恢复路径 | 未满足“第10章 减少偏见和有害性没有把代理目标、精选输出或训练内统计当作最终结论” |
| 第10章 减少偏见和有害性 · 独立评估 | 重放预测、单故障、恢复和不适用边界 | 第10章 减少偏见和有害性的接受、回退或拒绝理由 | 未满足“第10章 减少偏见和有害性满足“群体定义、提示模板、语言、采样、标注协议、效用与伤害指标均冻结”” |
unit: "llm-10"
question: "谁定义伤害,哪些群体/语言/上下文被测,干预代价如何报告?"
scenario: "在预注册多群体提示集上评估一种单一减害干预"
invariant: "群体定义、提示模板、语言、采样、标注协议、效用与伤害指标均冻结"
fault: "删除触发词后毒性分数下降,却忽略任务效用和隐含表达中的伤害"
evidence: "数据声明、分群指标、标注分歧、效用—伤害权衡与失败案例"
reset: restore_concept_mode_stage_trace_step_case_gates_and_artifact“第10章 减少偏见和有害性”要求从同一数据、模型、模板、版本、预算和随机状态重放参考、故障与恢复路径。重置后若目录选择、模式、阶段、轨迹步骤、案例、证据门或交付包没有回到基线,本次比较已经混入状态泄漏。
本页回顾
掌握“第10章 减少偏见和有害性”不是背模型名或复制提示,而是围绕“谁定义伤害,哪些群体/语言/上下文被测,干预代价如何报告?”重建数据、表示、目标、计算、输出、资源和独立评估,并用“群体定义、提示模板、语言、采样、标注协议、效用与伤害指标均冻结”拒绝“删除触发词后毒性分数下降,却忽略任务效用和隐含表达中的伤害”。最终交付为数据声明、分群指标、标注分歧、效用—伤害权衡与失败案例。
练习与答案
练习
- 问题 1:实验合同。 “第10章 减少偏见和有害性”为什么必须先冻结数据、模型、模板、版本、预算、随机性和评估口径?
- 问题 2:目录逐项覆盖。 怎样证明“第10章 减少偏见和有害性”的正式目录坐标已经进入机制、交互和练习?
- 问题 3:故障恢复。 怎样证明“删除触发词后毒性分数下降,却忽略任务效用和隐含表达中的伤害”已经被修正?
名词解释
名词解释
本章出现的专业名词,用大白话再讲一遍。
- 减少偏见和有害性
检索键 llm-A 对应正式目录坐标「第10章 减少偏见和有害性」;在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,需要连接原书范围、计算状态、独立证据和不适用边界。
- 偏见
检索键 llm-B 对应正式目录坐标「10·1 偏见」;在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,需要连接原书范围、计算状态、独立证据和不适用边界。
- 有害性
检索键 llm-C 对应正式目录坐标「10·2 有害性」;在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,需要连接原书范围、计算状态、独立证据和不适用边界。
- 偏见和有害性的检测与减少
检索键 llm-D 对应正式目录坐标「10·3 偏见和有害性的检测与减少」;在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,需要连接原书范围、计算状态、独立证据和不适用边界。
- 基于解码的策略
检索键 llm-E 对应正式目录坐标「10·3·1 基于解码的策略」;在“第10章 减少偏见和有害性”中用于把“基于解码的策略”放进伤害定义、分群测量与干预权衡的数据—目标—计算—输出链,需要连接原书范围、计算状态、独立证据和不适用边界。
- 基于提示的脱毒
检索键 llm-F 对应正式目录坐标「10·3·2 基于提示的脱毒」;在“第10章 减少偏见和有害性”中用于冻结基座、提示、示范、切分与预算,区分上下文状态和参数更新,需要连接原书范围、计算状态、独立证据和不适用边界。
- 基于数据的策略
检索键 llm-G 对应正式目录坐标「10·3·3 基于数据的策略」;在“第10章 减少偏见和有害性”中用于把“基于数据的策略”放进伤害定义、分群测量与干预权衡的数据—目标—计算—输出链,需要连接原书范围、计算状态、独立证据和不适用边界。
- 基于投影和正则化的方法
检索键 llm-H 对应正式目录坐标「10·3·4 基于投影和正则化的方法」;在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,需要连接原书范围、计算状态、独立证据和不适用边界。
- 基于风格转换的方法
检索键 llm-I 对应正式目录坐标「10·3·5 基于风格转换的方法」;在“第10章 减少偏见和有害性”中用于预注册群体、语言、提示、标注、效用和伤害指标并报告权衡,需要连接原书范围、计算状态、独立证据和不适用边界。
- 基于强化学习的微调和基于人类偏好的预训练
检索键 llm-J 对应正式目录坐标「10·3·6 基于强化学习的微调和基于人类偏好的预训练」;在“第10章 减少偏见和有害性”中用于区分训练条件概率、模型架构、logits和推理解码规则,需要连接原书范围、计算状态、独立证据和不适用边界。
- 小结
检索键 llm-K 对应正式目录坐标「10·4 小结」;在“第10章 减少偏见和有害性”中用于把本章主张、原始来源、版本、复核结论和未解决缺口双向连接,需要连接原书范围、计算状态、独立证据和不适用边界。