第 6 章 产品的专业性来自哪里
一段 ESG 报告的正文读起来「像那么回事」并不难,难的是它同时满足四件事:符合准则要求、只写公司真实发生的事、写在该写的位置、措辞的分寸配得上手里的证据。这一章讲 GreenStone 为这四件事做了什么。
6.1 行业专家的编制知识,编译进了生成规则
报告怎么编,是有行业 know-how 的:哪一条准则要求该在哪一节回应,一个议题内部先说治理还是先说实践,什么样的事实够格写成「已建立机制」。这些知识来自真实的报告编制专家。
GreenStone 没有把这些知识做成一份供人查阅的文档,而是编译成了生成时逐条生效的规则:
| 沉淀层 | 规模 |
|---|---|
| 专家撰写的议题编制指南 | 23 份 |
| 议题清单与报告章节映射 | 24 个议题、22 个议题章节 |
| 面向企业的收资问题 | 约 139 题 |
| 章节结构与逐块写作指导 | 120 个内容块 |
| 准则披露要求(条款级) | 265 条,其中应披露 166 条、鼓励披露 79 条 |
| 准则条款原文(供页面对照) | 162 条 |
那 265 条披露要求,每一条都挂着沪、深、北三所指引的具体条款号,并标明是「应当披露」还是「鼓励披露」。生成某一段时,系统按白名单把该段对应的那几条要求送进去——不是把整份准则丢给 AI 让它自己找。
对你意味着什么:报告的结构和覆盖面不取决于 AI 的发挥,而是取决于这套已经固化下来的编制规则。
6.2 分块生成,每块只写自己该写的
GreenStone 不一次写完整本报告,而是把报告拆成一百多个内容块,一块一块地写。
这么做首先是因为写得越长越不可靠:一口气写两万字,越往后模型越容易顺着自己前面写过的内容继续推演,不回头核对资料。
更重要的是,分块之后才谈得上「约束」。每个块在生成时会拿到三样东西:
- 它自己的写作职责——这一块该写什么,是明确声明的,不靠 AI 从上下文猜。
- 一份证据白名单——这一块能看到哪几道题的回答、哪几个指标,是逐条点名的。别的块的资料它看不到。
- 邻居的职责——同一议题下,凡是和它共用同一份资料的其他块,各自负责写什么,会一并告诉它。
第三条是「不跑题」的关键。举个实际例子:员工的安全培训归职业健康与安全,技能培训归人力资本发展;温室气体排放核算归应对气候变化,不归能源管理。这类边界不是靠事后检查发现的,而是在写之前就告诉了模型:这部分内容由别人负责,你不要写。
对你意味着什么:报告不会来回打转,同一件事不会在三个章节里各说一遍。希望某件事出现在某一章,就填在对应的地方。
6.3 每段内容都要有事实依据
假设你只写了一句「开展员工安全培训」。不受约束的 AI 会给你:
报告期内,公司全年开展安全培训 12 场,覆盖全体员工,培训覆盖率达 100%,全年未发生安全生产事故。
读着完全像一份合格的报告,但 12 场是哪来的?客户一追问原始记录,你拿不出来。
GreenStone 只写「开展了员工安全培训」这个你确实提供的事实。这不只是给模型下了指令,而是有确定性的拦截:正文里出现的每一个数字,都要能在你提供的事实里找到出处,找不到就打回重写,反复不通过则整块生成失败——不会把编出来的数字留在报告里。
同样受拦截的还有:你没提过的组织名称、制度名称、认证、项目名。
指标没填,系统只当作没有填写值,不会推断成没统计或数值为零。资料不够时它写方向性内容,不会说你的企业已经做了这些——这类段落需要你补实或删掉。
重点核对:所有具体数字;所有「已建立」「已完成」这类完成态表述;读起来像行业介绍的段落。
6.4 分寸:不只是不编造
「不编造事实」是底线,但一份报告读起来专不专业,往往输在更微妙的地方:手里只有一句话,却写出了一套体系;把法定义务写成了亮点;把员工写成了被管理的对象。
GreenStone 对这些语义分寸有专门的判据,其中三条值得你知道:
事实强度要配得上表述的具体度。 判据原文是这么写的:
语言表面具体不等于企业事实具体。一个动作是否可接受,关键不是动词本身,而是它属于目标行业普遍适用的基础实践,还是已经形成企业专属、可识别或可核验的安排。
也就是说,「建立了管理制度」和「建立了覆盖三个厂区、每季度考核的管理制度」是两种承诺强度,后者要有对应的证据才能写。同理,治理层面的内容不能写成日常操作,战略不能写成具体动作。
不主动暴露自己的短板。 「公司暂无专人负责,后续将逐步完善」这种句子不会出现——前半句已经把缺失坐实了,后半句的前瞻语气救不回来。但这条有边界:披露外部风险(「电价上涨可能推高成本」)是应该写的,不算暴露短板;涉及安全生产、劳动保护这类法定底线时,也不会写成公司才刚开始建立。
员工相关内容要有人本视角。 不把员工写成被纪律化、服从化的对象;不把签劳动合同、缴社保这类法定义务包装成 ESG 成就。
对你意味着什么:这些判据管的是「写得得体不得体」,不能替你判断内容对不对。该核的还是要核。
6.5 多层次的质量把关
上面那些约束不是写在提示词里就算数了,背后有一套分层的检查:
生成当时的硬拦截——约 25 条确定性规则,管数字来源、名称来源、内部信息泄漏、缺失性表述这类高确定性的红线。命中就重写,最多三次,仍不通过则报错,不会把有问题的内容留下。
离线的语义评判——五个专门的评判器,各自只判一件事:事实一致性、分寸是否匹配、有没有暴露短板、社会类表述是否得体、格式是否规范。每个评判器对同一段内容独立跑三次投票取多数,票数分裂本身就是判据模糊的信号。
人工校准——评判器的准确性以人类专家的判断为真值来校准,目前有 50 个校准样本、39 个经人工逐条裁定的表达质量样本。
这套东西你在使用时看不见,它作用在产品迭代上:每次改动生成规则,都要过这些检查,避免「修好一处、坏掉三处」。
对你意味着什么:把它理解成产品的质检线,不是你这一份报告的验收线。你这一份的验收,仍然是你打开审阅版逐段核对。
6.6 每段依据了什么,写在批注里
审阅版报告的正文与正式稿一字不差,但每段 AI 撰写的内容都挂着一条 Word 批注,说明这段依据了什么:
- 用了你上传的资料,就逐份列出文件名;
- 用了定量指标,就完整列出指标名称、数值、单位;
- 资料本身有对不上的地方而没有采用,会说明「未将其作为企业事实采用,按审慎表述撰写」;
- 都没用上,则写明「未引用用户上传的资料,依据用户的基础信息、填写内容与行业通用披露语境撰写」。
图片也有批注:矩阵图、指标摘要图、你上传的素材图各有说明。
前面说过,「关于本报告」和「关于公司」两章整体不批注。
对你意味着什么:核对不用从头通读。看到「未引用用户上传的资料」的段落重点读,看到列了指标值的段落对着数字核一遍。
6.7 支持图文混排
报告里可以有三类图:双重重要性矩阵图(按你的评分和阈值画)、你自己上传的图片(系统识别内容后配题注、放到合适的章节)、指标摘要图。
组织架构图与流程图曾由 AI 从你提供的事实中抽取结构、由代码绘制,2026 年 8 月起不再提供:标签能校验是否逐字来自你的资料,图的结构对不对却校验不了——专家复核发现过把并列环节画成串行、把三层治理画成四层的情况。画错的结构印在报告里比没有图更麻烦,因此改为不画。需要架构图或流程图,请自己做好了作为图片上传。
如 5.2 所述,目前没有基于定量指标的统计图表。