Evaluate Text Result 文本质量与事实准确性评测节点
Evaluate Text Result 节点依托 Griptape 评测引擎(Eval Engine),依据创作者设定的专业评估基准与评价准则(Criteria),对大语言模型输出的文本进行自动化定量打分与定性深度分析。该节点非常适用于验证 AI 生成内容的合规性、检测事实准确性(Factual Accuracy)或多维度评估文本质感与语义保真度。
输入与参数规范 (Inputs)
-
Examples 预设样例(面板属性 Property):选择内置的标准评测预设模板,或自定义全新评测配置。
- 可选预设选项:
Choose a preset..(选择预设模板..)Paraphrase(同义改写与意译保真度评估)Factual(事实陈述准确性与真实性评估)Analogy(类比推理与逻辑匹配度评估)
- 可选预设选项:
-
Input 输入原文(输入引脚 / 面板属性 Input/Property):作为评测基准的原始母本输入。
- 支持多行长文本录入。
-
Expected Output 预期输出(输入引脚 / 面板属性 Input/Property):黄金标准参考答案(Ground Truth)或基准对照文本。
- 单行文本输入。
-
Actual Output 实际输出(输入引脚 / 面板属性 Input/Property):上游待评测的 AI 实际生成结果文本。
- 单行文本输入。
-
Criteria 评估准则(输入引脚 / 面板属性 Input/Property):指导底层评测引擎进行打分判定的具象化评判准则。
- 支持多行长文本录入。
- 示例:"Does the output accurately paraphrase the input without losing meaning?"(实际输出是否在未丢失核心语义的前提下精确复述了输入文本?)
输出引脚规范 (Outputs)
-
Score 评测得分(输出引脚 Output):介于
0.0至1.0之间的归一化浮点数值。1.0:表示与评估准则完美契合(Perfect Match);0.0:表示完全不符合判定标准或存在严重事实错误(Complete Mismatch)。
-
Reason 评测依据与原因分析(输出引脚 Output):由评测引擎生成的结构化定性反馈详情。
- 深度拆解打出该分数的逻辑原由;
- 精确指出实际输出与预期参考答案之间的语义差异、事实偏离或逻辑漏洞。
典型使用场景与示例 (Example Usage)
1. 同义改写与复述评测 (Paraphrase Evaluation)
Input: "The quick brown fox jumps over the lazy dog."
Expected Output: "A swift brown fox leaps above a sleeping dog."
Actual Output: "A fast fox jumps over a dog that's not awake."
Criteria: "Does the output accurately paraphrase the input without losing meaning?"
# Score 预期约: 0.95
# Reason: 成功保留了敏捷的狐狸越过熟睡的狗的核心动作与状态,意译精准且无原意偏差。
2. 事实真实性评测 (Factual Evaluation)
Input: "The capital of France is Paris."
Expected Output: "Paris is the capital city of France."
Actual Output: "France's capital is Paris."
Criteria: "Is the output factually correct based on the input?"
# Score 预期约: 1.0
# Reason: 句意与核心地理事实陈述完全一致。
3. 类比推理逻辑评测 (Analogy Evaluation)
Input: "A bird is to sky as a fish is to ______."
Expected Output: "water"
Actual Output: "concrete"
Criteria: "Does the output correctly complete the analogy?"
# Score 预期约: 0.0
# Reason: 混凝土(concrete)并非鱼类的生存介质,未能完成正确的逻辑类比配对。
关键技术特性 (Notes)
- 核心调用 Griptape 原生 Eval Engine 驱动自动化语义与逻辑评判;
- 评测过程严格受控于输入的
Criteria评估准则; - 所有评测得分均标准化映射至
[0.0, 1.0]区间,便于下游接入Math或逻辑分支节点自动化触发报警/重跑; Reason输出提供了透明可解释的反馈链条,有助于持续调优 Prompt 工程。