跳转至

Evaluate Text Result 文本质量与事实准确性评测节点

Evaluate Text Result 节点依托 Griptape 评测引擎(Eval Engine),依据创作者设定的专业评估基准与评价准则(Criteria),对大语言模型输出的文本进行自动化定量打分与定性深度分析。该节点非常适用于验证 AI 生成内容的合规性、检测事实准确性(Factual Accuracy)或多维度评估文本质感与语义保真度。

输入与参数规范 (Inputs)

  • Examples 预设样例(面板属性 Property):选择内置的标准评测预设模板,或自定义全新评测配置。

    • 可选预设选项:
      • Choose a preset..(选择预设模板..)
      • Paraphrase(同义改写与意译保真度评估)
      • Factual(事实陈述准确性与真实性评估)
      • Analogy(类比推理与逻辑匹配度评估)
  • Input 输入原文(输入引脚 / 面板属性 Input/Property):作为评测基准的原始母本输入。

    • 支持多行长文本录入。
  • Expected Output 预期输出(输入引脚 / 面板属性 Input/Property):黄金标准参考答案(Ground Truth)或基准对照文本。

    • 单行文本输入。
  • Actual Output 实际输出(输入引脚 / 面板属性 Input/Property):上游待评测的 AI 实际生成结果文本。

    • 单行文本输入。
  • Criteria 评估准则(输入引脚 / 面板属性 Input/Property):指导底层评测引擎进行打分判定的具象化评判准则。

    • 支持多行长文本录入。
    • 示例:"Does the output accurately paraphrase the input without losing meaning?"(实际输出是否在未丢失核心语义的前提下精确复述了输入文本?)

输出引脚规范 (Outputs)

  • Score 评测得分(输出引脚 Output):介于 0.0 至 1.0 之间的归一化浮点数值。

    • 1.0:表示与评估准则完美契合(Perfect Match);
    • 0.0:表示完全不符合判定标准或存在严重事实错误(Complete Mismatch)。
  • Reason 评测依据与原因分析(输出引脚 Output):由评测引擎生成的结构化定性反馈详情。

    • 深度拆解打出该分数的逻辑原由;
    • 精确指出实际输出与预期参考答案之间的语义差异、事实偏离或逻辑漏洞。

典型使用场景与示例 (Example Usage)

1. 同义改写与复述评测 (Paraphrase Evaluation)

Input: "The quick brown fox jumps over the lazy dog."
Expected Output: "A swift brown fox leaps above a sleeping dog."
Actual Output: "A fast fox jumps over a dog that's not awake."
Criteria: "Does the output accurately paraphrase the input without losing meaning?"
# Score 预期约: 0.95
# Reason: 成功保留了敏捷的狐狸越过熟睡的狗的核心动作与状态,意译精准且无原意偏差。

2. 事实真实性评测 (Factual Evaluation)

Input: "The capital of France is Paris."
Expected Output: "Paris is the capital city of France."
Actual Output: "France's capital is Paris."
Criteria: "Is the output factually correct based on the input?"
# Score 预期约: 1.0
# Reason: 句意与核心地理事实陈述完全一致。

3. 类比推理逻辑评测 (Analogy Evaluation)

Input: "A bird is to sky as a fish is to ______."
Expected Output: "water"
Actual Output: "concrete"
Criteria: "Does the output correctly complete the analogy?"
# Score 预期约: 0.0
# Reason: 混凝土(concrete)并非鱼类的生存介质,未能完成正确的逻辑类比配对。

关键技术特性 (Notes)

  • 核心调用 Griptape 原生 Eval Engine 驱动自动化语义与逻辑评判;
  • 评测过程严格受控于输入的 Criteria 评估准则;
  • 所有评测得分均标准化映射至 [0.0, 1.0] 区间,便于下游接入 Math 或逻辑分支节点自动化触发报警/重跑;
  • Reason 输出提供了透明可解释的反馈链条,有助于持续调优 Prompt 工程。