DescribeImage 视觉多模态大模型图像理解与结构化反推节点
节点核心功能 (What is it?)
DescribeImage 节点通过调用具备视觉多模态(Vision)感知能力的顶级大模型,对输入的静态图像进行深度解析并生成自然语言描述或结构化 JSON 数据。它既可以作为图像转文字、视觉问答(VQA)的感知终端,也可通过精准的定向指令作为扩散模型反向提示词(Reverse Prompt Engineering)的推导引擎。
典型适用场景 (When would I use it?)
在以下情况下使用该节点:
- 生成图像的深度自然语言文本描述或无障碍替代文本(Alt Text);
- 从照片、设计图、架构图或图表中抽取关键事实与文字信息;
- 自动化反推参考图的布光、色调、艺术风格与微观主体特征;
- 将视觉资产转化为结构化 JSON 数据供下游业务系统存储与检索;
- 为自主智能体(Agent)赋予“视觉眼睛”以辅助做出行动决策。
使用指南 (How to use it)
基础配置流程 (Basic Setup)
- 在画布中添加 DescribeImage 节点。
- 将待理解的图像资产接入
image输入插槽。 - 在
prompt字段中根据期望的分析侧重给出具体的分析指令(默认"Describe the image")。 - 运行节点即可在
output获得详细分析文本。
精准指令的重要性 (Be Specific About What You Want)
在编写 prompt 提示词时,明确具体关注的元素能让模型给出极高品质的反馈:
- 色彩与光影:尝试
"Describe the color palette, the color of light and shadow, the saturation and value"(详细描述其配色方案、明暗光影色彩、饱和度与明度); - 角色与构图:尝试
"Describe the character's gender, age, clothing, posture, demeanor, and actions"(详细描述人物的性别、年龄、服装材质、站姿体态与动作)。
指令越精准具体,模型产出的输出质量就越契合预期。
参数输入插槽 (Parameters)
- image(必需):待分析理解的目标图像工件(接受
ImageArtifact或ImageUrlArtifact)。 - prompt(字符串,默认
"Describe the image"):指导模型如何观察与描述画面的自然语言指令。 - agent(可选):传入已有的专属 Agent 配置实例;若接入,则覆盖当前模型的独立配置。
- model:选择所调用的多模态模型(支持直选或接入 Prompt Model Config 配置引脚)。
- description_only(布尔值):若开启,则只纯粹返回图像描述文本,剥离一切多余的对话包装客套词。
- output_schema(可选):用于强约束输出格式的 JSON Schema。接受 JSON Schema 对象或合法 JSON 字符串。一旦连入,输出引脚自动切换为结构化 JSON 模式。
输出引脚 (Outputs)
- output:生成的图像分析结果。默认输出纯文本 text,当配置了
output_schema时输出严格校验通过的 JSON 数据。 - agent:在本次图像理解任务中实例化的智能体对象,可继续传递给下游节点复用上下文。
典型工作流示例 (Example)
自然语言风景反推
- 添加
DescribeImage节点至画布。 - 将生图节点或外部导入图像接入
image参数。 - 在
prompt字段填入:"Describe this landscape in detail, including colors, features, and mood"。 - 运行节点,在
output即可提取该风景画面的光影与意境描述,直接供给其他生图节点作为 Prompt。
结构化数据提取 (JSON 契约约束)
若需要模型严格按照固定 JSON 模板输出:
- 添加
CreateAgentSchema节点,输入样例 JSON 结构(例如包含{"style": "", "palette": [], "main_subject": ""})。 - 将
CreateAgentSchema.schema引脚连接至DescribeImage.output_schema。 - 运行
DescribeImage节点。 - 节点的
output将输出 100% 契合该 Schema 规范的结构化 JSON 数据(若校验失败引擎会自动抛出重试拦截)。
关键技术特性 (Important Notes)
- 云端鉴权凭证:默认使用 Griptape Cloud 网关时,需确保环境变量中存在有效的
GT_CLOUD_API_KEY。 - 默认模型选型:在未接入外部驱动时,节点默认采用能力极强的通用多模态模型(如
gpt-5.2等)进行高精语义识别。 - 缺失防御:若上游未提供图像,节点将优雅输出
"No image provided"而杜绝引发系统崩溃。
常见问题与排查 (Common Issues)
- API 报错或鉴权失败:确认环境变量中的
GT_CLOUD_API_KEY是否有效。 - 描述内容泛化空洞:在
prompt中增加限定词(如“逐项罗列”、“指出三处细节矛盾”等),避免使用空泛的默认指令。