将模型结构化输出分为语法、字段约束和业务事实三层检查,给出正反例与具体错误位置,适用于抽取接口和自动化处理。
## 任务目标 请为模型结构化输出制定可执行验收,并检查给定结果。保留原始输出,检查结果与修复建议分开记录,不以自动修补掩盖原始失败。 以核查和评审为主,给出有证据的判断及可复核的修改建议;本次用户另有明确实现要求时,按其授权范围执行。 ## 输入信息(选填) 两项均可留空,也可直接用一句话说明目标并附上已有资料。无需自行整理版本、配置或完整需求表;能读取的内容由执行者补齐。 待验收结果或问题:可留空;优先检查当前对话中的候选结构化回答,未提供结果时先设计验收规则 事实与格式约定:可留空;从已给任务、Schema、接口定义和样例中读取,不要求手工整理全部字段 ## 信息不完整时 先使用本次对话中已经说明的信息;用户留空、写“暂无/不清楚”或未替换输入标记,都按缺失处理,不当作真实路径、参数或业务值。已能从资料确定的内容不重复询问,不编造文件、日志、接口、业务值或执行结果。在用户已授权的范围内读取相关工程和材料,不为补齐输入擅自扩大操作范围。 ### 优先确认 - 在已提供文本和允许读取的工程中定位原始模型输出、输出协议、Schema声明和校验依赖版本。 - 从真实接口、事实材料及已有断言提取字段类型、必填关系和可核对的业务约束。 ### 可采用的默认处理 - 保留原始结果;已有协议优先,没有协议时将裸JSON作为建议检查基线,而不是未经确认的拒绝标准。 - 缺少Schema时先执行语法和可证实的事实检查,给出标为候选的Schema;缺少缺失值规则时不自动补零或补空串。 ### 必须有依据的事项 - 影响验收结论的输出包装、跨字段业务关系或缺失值语义无法从契约确认时,只将相关检查列为待确认。 只有缺口会改变业务结果、权限边界或关键实现,且无法从现有资料确认时,才集中提出最多 3 个关键问题;说明影响,并继续完成不依赖答案的部分。一般命名、排版和可逆实现细节按现有约定决定,不逐项等待确认。 ### 资料仍不足时的交付 - 没有候选输出时交付可运行的校验输入格式、正常与关键反例和验收表,结果栏保持未执行。 - 没有事实材料时可以核对语法与已知Schema,但不能宣布事实正确。 ## 执行要求 先用确定性解析和 Schema 校验检查格式,再核对跨字段关系和业务事实。结构正确不能替代内容正确。 1. 确认输出协议是裸 JSON 还是允许 Markdown 包装,以及对象、数组或其他顶层值是否可用。检查空输出、额外解释、多个对象、重复键及截断情况;存在协议歧义时指出需确认的影响,不默默选用最宽松解析器掩盖问题。 2. 在原始文本上做 JSON 语法解析,记录具体失败位置和原因。解析成功只标记语法层通过,不能据此认定符合业务;若从代码围栏中提取了内容,应另记该转换及原始包装是否合规,不把提取后的成功替代原始协议结果。 3. 先验证 Schema 自身,再按声明草案和校验器版本检查类型、必填、枚举、范围、数组项目、嵌套对象及额外字段。明确是否启用 format 检查器;配置不支持或未启用时,email、日期等格式不得声称已严格通过。 4. 用跨字段规则核对开始结束时间、金额合计、状态与必填条件等实际业务约束。每条规则列出输入路径、比较方法和失败判据;未给规则时不自行发明拒绝条件,对不能判断的事项标为待确认。 5. 将提取值或结论返回事实材料逐项核对,区分直接获得、计算推导和缺失信息。不得把缺失值无条件改成零、空字符串或猜测实体;仅按已授权策略使用 null、缺省字段或明确的错误结果,未经证据支持的补值列为事实层失败。 6. 准备最小正反例,至少覆盖一个正常结果和与当前契约相关的关键失败。每个样例写清预期失败层、字段路径和原因;能运行时保存真实解析及校验结果,不能运行则标明人工检查或待执行,不用模型自评代替确定性工具结果。 ## 交付与验收 输出验收表:检查层、检查项、字段路径、预期、实际、状态、证据。状态仅使用通过、失败、未执行、待确认。再给出问题清单、最小修复建议与样例表;原始输出始终单独保留。只有输出协议、语法、Schema、业务规则及事实核对均完成且通过,才给出可接受结论;未执行或待确认意味着尚不能验收,而不是默认成功。 ### 本条完成检查 - 逐层区分协议、语法、Schema、业务关系和事实结论,保留原输出与修复建议。 - 每个失败指向字段路径与证据,未执行或缺资料的层次不计为通过。 按本条要求组织结果,使用简洁中文和一致的编号、术语、缩进及空行;已有项目格式优先。只说明实际完成的内容,将采用的假设、未完成项和缺少的条件写在相关位置,不额外生成无关文档。未执行、无法复现或缺少证据的检查如实标注,不宣称已通过或已有性能收益。 ## 参考资料与适用边界 整理说明:格式检查方法参考下方资料;跨字段关系、事实对应及严格输出包装要求为本模板补充。 官方来源:https://github.com/modelscope/PromptScope/blob/d4e06ba53443eb86b67819c2e18a1ea1163599df/prompt_scope/core/evals/parsing/json_schema.py 来源许可说明:Apache-2.0(https://github.com/modelscope/PromptScope/blob/d4e06ba53443eb86b67819c2e18a1ea1163599df/LICENSE)。本条为中文原创整理,来源内容与本模板补充要求已在正文区分。
用输入、真实标签和原始模型回答分析错误,生成少量候选并按固定验证集比较,明确提示词调整的效果与适用边界。
## 任务目标 请根据真实错误样例改进现有提示词,并保留可复查的对照。没有真实结果时先准备评估方案,不能编造改进分数。 交付能用于评审或后续实施的具体方案、规则与样例;未要求实施的部分不声称已经落地。 ## 输入信息(选填) 两项均可留空,也可直接用一句话说明目标并附上已有资料。无需自行整理版本、配置或完整需求表;能读取的内容由执行者补齐。 提示词与主要问题:可留空;使用当前对话中被要求改进的提示词及已指出的失败现象 样例或运行记录:可留空;优先读取已给输入、原始回答、参考结果和模型配置,缺失部分明确标记 ## 信息不完整时 先使用本次对话中已经说明的信息;用户留空、写“暂无/不清楚”或未替换输入标记,都按缺失处理,不当作真实路径、参数或业务值。已能从资料确定的内容不重复询问,不编造文件、日志、接口、业务值或执行结果。在用户已授权的范围内读取相关工程和材料,不为补齐输入擅自扩大操作范围。 ### 优先确认 - 从上下文提取原提示词、不能改变的限制、典型错例与当前输出格式。 - 检查已有评估脚本、数据划分、模型版本与参数,识别重复或泄漏样例。 ### 可采用的默认处理 - 先处理明确歧义和遗漏,候选控制在三份以内,每份说明改动对应哪个已见问题。 - 没有真实评分时只给改进假设和可执行评估方案,保留基线;不借用他人效果或合成例冒充真实提升。 ### 必须有依据的事项 - 当前提示词、预期业务结果或不可变约束全部缺失时,集中索取能确定改写对象的最少内容。 - 涉及额外付费模型调用但未有调用授权时,先交付候选和评估输入,不擅自扩大调用。 只有缺口会改变业务结果、权限边界或关键实现,且无法从现有资料确认时,才集中提出最多 3 个关键问题;说明影响,并继续完成不依赖答案的部分。一般命名、排版和可逆实现细节按现有约定决定,不逐项等待确认。 ### 资料仍不足时的交付 - 只有提示词、没有错例时可做结构和歧义审查,给出待验证候选与样例收集格式。 - 没有模型运行条件时交付完整候选、固定比较方法和未执行的结果表。 ## 执行要求 从错例分析、反馈和少量候选调整入手,再用固定数据对照。 1. 固定任务边界、输出协议、评分口径和模型配置,先核对样例标签质量、重复项及泄漏风险。同一来源、实体或近似改写样例需要合理分组,避免高度相似内容同时出现在训练与评估数据里而虚增效果。 2. 区分用于发现错误的开发集、选择候选的验证集和最终检查的留出集。已经反复用于选优的数据只能算验证集;数据太少无法隔离时明确局限,采用可说明的分组验证,不宣称得到可靠的泛化提升。 3. 对真实失败按指令歧义、输入缺失、输出格式、知识不足和推理或业务规则错误分类,分别引用样例编号、期望值与实际值。提供可核对的简短原因,不要求展示模型完整思维过程;标签或输入本身有问题的样例先修订记录。 4. 最多生成三个候选,每个只围绕有证据的错误调整必要指令,标出相对基线的改动及预期影响。保持原有业务限制,避免把单个样例答案硬塞进通用提示词,也不以不断叠加例外导致正常任务退化。 5. 在相同模型、参数、样例和预算口径下比较基线与候选,原始回答和评分结果均保留。数值、实体名、否定词等业务含义不得被随意归一化;需要评分模型时记录其配置,并对关键争议样例作独立核对。 6. 用预先定义的门槛选择候选,同时检查正确率、格式合规、关键失败及调用成本。最终留出检查原则上只在候选确定后进行;若据此继续修改,须标明它已参与调优并另行安排最终验证。无显著改善时保留基线,不强行宣布优化成功。 ## 交付与验收 输出:数据划分与限制;错例分类表;基线和最多三个完整候选;“样例编号→原始回答→评分”结果;候选对照表;采用或保留基线的理由。没有执行环境时,结果格填写未执行,仅交付可运行的评估输入与判定规则。改进百分比必须能由实际样例计数复算,并写清分母;项目公开榜单、Star 数和他人任务的成绩不能作为本条效果证明。 ### 本条完成检查 - 基线和候选可直接复用,原有限制没有被改弱。 - 效果结论能追溯到相同条件下的实际样例,无法验证时明确保留基线或候选待测。 按本条要求组织结果,使用简洁中文和一致的编号、术语、缩进及空行;已有项目格式优先。只说明实际完成的内容,将采用的假设、未完成项和缺少的条件写在相关位置,不额外生成无关文档。未执行、无法复现或缺少证据的检查如实标注,不宣称已通过或已有性能收益。 ## 参考资料与适用边界 整理说明:错例分析与候选优化参考下方公开实现,独立留出集和回归门槛为本模板补充。 官方来源:https://github.com/modelscope/PromptScope/blob/d4e06ba53443eb86b67819c2e18a1ea1163599df/prompt_scope/core/models/world_model/base_world_model.yaml 来源许可说明:Apache-2.0(https://github.com/modelscope/PromptScope/blob/d4e06ba53443eb86b67819c2e18a1ea1163599df/LICENSE)。本条为中文原创整理,来源内容与本模板补充要求已在正文区分。