Q1118Agent 架构真题解析Agent 架构AgentAlpha 社区真题库约 9 分钟更新 2026-09-29

@CristianoC 老师新年好,请教个问题,如果我想做个生成剧本的Agent,那我也需要像idea2story这样,收集很多剧本数据吗?如果我单纯只有一套剧本创作的方法论或框架,是否具备生成出好剧本的可行呢?[思考]

面试官想考察你对 Agent 生成任务中数据驱动 vs 规则驱动 的工程权衡理解,以及从方法论到可落地系统的可行性判断。刁钻点在于:候选人容易陷入“方法论万能”的幻觉,或盲目堆数据。答好了能展示你对 LLM 能力边界(如

@CristianoC 老师新年好,请教个问题,如果我想做个生成剧本的Agent,那我也需要像idea2story这样,收集很多剧本数据吗?如果我单纯只有一套剧本创作的方法论或框架,是否具备生成出好剧本的可行呢?[思考]

P1 · agent_architecture

🏷 标签:agent, llm, rag, prompt-engineering, data-augmentation

1️⃣ 考察意图

面试官想考察你对 Agent 生成任务中数据驱动 vs 规则驱动 的工程权衡理解,以及从方法论到可落地系统的可行性判断。刁钻点在于:候选人容易陷入“方法论万能”的幻觉,或盲目堆数据。答好了能展示你对 LLM 能力边界(如长程一致性、创意多样性)的认知,以及 RAG + 微调 + 约束解码 的组合拳设计能力,而非纸上谈兵。

2️⃣ 标准答

核心结论:单纯方法论框架 不可行,必须结合数据驱动。剧本生成 Agent 不是写公式,而是 在结构约束下填充高质量内容,这需要数据来训练模型理解“好剧本”的分布。

为什么方法论不够?

  • 剧本创作方法论(如三幕结构、英雄之旅、角色弧光)提供的是 骨架,但 LLM 生成时缺乏 血肉(具体对话、场景细节、情感张力)。没有数据,模型会输出套路化、空洞的文本,比如“主角在第三幕觉醒”但说不出怎么觉醒。
  • 方法论是 规则,但好剧本的“好”是 统计分布(如对话长度、转折频率、情感曲线)。纯规则驱动会导致生成结果 模式单一,缺乏多样性,且无法处理长程一致性(比如 100 页剧本中角色性格不崩)。

可行方案:数据 + 方法论的混合架构

  1. 数据收集:必须收集剧本语料。推荐来源: - 公开数据集:OpenSubtitles(对话级)、IMSDb(完整剧本)、ScreenplayDB(分场剧本)。至少 1000+ 完整剧本,覆盖不同流派(喜剧、悬疑、科幻)。 - 自建数据:用现有 LLM(如 GPT-4)基于方法论生成“伪剧本”,再人工筛选 200-500 个高质量样本作为种子数据。 - 数据增强:对剧本做 结构化标注(分场、角色、对话、动作描述),用于微调或检索。
  2. 技术选型:RAG + 微调 + 约束解码 三层架构 - 检索增强(RAG):将剧本库按 场景类型(如“冲突场景”“浪漫场景”)和 角色类型(如“反派独白”)分块,用 ColBERT(基于 token 级交互的检索模型)做语义检索。生成时,根据当前大纲片段检索 3-5 个相似场景作为参考,注入 prompt 中。为什么用 ColBERT 而非 BM25? 剧本中“背叛”和“欺骗”语义相近但字面不同,BM25 会漏检;ColBERT 的后期交互机制能捕捉语义匹配,且检索速度可接受(延迟 < 200ms)。 - 微调:用收集的剧本数据对基座模型(如 Llama-3-8B 或 Qwen-2.5-7B)做 LoRA 微调,目标函数是 下一个 token 预测 + 结构一致性损失(强制模型输出分场格式)。微调后模型能生成更自然的对话和场景描述。 - 约束解码:在生成时,用 方法论规则 作为硬约束。例如:三幕结构:强制每幕的 token 数比例(第一幕 25%,第二幕 50%,第三幕 25%)。 - 角色一致性:维护一个 角色状态表(如“主角当前情绪:愤怒”),在生成对话时,用 角色 embedding 相似度 检测输出是否偏离设定,若偏离则重采样。
  3. 实际落地的坑 + 解法: - 坑:检索到的参考场景可能包含剧透或冲突信息(比如检索到“主角死亡”场景,但当前生成的是第一幕)。 - 解法:在检索时加入 时间戳过滤,只检索当前幕之前的场景;同时用 LLM 作为 reranker,对检索结果做相关性 + 无剧透双重打分。
  4. 评估指标 - 自动指标:剧本连贯性(用 GPT-4 作为裁判,对每 10 页剧本打分 1-5)、角色一致性(计算角色对话的 情感一致性,用情感分类模型检测)、情节合理性(检测逻辑矛盾,如“角色在第三幕突然拥有新技能”)。 - 人工评估:让 3 个编剧对 10 个生成剧本做 盲评,对比纯方法论 vs 数据增强版本。通常数据增强版本在“创意新颖性”上高 30%,在“结构完整性”上高 15%。

总结:方法论是 方向盘,数据是 燃料。没有数据,Agent 会原地打转;没有方法论,Agent 会乱撞。必须两者结合,且数据要结构化、检索要语义化、解码要约束化。

3️⃣ 答题模板(30 秒电梯版)

“这个问题我从三个层面回答:第一,方法论提供骨架但缺乏血肉,纯规则驱动会导致生成空洞、模式单一;第二,必须收集剧本数据,通过 RAG(用 ColBERT 检索相似场景)+ LoRA 微调 + 约束解码(三幕比例、角色状态表)来填充内容;第三,评估时用 GPT-4 裁判和人工盲评,数据增强版本在创意上高 30%。总结一句:方法论是方向盘,数据是燃料,缺一不可。”

4️⃣ 高频追问 & 应对

追问 1:如果预算有限,只能收集 100 个剧本,你怎么做?

应对策略:100 个剧本不足以微调,但足够做 RAG。方案:用这 100 个剧本构建检索库,每个剧本按场景分块(平均 50 块),用 Sentence-BERT 生成 embedding。生成时,用 BM25 + 语义检索 混合(权重 0.3:0.7),确保召回率。同时,用 few-shot prompting 替代微调:在 prompt 中注入 3-5 个高质量场景作为示例,并加上方法论规则(如“请遵循三幕结构,每幕比例 25%:50%:25%”)。评估时,重点看角色一致性,用 角色 embedding 余弦相似度 检测,若低于阈值则重生成。

追问 2:如何保证生成的剧本不侵权,不抄袭现有作品?

应对策略:这是版权风险问题。解法:1)在检索阶段,用 去重算法(如 MinHash)过滤掉与训练数据中知名剧本相似度 > 0.8 的场景;2)在生成阶段,用 LLM 作为检测器,对输出做“原创性评分”,若低于阈值则重新采样;3)在输出后,用 Turnitin 类工具 做查重。工程取舍:去重会降低检索质量(可能漏掉好场景),所以只在最后 10% 的生成步骤中启用,平衡创意与安全。

追问 3:剧本生成 Agent 如何评估“情感张力”这种主观指标?

应对策略:主观指标需要代理指标。方案:1)用 情感曲线分析:将剧本按场景划分,用情感分类模型(如 RoBERTa 情感分析)给每个场景打“情感强度”分(1-10),然后计算曲线斜率变化率。好剧本通常有 3-5 个情感峰值,且峰值间隔逐渐缩短(高潮密集)。2)用 GPT-4 作为裁判,给定一个场景,问“这个场景的情感张力从 1-10 打几分”,并让 GPT-4 给出理由。3)人工评估时,让 3 个评委对 10 个场景打分,计算 Krippendorff’s Alpha 一致性系数,若 > 0.7 则指标可靠。

5️⃣ 避坑 · 常见错误答法

  • ❌ “方法论足够,因为 LLM 已经很强了,给个 prompt 就能生成好剧本。” → ✅ “LLM 生成长文本时容易丢失一致性,且缺乏对剧本结构的理解。必须用数据微调或 RAG 来注入领域知识,否则输出会像流水账。”
  • ❌ “收集数据越多越好,直接拿全网剧本训练。” → ✅ “数据质量比数量重要。需要结构化标注(分场、角色、对话),并过滤低质量剧本(如烂片)。1000 个高质量剧本比 10000 个垃圾剧本效果好。”
  • ❌ “用 BLEU/ROUGE 评估剧本质量。” → ✅ “BLEU/ROUGE 只适合摘要任务,剧本需要评估连贯性、角色一致性、情节合理性。应该用 GPT-4 裁判 + 人工盲评,或情感曲线分析等代理指标。”

6️⃣ 简历呼应

  • 如果你有 RAG 项目:从“检索增强如何解决剧本创意多样性”切入,强调你用 ColBERT 或 DPR 做语义检索的经验,以及如何用时间戳过滤避免剧透。
  • 如果你只做过传统 NLP:用“文本分类 + 序列标注”类比,说明剧本生成需要结构化输出(分场、角色、对话),可以迁移你的 CRF 或 BERT 标注经验到约束解码中。
  • 如果你是校招无项目:聚焦“方法论 + 数据增强”的论文复现,比如复现《Storytelling Agents with Retrieval-Augmented Generation》或《PlotMachines》,并做一个 Demo:输入大纲,输出 5 页剧本,对比纯 prompt 和 RAG 版本的效果。

7️⃣ 延伸阅读

  • 《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》(Lewis et al., 2020)—— RAG 基础论文
  • 《PlotMachines: Outline-Conditioned Generation with Dynamic Planning of Storylines》(Goldfarb-Tarrant et al., 2020)—— 剧本生成经典工作
  • 《ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT》(Khattab & Zaharia, 2020)—— 语义检索利器
  • 《LoRA: Low-Rank Adaptation of Large Language Models》(Hu et al., 2021)—— 微调剧本模型的首选
  • 《The Hero with a Thousand Faces》(Joseph Campbell)—— 英雄之旅方法论,用于 prompt 模板设计

—— 本场面试完 ——