AI Agent · 真实交付复盘

从 15 人、3–4 周
1 名策略师、5 天

不是再加一层 Prompt,而是把专家判断拆成 Skill,把正反例、验收、记忆与反馈装进 Harness。

2026-05-10 飞书会议纪要 · 会议经验陈述 · 非随机对照实验

15 人原项目团队规模
3–4 周原交付周期
1 + AI策略师与系统
5 天一次通过
Before → After

先压缩信息收集,再把专家判断沉淀进系统

早期自动化只解决“找资料更快”,真正阻碍规模化的是报告仍依赖少数专家反复分析、制图与返工。

旧链路:项目制交付

  • 人工浏览小红书约 10 天至 2 周
  • 信息收集虽可压缩到数小时,报告仍靠人完成
  • 高质量 PPT 需要约 15 人、3–4 周
  • 客户越多,人力与培训成本近似线性增长

新链路:Skill + Harness

  • 通用 Skill 与客户专属 Skill 分层
  • 系统根据任务选择并组合技能
  • 策略师保留高价值判断与最终验收
  • 洞察过程、纠错与反馈可持续复用
Architecture

规模化改造的三个关键动作

1

拆成可验收 Skill

把达人筛选、赛道分析、人群识别、内容与投放建议拆成单一职责模块。

2

建立 Harness

维护正例、反例、边界、验收标准、Memory、评测集和可观测反馈链路。

3

保留人工闸门

AI 执行重复链路;策略师处理歧义、风险与最终质量,而不是被假设为零成本替代。

Reported Outcomes

会议中报告的结果

5 天一次通过

原先约 15 人、3–4 周完成的 PPT 项目,变为 1 名策略师与 AI 系统协作。

< 1 天

一份竞品分析与投放建议可以在不到一天内交付。

两个数量级

会议报告的服务成本相较早期交付方式下降两个数量级。

2–3 个月

专业策略师仍需要学习和迁移周期,说明流程变革不能只计算模型调用时间。

⚠️

证据边界

这些数字来自会议中的经验陈述,未经独立审计。案例支持“Skill + Harness 能降低特定营销交付的周期和边际人工”,但没有披露统一口径下的错误率、模型成本、重试率或客户长期留存;不能直接外推为所有行业的保证。

What To Reuse

真正值得复制的不是数字,而是验证方式

先记录人工基线

同一批真实任务比较成功率、周期、人工工时、成本、重试和严重错误。

从单 Agent + 多 Skill 开始

只有观测数据证明吞吐或专长隔离确有需要,才升级为多 Agent。

失败要进入回归集

区分数据、工具、推理和验收问题,修改对应层,而不是无限追加提示词。

高风险动作保留审批

发布、付款、删除、外发和低置信度决策必须有明确人工闸门与回滚。

把你的专家工作流拆成可评测系统

安装 Agent Workflow Playbook,获得完整的 Skill contract、Harness、评测和上线清单。

查看 Skill →

素材来源:飞书会议纪要《AI agent实践落地困境与规模化尝试分析》,2026-05-10。为保护相关方,页面仅保留工作流与量化结论。