一次选题系统的尝试与反思

两周以来,我一直在思考并尝试搭建一个选题系统——借助 AI 产生公众号文章选题,以此减少人工找选题的时间和烧脑的痛苦。

我首先想到的是 LangChain,这个概念在2022年很火,现在称作 LangGraph更合适。它的本质是可编程化的 Agent 框架,主要用于构建自动化工作流,最大的优势在于处理流程可控,结合程序代码和大模型,设定每个节点具体处理的内容。

大致学习了LangGraph的主要知识点后,我做了一个简单的选题系统框架:

  1. LLM分析样本文章,生成发散内容
  2. LLM根据第一步的发散内容,生成10个选题
  3. LLM审核并给出最终通过的选题

逻辑没有问题,也跑通了这三步,但第二步生成出来的选题基本上都不可用,最终结果也没有达到我的标准。

我想尝试加入联网搜索来提高生成选题的质量,考虑到需要申请搜索 API、配置 API的繁琐,投入产出比不高,所以我决定先解决选题重复的问题,做出筛选机制:分析哪些选题已经做过,在生成选题的时候就排除掉这些选题。

为了让 AI 更好地了解过去的文章,我对过去的200多篇文章进行切片,再用大模型去分析和汇总,折腾将近一天后,得到了一份表格。

这份被寄予厚望的表格并没有起到太大的用处,因为AI无法通过这些数据判断某个新选题与过去写过的选题在角度上有多大差异。比如,你已经写了红烧鱼、水煮鱼、清蒸鱼,如果有一道新菜是水煮鱼片,AI可能不知道它和水煮鱼的差别,无法判断值不值做。

连续两次尝试都没有达到预期后,我开始怀疑:利用AI生成可用的选题,是不是一个伪命题?

AI 在编程方面的能力提升其实非常明显,快速写代码、找出 bug、自我验证……这些能力随着模型的升级而不断提高,但是在写作上,大纲的设计和逻辑连贯性,我的感觉是没有太大的变化,反而更模版化了。

编程是可验证的,因为程序是否正确,通常有明确的判断标准。比如写一个程序统计名单中的重复姓名,人工核对后应该有 12 个,程序却算出 15 个,就可以顺着处理流程查找问题。修复 bug 后再次运行,结果符合预期,问题也就解决了。

相较而言,写作没有绝对的规律,运用特定方法写出的文章不一定会有热度。虽然有PREP(Point-Reason-Example-Point)这类写作技巧,但采用这类技巧的文章不一定就是好文章。

利用好AI的关键是将隐性的标准显性化。我想起一个资深老领导教导的基础图像识别的算法——先将图像转成黑白,计算各个相邻区域明度的差值,相差较大的地方就是物体的边缘,我当时惊叹,这个算法竟然如此简单且有效。我不知道眼睛是如何判断物体的存在,但这个算法给出了一种显性的解释。

设计选题系统是利用AI分析并提炼出一套选题标准,但有些东西是没有规律的,无法量化的。很多时候,一个好的选题靠灵感,而灵感来自过往大量的信息摄入。即使AI生成的某些选题非常有吸引力,但如果没有文章质量的基础支撑,并不会明显提高文章的转发量和阅读量。

一篇文章的质量由专业知识的积累、对客户问题的了解以及书面表达能力决定,AI 可以提高整理和表达的效率,却无法替代这些长期积累。

AI 生成的内容,说到底是利用向量拼凑出来的,在提供人自己都不确定的东西时,它反而会带来混乱。通过阅读、交流以及经历,人的认知在不断变化,不一定正确,但具有独特性,不可预测性,这是人作为受造物更高级的地方。