AI检测工具承诺一个简单的答案:粘贴文本,得到百分比,就知道是不是机器写的。实际上百分比在不同工具之间、不同提交之间都会变化,同一文本测两次也可能不同。这不是某个产品的缺陷,而是技术本身的工作方式。
几乎所有检测器都在已知AI输出和人类写作的模式上训练。它把目标文本与这些模式对比,返回一个概率。分数取决于训练数据、原文风格,以及生成它的AI的配置。
同一段落在甲工具得分高,在乙工具可能得分低。短文本比长文本更不可靠。改动很大的草稿会偏离检测器学到的模式。这些都不意味着工具无用,只说明单个数字不是定论,而是参考。
检测测量的是与训练数据的统计相似度,而不是意图,也不是作者。措辞公式化的人写文本可能得分很高。大幅修改过的AI草稿可能像人写的。
如果必须使用检测器,请把它当作众多弱信号中的一个。绝不只凭分数发布、驳回或下结论。误报的代价由真实的人承担:他的作品被贴上机器制造的标签。
有用的问题不是"这是机器写的吗",而是"这篇文本准确、清晰、可以发布吗"。这是核查问题,不是检测问题。
Vortixy 的做法是:从清晰度、结构、语气和事实一致性来审校草稿,并附上问题说明返回修改稿。编辑决定权在你手里,报告指出文本的弱点。
一份实用的核查清单可以配合任何工具使用:
确有正当用途:审计内容流水线、按机构规范核查学术提交、调查文档是否为机器生成。这时工具应当支撑有明确边界的人工流程,而不是取代判断。
测试前先定阈值,同一文本至少过两个工具,把分歧当作人工复核的理由,而不是挑选顺眼分数的理由。
在聊天中试试:用清单核查我的草稿是中等有用的信号,不是定论。同一文本在此高在彼低,短文本不如长文本稳定,修改会让分数向两边漂移。
因为训练数据、权重和刻度校准都不同。风格、长度、修改和模型配置都会移动分数。分歧很正常,它本身就是复核文本的信号。
会。篇幅短、语体正式、结构公式化、经过工具辅助修改,都会推高纯人类文本的分数。所以绝不能只凭分数决定学术或人事事项。