跳到主要内容
← 返回项目列表
项目档案 07搜索质量2016.12 - 2020.05字节跳动 · 搜索业务

搜索质量评估与问答式搜索探索

在大模型叙事出现之前,用搜索满足度标准推动视频搜索、综合搜索和直接答案体验

我的判断

搜索质量不是结果多不多,而是用户需求有没有被满足,尤其是首位结果有没有真正解决问题。

Search Satisfaction搜索满足度评估器搜索词 IntentEvaluation StandardRAG EvaluationDirect AnswerBERT Exploration首位结果 HitResult Quality

决策记录

这次判断,怎么站住。

这不是项目总结,而是我愿意被追问的四个点:当时怎么判断、没有选什么、证据从哪来,以及什么情况会让我改判断。

当时判断

01

搜索质量不看结果多不多,而看用户需求是否被满足,尤其首位结果是否命中。

没选什么

02

没有把今天的大模型叙事硬套回旧项目,也没有只讲相关性或点击率。

证据来源

03

人工评估、竞品对标、线上反馈、视频搜索行业第一,以及问答式结果 10%+ 覆盖。

什么会推翻

04

如果首位命中和答案可信度不能提升满意度,问答式结果就不该继续扩大曝光。

AI 重构启发

搜索质量与 AI 答案,如果今天用 AI 重构

不是贴 AI 标签,是重做判断流程

AI 可以帮什么

AI 可以帮忙拆搜索词意图、检查首位结果是否回答了问题、归因坏样本,也可以在问答式结果里比较不同答案的完整度和可信度。

人必须判断什么

人要定义满足度。用户搜到了相关内容,不代表问题被解决;AI 给了答案,也不代表答案能被信任。哪些场景可以直接回答,哪些必须保守,是产品边界。

留下的启发

这个项目的启发是,搜索里的 AI 不是多生成一段话,而是把“用户到底有没有被满足”这件事判断得更细、更可检查。

搜索质量与问答式搜索 · 一页看懂

把搜索从“有结果”推进到“真满足”

这个项目不要硬讲成今天的大模型项目。当时更真实的问题是:用户搜完以后,到底有没有被满足?我的重点是把这个判断拆成可评估的标准,再转成内容引入、结果评估、排序调优和问答式结果命中的策略动作。

01

搜索不是推荐

搜索用户带着明确需求进入,核心不是多分发内容,而是快速判断需求是否被满足。

02

相关不等于满足

视频结果可能相关,但不一定能解决问题;点击高,也可能只是用户反复试错。

03

当时还不是大模型叙事

内部也尝试过 BERT / Transformer,但收益有限;真正能推进的是需求分型、供给和评估口径。

核心口径

搜索满足度四问:理解需求、定义好结果、命中首位、验证答案

用户到底要什么?

搜索词 是找事实、找教程、找视频、找事件,还是在问一个可以被直接回答的问题。

什么结果算满足?

不是有结果就够了,还要看相关、可消费、质量稳定、时效合适、能不能少让用户二次搜索。

首位结果 是否真的命中?

很多搜索体验的差距,就发生在第一条结果:它是答案,还是只是看起来相关。

直接答案能否成立?

对于适合问答的需求,要判断答案是否准确、可信、可验证,而不是只看生成形态。

内容引入 × 评估标准 × 排序调优

视频搜索质量

  • 定义哪些视频内容适合进入搜索供给
  • 建立相关性、可消费性、质量和时效评估口径
  • 用竞品对标和人工评估校准搜索体验
  • 联动算法调优候选、排序和结果准确性
可回答需求 × 首位结果 精准 × 答案可信

问答式搜索探索

  • 识别适合直接回答的搜索需求
  • 把 首位结果 精准命中作为核心体验目标,而不是只看列表整体相关性
  • 评估答案是否完整、可信、可验证
  • 用覆盖率判断问答式结果对搜索满足度的增量

策略链路

从 搜索词 到满足度的质量链路

1

搜索词 分型

2

内容供给

3

评估标准

4

排序调优

5

首位结果 命中

6

效果复盘

AI Migration · Demo Module

搜索满足度评估器:先判断是否满足,再谈答案生成

如果今天重做这个项目,我不会先做一个新的搜索入口。更有价值的是把当年的满足度判断做成评估工具:输入 搜索词、首位结果 结果和候选答案,先判断用户到底要什么、当前结果是否少让用户走弯路。

Human Review Boundary

AI 可以做初筛、归因和证据检查;但满足标准、直接答案边界、高风险证据要求,仍然必须由产品和评估团队定义。

什么叫满足哪些 搜索词 适合直接回答高风险答案证据要求是否影响排序或答案曝光模型判断和人工标准冲突时怎么处理
1

判断 搜索词 意图

先区分用户是在找事实、教程、视频、比较,还是涉及高风险建议。不同意图对应不同满足方式。

2

检查 首位结果 是否命中

首位结果 不能只看相关。它要真的减少用户成本,否则只是把用户带进下一轮试错。

3

评估答案证据

如果出现直接答案,就要检查来源、时效、完整性和风险,不因为答案流畅就默认满足。

4

归因 问题样本

把问题归到意图理解、供给、排序、答案生成、证据或人工标准,而不是笼统说搜索质量不好。

Demo 问题样本s

Human Review Required when risk is high
视频消费搜索词 understanding / Ranking
周杰伦 晴天 现场版

文字百科结果相关,但没有满足“现场版视频”需求。

高风险建议Policy / Evidence
布洛芬和感冒药能一起吃吗

不能用论坛经验或无来源答案直接满足,需要权威来源和人工审核。

多结果比较Answer generation / Human evaluation
新手买咖啡机还是手冲

不应该被压成单边推荐,要保留预算、清洁、学习成本等比较维度。

行业第一

头条 / 西瓜 / 抖音视频搜索体验

10%+

问答式结果覆盖搜索需求

持平竞品

头条搜索结果准确性

我的重点:不是证明某个模型很先进,而是定义什么结果真正满足用户,并把这套判断变成搜索算法、人工评估和问答式结果都能使用的质量标准。