当时判断
01搜索质量不看结果多不多,而看用户需求是否被满足,尤其首位结果是否命中。
在大模型叙事出现之前,用搜索满足度标准推动视频搜索、综合搜索和直接答案体验
我的判断
搜索质量不是结果多不多,而是用户需求有没有被满足,尤其是首位结果有没有真正解决问题。
决策记录
这不是项目总结,而是我愿意被追问的四个点:当时怎么判断、没有选什么、证据从哪来,以及什么情况会让我改判断。
当时判断
01搜索质量不看结果多不多,而看用户需求是否被满足,尤其首位结果是否命中。
没选什么
02没有把今天的大模型叙事硬套回旧项目,也没有只讲相关性或点击率。
证据来源
03人工评估、竞品对标、线上反馈、视频搜索行业第一,以及问答式结果 10%+ 覆盖。
什么会推翻
04如果首位命中和答案可信度不能提升满意度,问答式结果就不该继续扩大曝光。
AI 重构启发
AI 可以帮什么
AI 可以帮忙拆搜索词意图、检查首位结果是否回答了问题、归因坏样本,也可以在问答式结果里比较不同答案的完整度和可信度。
人必须判断什么
人要定义满足度。用户搜到了相关内容,不代表问题被解决;AI 给了答案,也不代表答案能被信任。哪些场景可以直接回答,哪些必须保守,是产品边界。
留下的启发
这个项目的启发是,搜索里的 AI 不是多生成一段话,而是把“用户到底有没有被满足”这件事判断得更细、更可检查。
搜索质量与问答式搜索 · 一页看懂
这个项目不要硬讲成今天的大模型项目。当时更真实的问题是:用户搜完以后,到底有没有被满足?我的重点是把这个判断拆成可评估的标准,再转成内容引入、结果评估、排序调优和问答式结果命中的策略动作。
搜索用户带着明确需求进入,核心不是多分发内容,而是快速判断需求是否被满足。
视频结果可能相关,但不一定能解决问题;点击高,也可能只是用户反复试错。
内部也尝试过 BERT / Transformer,但收益有限;真正能推进的是需求分型、供给和评估口径。
核心口径
搜索词 是找事实、找教程、找视频、找事件,还是在问一个可以被直接回答的问题。
不是有结果就够了,还要看相关、可消费、质量稳定、时效合适、能不能少让用户二次搜索。
很多搜索体验的差距,就发生在第一条结果:它是答案,还是只是看起来相关。
对于适合问答的需求,要判断答案是否准确、可信、可验证,而不是只看生成形态。
策略链路
搜索词 分型
内容供给
评估标准
排序调优
首位结果 命中
效果复盘
AI Migration · Demo Module
如果今天重做这个项目,我不会先做一个新的搜索入口。更有价值的是把当年的满足度判断做成评估工具:输入 搜索词、首位结果 结果和候选答案,先判断用户到底要什么、当前结果是否少让用户走弯路。
Human Review Boundary
AI 可以做初筛、归因和证据检查;但满足标准、直接答案边界、高风险证据要求,仍然必须由产品和评估团队定义。
先区分用户是在找事实、教程、视频、比较,还是涉及高风险建议。不同意图对应不同满足方式。
首位结果 不能只看相关。它要真的减少用户成本,否则只是把用户带进下一轮试错。
如果出现直接答案,就要检查来源、时效、完整性和风险,不因为答案流畅就默认满足。
把问题归到意图理解、供给、排序、答案生成、证据或人工标准,而不是笼统说搜索质量不好。
文字百科结果相关,但没有满足“现场版视频”需求。
不能用论坛经验或无来源答案直接满足,需要权威来源和人工审核。
不应该被压成单边推荐,要保留预算、清洁、学习成本等比较维度。
头条 / 西瓜 / 抖音视频搜索体验
问答式结果覆盖搜索需求
头条搜索结果准确性