切换深色模式
4.1 从论文题目到关键词体系
4.1.1 为什么先写题目,再打开数据库
检索(Retrieval)要做的是“带着问题找答案”,不是在数据库里随便逛。许多同学一拿到任务就打开知网(CNKI),输入一个模糊的词,看到几万条结果后不知从何下手,又换一个词,最后得到一堆与研究问题关系不大的文献。这种“先逛后想”的做法会制造三种问题:
- 结果无法收敛:没有明确的边界,结果量始终在大和小之间反复横跳,无法判断是否已经“找全”。
- 被高频词带偏:数据库默认按相关度或发表时间排序,热门主题会挤占视线,使真正相关的冷门文献沉底。
- 阅读失去标准:没有事先列好的关键词表,读文献时就不知道某篇文献到底在回应自己题目的哪一部分。
正确的做法是先用自己的语言把研究问题写成一句完整的题目,再把它拆开,变成一组可以在数据库中检索的概念词。题目是检索的地图,关键词是路标。地图画好之后,数据库只用来验证和补充,不替你思考。
开工前先花十分钟写词表
在打开任何数据库之前,先用一张纸或一份文档写下:(1)研究题目;(2)题目涉及的 3—5 个核心概念;(3)你目前能想到的同义词。这一步只花十分钟,但能让后续两小时的检索少走大量弯路。
4.1.2 把论文题目拆成概念块
一个完整的税收学实证题目,通常可以拆成若干“概念块(Concept Block)”。三个例子示范拆解过程。
例一:研发费用加计扣除(Super Deduction for R&D Expenses)对高新技术企业(High-tech Enterprise)创新投入的影响
| 概念角色 | 题目里的具体内容 | 检索含义 |
|---|---|---|
| 政策 / 核心解释变量 | 研发费用加计扣除、税收优惠 | 决定检索的“因”(X) |
| 对象 | 高新技术企业、企业 | 决定研究主体是谁 |
| 结果 | 创新投入、研发投入 | 决定检索的“果”(Y) |
| 机制 | (隐含)融资约束、税负、现金流 | 决定可能的传导路径 |
| 情境 | 时间、地域、行业 | 决定检索的边界与适用范围 |
例二:增值税留抵退税(Value-added Tax Credit Refund)对企业投资(Investment)的影响
| 概念角色 | 具体内容 | 检索含义 |
|---|---|---|
| 政策 / X | 留抵退税、增值税期末留抵退税 | 因 |
| 对象 | 企业、制造业企业 | 主体 |
| 结果 / Y | 企业投资、固定资产投资 | 果 |
| 机制 | 现金流、融资约束、流动性 | 传导 |
| 情境 | 2018—2022 分批试点、制造业 | 边界 |
例三:环境保护税(Environmental Protection Tax)对重污染企业绿色创新(Green Innovation)的影响
| 概念角色 | 具体内容 | 检索含义 |
|---|---|---|
| 政策 / X | 环境保护税、排污费改税 | 因 |
| 对象 | 重污染企业、高耗能行业 | 主体 |
| 结果 / Y | 绿色创新、绿色专利 | 果 |
| 机制 | 合规成本、创新补偿效应 | 传导 |
| 情境 | 2018 年实施、重点监控行业 | 边界 |
共性是:每个题目都能拆成“政策—对象—结果—机制—情境”五块。机制词在题目里常常隐含,需要主动补出,否则检索会漏掉讨论机制的文献。
功能词不要当检索词
不要把题目中的“影响”“研究”“分析”“视角”这类功能词当作检索词。“研发费用加计扣除对企业创新投入的影响研究”里真正有检索价值的是“研发费用加计扣除”“企业创新投入”,而不是“影响”“研究”。功能词放进检索式只会扩大噪音。
4.1.3 关键词金字塔:五层结构
当概念块被拆出后,需要为每一块准备不同层次的词。“关键词金字塔(Keyword Pyramid)”要解决两个问题:保证相关性,不遗漏新表述。
图 4-1 关键词金字塔。上位词扩大范围,核心词保证相关性,相关词发现新表述。
金字塔从下到上分为五层,每一层承担不同功能:
| 层级 | 名称 | 作用 | 例子(以加计扣除题目为例) |
|---|---|---|---|
| 第一层 | 上位概念(Broader Concept) | 范围太窄找不到时用它“往上扩” | 税收优惠、减税政策、激励政策 |
| 第二层 | 核心概念(Core Concept) | 保证文献与你题目的相关性 | 研发费用加计扣除、高新技术企业、创新投入 |
| 第三层 | 同义表达(Synonyms) | 覆盖不同作者对同一事物的不同叫法 | R&D 加计扣除、研发费加计扣除、研发支出加计 |
| 第四层 | 相关概念(Related Concept) | 发现你没想到的新表述、新角度 | 税收优惠、融资约束、实质性创新、研发投入 |
| 第五层 | 英文对应词(English Equivalent) | 用于检索英文库、核对中外术语 | R&D super deduction, high-tech firm, innovation input |
每一层在检索中的分工也不同,可按轮次调用(与 4.3 三轮检索法呼应):
| 金字塔层 | 通常在第几轮使用 | 用法 |
|---|---|---|
| 上位概念 | 第一轮(发现词) | 当核心词太窄、结果为零时往上扩 |
| 核心概念 | 每一轮都必须 | 保证相关性,缺它文献就跑题 |
| 同义表达 | 第一轮补充、第二轮并入 | 用 OR 连接,覆盖不同叫法 |
| 相关概念 | 第一轮观察、第三轮限定 | 发现新角度、也用作筛选维度 |
| 英文对应词 | 外文检索阶段 | 查 Web of Science、Elsevier、Springer 等 |
展开:为什么同义词如此重要
同一个政策在不同的文件、不同的论文里,叫法可能完全不同。以“研发费用加计扣除”为例:
- 财政部、税务总局文件中的正式名称是“企业研发费用加计扣除”;
- 早期文件中曾称“技术开发费加计扣除”;
- 部分论文习惯写作“R&D 加计扣除”或“研发费加计扣除”;
- 2018 年比例提高后,又出现“研发费用加计扣除比例提升”等表述。
如果你只检索“研发费用加计扣除”一个词,会漏掉那些用“R&D 加计扣除”发表、但内容完全相关的文献。检索就是用作者的词去找作者的文,所以必须先把作者可能用过的词穷尽。
4.1.4 同义词与近义词从哪里找
不要凭空想同义词。有效的同义词来源有六类,按可信度从高到低排列:
- 政策文件的正式名称与条文表述。例如《关于完善研究开发费用税前加计扣除政策的通知》里使用的标准措辞,是检索政策类文献最权威的词源。
- 综述类论文(Review Article)的关键词与正文。综述为了涵盖全貌,通常会把同一概念的各种叫法都列出来。
- 已有论文的“关键词”栏。翻开 10 篇相关文献,记录它们各自使用的关键词,是积累同义词最快的方法。
- 行业报告与白皮书。如税务部门、行业协会发布的报告,常用贴近实务的表述。
- 术语表与教科书目录。税收学教材的章节能告诉你“税收优惠”“税收激励”等上位概念的完整谱系。
- 论文的英文摘要。中文论文的英文摘要会给出规范的英文对应词,便于之后做外文检索。
用结果页关键词反哺词表
在知网检索结果页,每篇文献下方都会列出“关键词”。把前 30 篇相关文献的关键词复制到一个文档里,去重后就是你这一主题的词库雏形。这一步属于“用数据库反哺关键词表”,在 4.3 的“三轮检索法”第一轮中会具体使用。
4.1.5 关键词表的字段与样例
零散的词容易丢失,需要用“关键词表(Keyword Table)”固定下来。一张可用的关键词表至少包含三列:概念角色、关键词、来源依据。“来源依据”一栏尤其重要,它让你在两个月后回看时,仍能记得某个词为什么该出现。
关键词表模板如下:
| 概念角色 | 关键词 | 来源依据 |
|---|---|---|
| 核心—政策 | (待填) | (待填,如政策文件 / 综述论文) |
| 核心—对象 | (待填) | (待填) |
| 核心—结果 | (待填) | (待填) |
| 同义—政策 | (待填) | (待填) |
| 同义—结果 | (待填) | (待填) |
| 相关—机制 | (待填) | (待填) |
| 上位—政策 | (待填) | (待填) |
| 情境—地域 | (待填) | (待填) |
| 情境—时间 | (待填) | (待填) |
| 英文对应 | (待填) | (待填) |
下面是一份已经填好的、以“研发费用加计扣除”为题的样例:
| 概念角色 | 关键词 | 来源依据 |
|---|---|---|
| 核心—政策 | 研发费用加计扣除 | 财税〔2015〕119 号、综述论文关键词 |
| 核心—对象 | 高新技术企业、企业 | 题目、CSMAR 数据库分类 |
| 核心—结果 | 创新投入、研发投入 | 题目、已有实证论文因变量 |
| 同义—政策 | R&D 加计扣除、研发费加计扣除、研发支出加计 | 论文英文摘要、早期文件 |
| 同义—结果 | R&D 投入、技术创新投入 | 综述论文关键词 |
| 相关—机制 | 融资约束、税负、现金流、实质性创新 | 理论文献假设部分 |
| 上位—政策 | 税收优惠、减税政策、税收激励 | 教科书章节、综述 |
| 情境—地域 | 中国、东部地区 | 数据可得范围 |
| 情境—时间 | 2016—2023、营改增后 | 政策实施节点 |
| 英文对应 | R&D super deduction, high-tech firm, innovation input | 中文论文英文摘要 |
图 4-2 关键词表样例:概念角色—关键词—来源依据。
填表时常见的四类错误,应提前规避:
| 填表错误 | 表现 | 修正 |
|---|---|---|
| 来源依据留空 | 只写词不写出处 | 至少标注“政策文件 / 综述 / 论文关键词”之一 |
| 同义词与核心词混填 | 把 R&D 加计扣除填进核心栏 | 严格按“核心 / 同义 / 相关 / 上位”分栏 |
| 英文词缺失 | 只填中文,做外文检索时抓瞎 | 每个核心概念至少配一个英文对应词 |
| 机制词漏填 | 只填政策与结果,漏掉传导路径 | 回到 4.1.2 的“机制”列补全 |
版权与引用提醒
关键词表不是用来“照搬”别人成果的。把他人论文的关键词抄进你的表,是为了发现检索词,而不是把这些词当作你论文的“已有研究”。讨论文献时仍须回到原文阅读、按规范引用。
4.1.6 如何确定搜索范围:五个维度画边界
有了词,还要知道“在什么范围内搜”。边界画错了,检索要么泛滥要么枯竭。从五个维度给自己的选题画边界:
| 维度 | 含义 | 边界过宽的症状 | 边界过窄的症状 |
|---|---|---|---|
| 研究对象 | 企业 / 行业 / 地区 / 个人 | 结果几万条,无从读起 | 只有个位数,且与题目不符 |
| 时间 | 政策前后、某年段 | 混入已被取代的旧政策文献 | 漏掉政策出台前的关键理论文 |
| 地域 | 全国 / 省 / 市 / 跨国比较 | 行政差异被平均掉,结论失真 | 找不到可比数据,文献极少 |
| 税种 | 所得税 / 增值税 / 财产税 | 不同税种机制混为一谈 | 该税种文献本就稀少,直接为零 |
| 企业特征 | 规模 / 所有制 / 上市与否 | 异质性结论被掩盖 | 细分后样本太小,无文献支撑 |
以“研发费用加计扣除”题做边界示范:
本研究关注**中国沪深 A 股上市公司(企业特征)在2016—2023 年(时间)的研发费用加计扣除政策(税种:企业所得税)对创新投入(结果)的影响,地域上以全国(地域)**为样本。
把边界写清后,检索时才知道哪些筛选条件该加、哪些不该加。边界过宽时,优先加“研究对象”和“税种”;边界过窄时,先去掉“时间”和“地域”再看。
4.1.7 先求全,再限定:两次检索的分工
检索应当分两次进行,分工明确:
第一次检索,求全(Recall First)
- 只用核心概念 + 同义表达,不加或极少加筛选条件。
- 字段优先用“主题(Subject)”,因为它覆盖篇名、关键词、摘要。
- 目的:把该主题下尽可能多的文献“捞”出来,观察作者都在用什么词、什么角度。
- 此时结果多不怕,怕的是少。
第二次检索,限定(Then Filter)
- 在第一次的基础上,加入时间、地域、税种、来源类别等边界条件。
- 字段可以收紧到“篇名(Title)”或“关键词(Keywords)”以提高相关性。
- 目的:形成可精读的核心文献集。
用两次结果数的落差判断边界
两次检索的结果数都记下来。如果第一次 2000 条、第二次 200 条,说明边界合理;如果第一次就只有 30 条,说明你的核心词可能过窄,需要回 4.1.3 用上位概念扩面。两次结果数的“落差”本身就是判断边界是否合适的依据。
4.1.8 关键词表与检索式的衔接
关键词表不是终点,而是 4.2、4.3 构造检索式(Search Expression)的原料。衔接规则如下:
- 同一概念的同义词 → 用 OR 连接,外面加括号。 例:
(研发费用加计扣除 OR R&D加计扣除 OR 研发费加计扣除) - 不同概念块 → 用 AND 连接。 例:
(政策词) AND (对象词) AND (结果词) - 字段限定 → 统一加在每组前面,如
SU=。 - 边界条件 → 不在关键词表里展开,留到 4.3 第三轮用筛选器加。
把 4.1.5 的填好的样例直接翻译成检索式:
SU=(研发费用加计扣除 OR R&D加计扣除 OR 研发费加计扣除)
AND SU=(高新技术企业 OR 企业)
AND SU=(创新投入 OR 研发投入 OR R&D投入)这个式子可以直接输入 4.2 的知网高级检索面板。可见:关键词表越规范,检索式越省事。
衔接易错点
很多人把“机制词”也用 AND 硬塞进主检索式,例如 (政策) AND (对象) AND (结果) AND (融资约束),结果因多一个 AND 而大幅缩水甚至为零。机制词更适合放在:①第一轮观察新表达;②第三轮作为可选限定。主检索式先用“政策 AND 对象 AND 结果”三块即可。
4.1.9 常见错误
| 错误 | 表现 | 后果 | 修正 |
|---|---|---|---|
| 关键词太少 | 只放 1—2 个词 | 大量相关文献因用词不同而漏检 | 每个核心概念至少配 2—3 个同义表达 |
| 关键词太多 | 一次塞进 8 个以上且全用 AND | 结果为零或个位数 | 同义词之间用 OR,不同概念之间才用 AND |
| 把结论词当检索词 | 搜“促进”“提升”“显著” | 这些词几乎所有论文都用,无区分度 | 只保留政策、对象、结果、机制类实词 |
| 只用口语词 | 用“减税”“少交税” | 学术文献多用规范术语,搜不到 | 改用“税收优惠”“税收激励”等规范词 |
| 忽略政策正式名称 | 只用“加计扣除” | 漏掉“研发费用加计扣除”全称文献 | 以政策文件标题为准建立核心词 |
| 只用上位词 | 只搜“税收优惠” | 结果过泛,相关性低 | 上位词仅用于扩面,核心检索仍需具体词 |
核心词太少与只用上位词常同时出现
“核心概念太少”和“只用上位词”常常同时出现。例如只搜“税收优惠 企业创新”,会得到海量但松散的文献;正确做法是保留“研发费用加计扣除”这一具体核心词,再用“税收优惠”作为补充扩面词,二者用 OR 连接后再与“企业创新”用 AND 连接(具体写法见 4.3)。
4.1.10 课堂实操
请使用你自己的毕业论文选题,完成以下产出:
- 拆题表:把你的题目按“政策 / 对象 / 结果 / 机制 / 情境”五类概念块拆解,填写类似 4.1.2 的表格。
- 关键词表:制作一张不超过 20 个词的关键词表,包含“概念角色、关键词、来源依据”三列,至少覆盖核心概念、同义表达、相关概念、英文对应词四类。
- 边界说明:用一句话写下你选题在“研究对象、时间、地域、税种、企业特征”五个维度上的边界。
- 三组检索组合(只列组合,不要求立刻执行):
- 政策词 + 对象词,例如:
研发费用加计扣除 AND 高新技术企业 - 对象词 + 结果词,例如:
高新技术企业 AND 创新投入 - 核心词 + 机制词,例如:
研发费用加计扣除 AND 融资约束
- 政策词 + 对象词,例如:
- 预翻译检索式:参照 4.1.8,把你的关键词表翻译成一个含 OR 括号的检索式草稿,作为输入 4.2 知网检索面板的准备。
完成后与同桌互相检查:对方的关键词表里是否出现了“只用上位词”或“把结论词当检索词”的情况。4.2 会把这些组合真正输入知网检索面板。