Marx MaxEN
菜单

AI 进入实证研究,难在哪里

摘要:AI 参与实证研究的困难,涉及研究问题、数据处理、模型设定与结果解释之间的关系。本文直接从这些工作要求展开,讨论如何明确执行条件、保留数据含义、区分程序反馈与经验验证,以及组织有效的人机分工。以政策与企业研发投入的说明性任务为例,文章分析样本变化、模型比较、人工修改和可重复计算需要怎样的依据,并说明 Marx Max 围绕实证分析组织协作的设计方向,以可继续使用的成果和完整任务的劳动量检验工具价值。

一段回归程序能够运行,和一项实证研究能够回答问题,中间还隔着数据、设定与证据。研究者关心“一个政策有没有促进企业创新”,需要先说明政策影响谁、怎样衡量创新、哪些数据能观察到变化,以及如何建立可信的比较。AI 可以协助写程序、处理材料和完成计算,但只有这些工作与研究问题对应起来,输出才有分析和解释的价值。

我理解的 AI for empirical research,是让 AI 参与这些具体工作,使研究者能够核对成果、调整分析并继续研究。困难并不只在代码生成环节,还在于任务条件是否明确、数据处理是否保留含义、模型比较是否有依据,以及程序反馈能否与研究判断区分。把这些要求纳入工作方式,才能让 AI 完成的部分成为研究者下一步可以使用的成果。

实证任务需要明确的分析依据

一项实证任务往往包含从问题到指标、从材料到数据、从模型到解释的多次转换。每次转换都可能改变研究含义,例如用研发投入衡量创新活动,或用一组企业的变化解释政策效果。工具需要知道研究者已经决定了哪些条件,哪些条件仍待讨论,以及当前步骤准备交付什么。否则,即使每段程序分别能运行,也未必构成同一项研究所需的分析。

“帮我研究政策效果”与“按照这个设定完成估计”是不同范围的要求。前者可能需要整理文献、检查数据可得性并比较研究设计;后者可以依据指定材料、变量和样本执行计算。AI 能够协助两类工作,但不能把尚在讨论的设计直接当成定稿,也不能把完成一次估计等同于完成整项研究。说明任务所在阶段,有助于将生成、检查和判断安排在合适的位置。

因此,面向实证研究的产品应当让材料、条件、操作与结果的关系能够被检查。研究者改变指标或样本时,需要确认哪些处理和模型随之变化;AI 完成计算时,需要报告实际使用的条件与取得的输出。这样的协作使每一步都有明确依据,研究者能够根据观察决定下一步,而不必反复重建工具替自己作过的选择。

问题定义决定计算要做什么

“政策促进了创新”不是一个可以直接执行的计算要求。它可能指专利数量、专利质量、研发投入或新产品,也可能关注不同企业、行业和时期。研究者需要说明自己关心哪一种变化,以及所用指标为何能够表达它。这里的判断先于模型估计:同一句问题采用不同指标,可能就在研究不同的事情,程序不能仅凭一个变量名称确定其含义。

例如,研究一项补贴政策是否改变企业创新活动,先要确认哪些企业受到政策影响、影响发生在什么时候,以及手中的数据能够观察什么。如果选择研发支出,就需要解释它作为创新投入的意义;如果选择专利,也需要区分申请与授权等口径。AI 可以帮助核对材料、整理候选指标和生成处理代码,但这些工作要围绕已经说明的研究问题展开,不能先生成一个规范模型,再倒过来寻找配合它的理由。

识别策略也不能只由方法名称决定。研究者要说明为什么某组对象适合比较、相关时间窗口如何选择、哪些其他因素可能同时影响结果,以及当前材料支持什么假设。AI 熟悉回归或因果推断的语法,可以减轻执行负担;研究设定是否合理,则需要把理论、制度背景和数据条件一起讨论。区分这两层,才能知道一份结果表究竟完成了什么。

由此得到的产品要求,是任务条件能够被明确表达、核对和修改。条件未定时,AI 可以先整理材料与待确认事项;条件已定时,再执行指定的整理和计算。研究者根据新观察调整设定,工具就应当依据更新后的要求继续。人机协同中的判断因此有具体对象,不必在每次生成之后从头追查模型替自己作了哪些选择。

数据整理要保留研究含义

实证研究所需的材料可能来自行政记录、企业披露、平台数据或调查。它们围绕不同目的产生,使用不同对象、单位和时间尺度,也有不同的访问与使用条件。能够取得文件,不等于已经具备回答问题的数据。覆盖范围、变量口径和匹配方式,都可能改变研究对象与最终的比较,必须在进入计算之前说明。

单位转换是一个容易理解的例子,身高用米还是厘米可以明确处理;更复杂的是企业营收按年度还是季度记录、地区编码是否改变、调查题目在不同轮次是否一致。同名变量未必同义,统一列名也不会自动统一测量。AI 可以执行转换和匹配,但研究者需要知道它采用了哪条规则,哪些记录无法处理,以及处理前后的样本发生了什么变化。

从企业披露文本整理面板数据,同样可以作为说明性任务。需要先确定企业、年份和指标,再检查提取值对应的统计期间、合并范围与材料版本。如果几份披露对某个指标的含义不同,直接拼成一列就可能产生形式完整、实质不一致的数据。工具应当保留原始来源和处理依据,让研究者能够回到记录核对;文本中的数字被提取出来,并不表示测量工作已经完成。

这些要求说明,数据准备本身就是研究过程的一部分。工具的交付不能只有整理后的表,还应使变量说明、筛选条件和必要的检查结果能够被追踪。材料能否用于当前任务,也需要依据具体来源和授权范围确认。AI 减少的是重复查找、转换和执行的劳动,研究者仍能掌握数据怎样形成,后面的分析才有明确基础。

程序反馈和研究反馈要分别判断

在实证任务中,至少有两类不同的检查。程序层面要确认文件能读取、变量处理符合要求、计算正常执行;研究层面还要判断比较是否回答了问题,模型条件是否合理,以及结论有没有超出证据支持的范围。程序没有报错,只证明相应执行没有在这个环节失败;统计输出完整,也不意味着其中的解释已经成立。

以政策效果研究为例,我们观察实施政策之后的结果,同时关心同一对象没有实施政策时会怎样。不能同时观察到两种状态,研究者就需要提出比较设计和识别假设。AI 可以协助检查程序是否落实这些设定,整理相应的检验和结果,却不能从一张显著的回归表直接宣布假设成立。怎样论证比较的可信度,仍要联系问题与材料。

模型比较也需要明确改变了什么。加入控制变量后,如果部分观察因缺失值退出估计,系数变化就同时涉及设定和样本。可以先确认有效观察,再完成适当的同样本比较,并讨论控制变量选择的理由。类似地,更换标准误主要改变不确定性的估计,不能据此声称解决了模型设定中的偏误。每一步比较都需要与它实际能够检查的问题对应。

因此,AI 的反馈应当使程序结果与研究解释的依据分别可见:用了什么样本、改变了什么设定、取得什么输出、还有什么未确认。让几个模型互相赞同一段解释,并不能替代对数据与方法的检查。实证研究需要的可靠帮助,是把执行情况和经验依据整理清楚,使作者能够继续判断,而不是把所有输出统一标成“已完成”。

一项实证任务怎样形成有效的人机分工

假设研究者准备比较补贴政策与企业研发投入之间的关系,手中已有数据说明和一个初步分析设定。AI 的第一步可以协助检查变量、单位、观察时间和材料覆盖,列出执行当前任务还缺哪些条件。研究者确认所用指标、样本和模型后,再组织数据处理与估计。这样的分工既让工具承担实质工作,也避免把未确定的研究选择悄悄写进程序。

进入计算后,可以保留样本处理、基础模型和扩展模型的代码与结果。发现异常时,先定位对应阶段:是材料读取、变量构造、样本筛选,还是估计与解释的问题。已经确认的部分不必反复重写,需要修改的部分则应连同后续依赖一起核对。研究者也可以直接修改代码,再说明变化后的条件,请 AI 完成下一步比较。

任务结束时,交付应当支持继续研究。代码与图表要能对应当前数据和设定,结果整理要区分观察、解释和待核实事项,文件中的执行顺序也要明确。保存代码和输出不会自动恢复内核变量,所以重开之后仍需要按顺序运行前置步骤。这样的成果可以进入汇报、复核和后续修改,而不只是在一次聊天中看起来完整。

这也是检验效率的合适尺度。AI 是否提效,要看它完成了多少可以继续使用的工作,研究者的总劳动量是否减少,检查和返工成本是否可控。研究问题、方法与解释由作者负责,不能成为工具交付低质量结果的理由;工具认真完成已明确的任务,人才有条件把时间用于真正需要判断的部分。

Marx Max 围绕实证研究组织协作

针对这些要求,Marx Max 将需求讨论、可编辑代码与计算结果放在同一个工作区。左侧明确当前问题和任务条件,右侧查看实际执行、修改并重跑代码;研究者可以依据输出继续讨论,也可以保留已有计算进行比较。这个安排回应的是实证分析中反复观察、调整和核对的工作方式,不能仅以一次生成速度来评价。

AI for empirical research 的产品价值,需要在这些具体任务中形成:资料能否支撑当前问题,代码能否落实已经确认的设定,结果能否被人理解和检查,修改后能否在可靠的基础上继续工作。编程与计算能力提供了基础,针对实证研究组织材料、条件和协作过程,决定了这些能力能否有效参与研究。这也是我们围绕实证任务组织人机协同的设计方向。