government-accountability-and-transparency
评估监管的有效性:计量和方法
Table of Contents
导言:为什么评价事项是监管的
监管几乎塑造了现代生活的每一个方面 — — 从我们呼吸的空气和我们食用的食物到金融市场的稳定和工作场所的安全。 然而监管并不是自我验证的。 纸面上看明智的规则可能产生意想不到的后果、强加不成比例的成本或根本无法改变行为。 因此,评估监管效力是一项关键的治理职能。它提供了完善现有规则、设计更好的新规则和确保真正实现预期的公众利益所需的证据。 如果不进行严格的评估,监管就有可能成为负担,而不会明显地回报,甚至更糟糕的是,伤害源。
本条全面审查了评估监管效力所用的衡量标准和方法,借鉴了经合组织[和美国环境保护局[等组织既定的评价框架,以及从现实世界案例研究中吸取的教训。 通过了解哪些措施可行和不可行,监管者、利益攸关方和公民可以推动更明智、更负责任的治理。
理解监管效力
监管效力不是一个单一的概念,而是一个多层面的概念,它的核心是监管在多大程度上实现了既定目标,然而,这些目标往往跨越多个领域——经济效率、环境质量、公共卫生、公平和行政可行性。
- 功效:该规则是否产生所期望的行为或结果的改变?
- 效率[:该规则的好处是否以社会成本为理由?
- 公平:负担和利益是否在不同群体之间公平分配?
- 反应:该条例能否适应不断变化的情况或新信息?
- 法律关系:规则是否被受影响者视为公平合理?
经合组织的“监管政策展望”[强调,评估有效性不仅应该通过立即遵守,而且应该通过长期社会结果和管理过程本身的质量来进行。 评估必须平衡这些紧张关系,同时采用能反映全局的衡量尺度和方法。
评价的关键计量
计量标准将监管目标转化为可衡量的指标,没有单一的计量标准足够;需要一套指标来反映有效性的许多方面,以下是最常用的计量标准,并附有实例和背景。
遵守率
合规性是最直接的衡量标准:它衡量遵守规则的受监管实体的比例。 高合规率表明监管设计良好、执行良好、被接受。 低合规率可能表明设计不良、执行不力或不切实际的要求。 然而,单靠合规性可能令人误解。 容易实现的规则可能不会推动有意义的变革,而适度合规的艰难规则可能仍然产生巨大的净收益。 例如,美国证券交易委员会跟踪披露要求的遵守情况;高申报率并不能保证投资者实际使用信息。
对结果的影响
结果衡量标准超出了遵守标准的范围,无法衡量世界实际的变化。 对于环境条例,这可能是减少污染物浓度或物种恢复。对于安全条例,结果衡量标准可能是减少工作场所的伤害或交通伤亡。结果衡量标准是衡量监管是否起作用的最直接标准。然而,结果衡量标准要求控制其他因素,而影响结果常常需要复杂的统计方法。 EPA对《清洁空气法》的回顾分析提供了一个众所周知的例子:通过比较重大修正前后的空气质量趋势,该机构估计该法防止了数十万的过早死亡。
成本收益分析
现金收入分析将监管的总经济成本(合规成本、行政负担、生产力损失)与总收益(健康改善、环境收益、风险降低)进行比较。 成本和收益都尽可能以货币形式表示,从而可以直接评估净社会福利。 现金收入分析是许多国家监管影响分析的基石,但也有局限性。 它与不可移动的价值(如生物多样性、人的尊严)有冲突,并且对折扣率和不确定性敏感。 尽管存在这些问题,但现金收入分析仍然是比较监管替代方法的有力工具。 美国管理和预算办公室每年发布关于联邦监管成本和效益的报告,为评估提供了丰富的数据来源。
利益攸关方反馈
需要从受影响者提供质量方面的投入来补充量化的衡量标准。通过调查、公开评论或磋商会议获得的利益攸关方反馈能够揭示出意料之外的后果、执行障碍和公平观念。例如,小企业调查可能表明,报告要求如此繁重,尽管规则本身是合理的,但它阻碍遵守。联合王国金融行为管理局定期进行执行后审查,将量化数据与利益攸关方访谈结合起来。
纵向研究和时间-时间-时间分析
许多监管产生多年来或几十年的影响。 纵向研究跟踪同一受监管实体或地理区域的时间跨度,让评估人员在监管前后观察趋势。 时序计量可以将监管效应与其他经济或社会变化隔离开来。 例如,研究《多德-弗兰克法案》对银行冒险影响的研究人员利用数十年的银行资产负债表季度数据来估计杠杆和交易活动的变化。 这些研究是宝贵的,但需要谨慎的模型来避免混乱的变量。
额外计量:公平、效率和反应
除了上述核心衡量标准之外,监管者越来越多地衡量公平——无论该条例对弱势群体的影响是否不成比例,这可以通过遵守成本的人口分类或结果变化来加以反映。效益可以通过成本效益分析(例如,每获一命一美元)或通过对各法域的监管业绩进行比较来进一步评估。责任性难以量化,但可以被监管更新的速度或给予的豁免的数量所大致理解。
评价方法
选择正确的评价方法取决于监管背景、数据提供情况和所问问题。 方法通常从数量到质量都有所变化,混合方法往往能产生最丰富的见解。
定量方法
定量方法依赖于数字数据和统计推论,其优点是客观性和可复制性,但需要高质量的数据和仔细的模型规格.
准实验设计
由于随机控制试验对于监管来说很少可行(你无法指定一些公司受监管,而另一些公司则不适用),评估人员使用准实验方法。 差异分析[ 在政策变化前后将受监管群体比作非监管控制群体。 递归不连续性 利用阈值(例如,触发更严格规则的特定污染水平)来因果估计影响。 手段变量可在监管本身受到结果影响时处理内在性问题。这些方法现在已成为学术政策评价的标准,并日益为政府机构所采用。
经济模型和模拟
总体平衡模型和系统动态模型可以模拟监管在整个经济或部门中的连锁效应。 例如, EPA的温室气体报告方案[ 使用经济模型来估计排放限度的宏观影响。 这些模型对预测很有力量,但在很大程度上依赖于行为和技术的假设。 它们最好与经验基准并用。
调查和行政数据
对受管制实体的大规模调查可以低廉地产生遵守和结果数据。 行政记录——如税务申报、污染报告或安全检查——提供丰富的纵向数据,而不需要收集原始数据。 将各机构的行政数据集(如健康记录和环境监测)联系起来,可以进行有力的分析,但引起必须管理的隐私问题。
定性方法
定性方法探讨量化结论背后的“如何”和“为什么”问题,对于了解执行进程和利益攸关方的经验至关重要。
深度访谈
与监管者、行业代表、宣传团体和受影响公民的半结构化访谈可以发现遵守、公平感和意外后果的障碍。 比如,在新的食品安全规则出台后与小企业主的访谈可能表明测试设备的成本远远大于其具体操作的食品安全效益。 这种洞察力可以为豁免或分级要求提供信息。
重点小组
焦点小组将不同利益攸关方的小型小组聚集在一起,探讨他们对条例的看法,在测试规则草案或探讨为何遵守率低时,它们特别有用,动态小组互动往往会呈现出个别访谈中不会出现的观点。
个案研究
深入的监管实施案例研究提供了丰富、符合背景的证据。 案例研究可能追踪一城市新的租金管制条例如何影响两年来房东行为、住房供应和房客满意度。 经合组织案例研究库[提供了数十个跨部门实例,说明了监管措施的成功和失败。
混合方法:将两者结合起来
评估框架越来越主张混合方法:使用定量数据来估计因果关系和识别模式,然后利用定性调查来解释这些模式和确定机制。 例如,对 FDA烟草管制的研究[ 可能把中断的吸烟率时间序列分析与对公共卫生官员和烟草零售商的访谈结合起来。 这一三角测量可以加强调查结果的可信度,并提出可采取行动的建议。
条例评价方面的挑战
即使采用最佳的衡量标准和方法,监管评价也面临着长期存在的障碍。 承认这些挑战对于现实的评估至关重要。
数据提供和质量
监管评价往往需要不存在或无法获得的数据。 机密的商业信息、分散的机构记录或短暂的计量期会限制分析。在发展中国家,基本合规数据可能完全缺失。评估者有时必须依赖代理或小样本,这带来了不确定性。 规范.gov 在美国的门户提高了数据透明度,但许多机构仍然缺乏系统性的评价数据库。
归属和反事实
将一项规章与其他同时发生的变化——经济周期、技术变化、其他政策——相分离,是众所周知的困难。 如果没有有效的反事实(如果没有规章,会发生什么),因果关系仍然是暂时的。 准实验方法帮助但依靠可能无法存在的假设(例如平行趋势 ) 。
时间拖拉和动态效果
许多监管只有在长期滞后之后才会产生效果。 环境监管往往需要数年才能显示生态系统健康有可衡量的改善。 金融监管可能防止几十年后发生的危机 — — 或者永远也不会发生。 过早进行的评估可能不会产生效果,而利用过时的数据等待风险太长。 动态效应(例如公司创新以避免合规 ) 也能够随着时间的推移改变监管环境。
利益攸关方抵制和赌博
受监管实体可能抵制数据收集或战略性报告,以尽量减少所察觉的不遵守行为,这可能会对遵守指标和结果措施产生偏见,例如,受排放上限限制的公司可能报告污染不足,使监管显得比它更有效。 独立审计和第三方核查可以减轻赌博,但会增加成本。
政治和体制限制
显示某项监管无效的评价在政治上可能不方便,各机构可能面临压力,只公布积极成果,或者在发现结果不可取时削减评价预算。 机构惰性也阻止了评价结论用于更新规则。 建立评价文化需要领导和长期承诺。
法规评价案例研究
现实世界的评价说明了理论如何与实践相匹配,以下案例突出了不同尺度和不同方法的操作.
《清洁空气法》(环境条例)
美国清洁空气法是历史上评价最广泛的法规之一。 美国环保局的追溯分析采用了合规数据、空气质量监测(结果衡量标准)和健康影响模型相结合。 一项里程碑式的研究估计,在1970年至2020年期间,该法每年防止了20多万例过早死亡。 评估依赖于将各州与不同基线污染水平的差别进行比较,以及成本效益分析,显示效益超过成本的系数为30。 这一证据被用来证明随后的修订和制定空气质量标准是合理的。
《多德-弗兰克法》(财务条例)
2008年金融危机后通过,多德-弗兰克旨在降低系统性风险和保护消费者. 评估侧重于银行资本比率,承担风险行为,以及银行倒闭数量等衡量标准. 利用季度银行数据和围绕资产规模阈值的回归不连续设计的研究发现,在多德-弗兰克公司下进行更紧密的监督降低了风险承担,但也增加了小银行的合规成本. 定性访谈显示,社区银行在报告负担上挣扎,引发了2018年监管减免法案. 案例表明定量和定性评估如何为立法调整提供依据.
烟草管制政策(卫生条例)
食品药品管理局在2009年获得了监管烟草产品的权力,它实施了广告限制、警告标签和口味禁令。 评价者使用存储级销售数据中断的时间序列模型来显示口味禁令将青少年的启动率降低了40%。 对零售商和青少年重点群体进行的调查提供了背景:禁令有效,因为它们消除了吸引人的口味,但青年只是转向在线购买。 这一发现导致强化了对电子商务销售的执法。 食品药品管理局的 监管科学方案 继续为反馈到政策设计的评价提供资金。
GDPR(数据隐私管理)
2018年生效的欧盟数据保护总条例旨在加强数据隐私权。 由于数据流动的全球性质,评估其有效性是一项挑战。 计量包括数据违约通知、罚款和消费者信任调查的数量。 将违约报告定量分析(增加)与隐私官员访谈相结合的混合方法研究发现,该条例提高了人们的认识,但也为小企业带来了合规负担。 评价强调了成员国分级执行和统一的必要性。
结论:实现更聪明的管理
评价监管的有效性不是一次性工作,而是持续的承诺,随着现代经济和生态系统的复杂性的增加,对严格、透明的评估的必要性也随之增加,本条所述的衡量尺度和方法——从遵守率和成本效益分析到准实验设计和利害关系方访谈——提供了一个能够适应任何监管环境的工具包,没有任何单一工具是完美的,最好的评估结合了多种方法,承认不确定性,并积极寻找不可靠的证据。
数据提供、归属和政治阻力的挑战是真实的,但并非不可克服。 政府可以投资数据基础设施、授权独立评估单位以及建立反馈机制,让监管得以发展。 最终目标不是对规则做出最后判断,而是创造动态的学习和改进过程。 被正确评价的监管能够赢得信任,带来结果,为公共利益服务比监管未经过审查更有效。