报告概述
本报告介绍Project Spectrum,该项目探索使用人工智能(特别是文本嵌入与经典机器学习算法)对大规模网络爬取的产品数据进行自动分类,以支持通胀的实时预测(nowcasting)。研究对象为欧洲央行每日价格数据集(DPD),包含约3400万种产品。报告详细阐述了嵌入分类器(KNN和FFN)的设计、训练与评估,并与直接使用大语言模型(LLM)提示的方法进行比较。报告还展示了持续迭代优化流程,通过人工标注逐步扩展参考数据集,提升分类精度和覆盖范围。该报告为货币政策分析师、央行数据科学家以及统计机构提供了一种低成本、可扩展的自动化产品分类方案。
报告的核心结论
嵌入分类器以极低成本达到接近LLM的精度
使用文本嵌入(如Text-Embedding-3-Large)结合KNN或FFN分类器,在ECOICOP五级分类上达到约75%-80%的准确率,而直接使用GPT-5提示的准确率为86%。但嵌入分类器的处理成本仅为每千条产品0.03欧元,时间不到7秒,而LLM方法每千条需500秒和22.2欧元。
自动化分类使大规模网络数据可用于通胀分析
DPD每天产生约400万条价格观测,每月新增近100万种新产品。手动分类不可行,直接LLM方法处理3400万条需超过200天和65万欧元。嵌入分类器仅5天即可完成全数据集分类,成本约1500欧元,使高频实时价格数据能够被纳入通胀预测模型。
持续迭代流程可系统性提升分类准确率
项目开发了人机协作的迭代优化流程:通过分层抽样选择低精度或样本不足的类别,由人工标注后扩充参考与验证数据集,然后重新分类全部产品。目前已通过6,000条新增标注完成初步迭代,并将持续进行以覆盖更多产品类别。
当前数据集覆盖约50%的欧元区CPI篮子
DPD涵盖食品、服装、个人护理、电子产品和家具等关键领域,但能源、住房租金、电信和汽车等类别因难以在线获取而缺失。在覆盖的154个ECOICOP五级子类中,通过嵌入分类器可实现70%以上精度的类别合计覆盖36%的CPI权重。
报告回答的关键问题
如何用AI对海量产品自动分类以用于通胀预测?
Project Spectrum使用文本嵌入模型将产品描述(名称、描述、店铺类别等)转换为高维向量,然后用K近邻(KNN)或前馈神经网络(FFN)分类器将这些向量映射到ECOICOP五级分类代码。该方法可在几小时内处理数百万条产品,成本极低,且精度接近直接用大语言模型(GPT-5)提示的结果。
文本嵌入分类器与大语言模型提示相比有什么优势?
主要优势是成本和时间。直接LLM提示每千条产品平均耗时500秒、成本22.2欧元,而嵌入+FFN方法仅需6.8秒、0.031欧元。处理整个DPD(3400万条)时,LLM需要超200天和65万欧元,嵌入方法仅需5天和1500欧元。此外,嵌入分类器结果可重复、可模块化,便于更新和调试。
嵌入分类器在通胀分析中的分类精度如何?
在测试集(3万条手动标注)上,嵌入+FFN达到80%的总体准确率,KNN为75%,直接LLM提示为86%。但嵌入分类器的错误大多发生在同一大类(ECOICOP二位码)内部,对整体通胀跟踪影响较小。在食品、服装等核心类别上精度超过70%,且通过持续迭代补充标注可以进一步提高。
如何克服产品分类中类别不平衡的问题?
报告构建了经过精心配比的参考数据集(3万条),对过表示类别(如食品配送)进行降采样,对稀有类别增加比例。此外,通过迭代流程优先选择低精度或样本不足的类别进行人工标注,逐步扩充参考和验证集,持续改善分类性能。
该项目对央行和统计机构有什么实际价值?
提供了一套可投入生产的自动化产品分类管道,能够每天处理数百万级新产品的分类(每小时约33万条)。分类结果可直接用于构建精细化价格指数和通胀预测模型,使政策制定者能够更及时、更详细地掌握价格动态,提升货币政策的前瞻性。
报告中的代表性数据
全数据集分类时间与成本对比
截至2025年12月,基于实际测试推算分类34百万条唯一产品的总耗时与成本。嵌入方法使用Text-Embedding-3-Large + KNN/FFN,LLM使用GPT-5直接提示。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 详细的项目背景与动机:阐释为何实时价格数据对货币政策重要,以及传统分类方法的局限性。
- 数据描述:介绍ECB每日价格数据集(DPD)的结构、规模、字段及覆盖范围,包含34百万条唯一产品观测,覆盖约50%欧元区CPI。
- 手动标注方法:说明训练集和测试集的构建过程,包括标注者培训、质量控制和标注一致性分析(Fleiss' Kappa指标)。
- 嵌入模型与分类算法详解:对比多种嵌入模型(如Text-Embedding-3-Large/Small),详述KNN和FFN的架构、超参数调优及距离度量选择。
- 性能评估图表:包含按ECOICOP子类的精度热力图、精度-CPI覆盖权衡曲线、分类混淆矩阵,以及不同方法在速度和成本上的详细对比表格。
- 连续优化迭代流程:完整描述人机协作的半自动化迭代方案,包括批次选择策略(基于精度、样本量、CPI权重等)、新增标注后重新分类的循环。
- 初始部署结果:介绍已完成的6,000条新增标注对参考和验证集的扩充效果,以及全DPD分类结果已向合作伙伴提供的情况。
- 结论与下一步工作:提议构建历史CPI指数进行回测、在其他数据集和语言上验证方法,并探索在金融稳定评估等更广领域应用。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。
相关报告

Financing the AI boom: from cash flows to debt

AI adoption, productivity and employment: evidence from European firms

Economic impact of AI in emerging market economies

Global giants in the AI supply chain

Generative AI for surveys on payment apps: AI views on privacy and technology
