应帆应财智云金融资讯图片匹配算法一、字段
金融资讯主表:存储资讯文本及发布信息。主关键字段 news_id,属性为 BIGINT, PRIMARY KEY,唯一标识每篇资讯。
图片资源表:存储图片链接与存储路径。主关键字段 img_id,属性为 BIGINT, PRIMARY KEY;img_md5 唯一索引用于去重。
图片特征向量表:匹配核心数据源。主关键字段 vec_id,属性为 BIGINT, PRIMARY KEY;feature_vector BLOB 存储高维特征向量。
图文匹配结果表:记录匹配结果。主关键字段 match_id,属性为 BIGINT, PRIMARY KEY;similarity 记录相似度得分。
二、数据组织方式
系统采用MySQL关系表 + 向量字段架构,特征向量压缩存入 BLOB字段。基于 news_id、img_md5、vec_id 建联合索引,通过 MD5 快速去重,结合向量余弦相似度完成匹配,主外键关联实现全数据链路绑定,兼顾结构化查询与算法运算需求。
应帆应财智云个股周报资讯通过字段定义数据特征,字段属性规定数据类型、取值范围,主关键字段唯一标识每条数据,确保数据完整性和可检索性。
一、个股行情表现字段信息
字段名称:证券代码、简称、公告标题、公告时间、周交易时段、周涨跌幅、收盘价、A股涨跌幅排名、行业指数代码、行业指数涨跌幅
字段属性:证券代码(字符串,6位)、简称(字符串)、公告标题(字符串)、公告时间(日期格式)、周交易时段(字符串)、周涨跌幅(数值,保留2位小数)、收盘价(数值,保留2位小数)、A股涨跌幅排名(整数)、行业指数代码(字符串)、行业指数涨跌幅(数值,保留2位小数)
主关键字段:证券代码+周交易时段(唯一标识单只股票单周行情)
应帆应财智云上市公司财报数据智能分析本产品通过结构化数据模型支撑三大智能业务场景,数据组织遵循“业务驱动、关联互通”原则,通过核心数据表的关联设计实现高效存取与整合。
核心数据表设计如下:
(1)上市公司基础信息表:以stock_id(股票代码)为主键,记录stock_name(公司全称)与industry(行业分类)等基础属性。
(2)财报核心数据表:以report_id(财报唯一编号)为主键,通过外键stock_id关联公司信息。核心字段包括report_period(财报期间,如“2024年中报”)、revenue(营业收入,单位万元)、profit(净利润,万元)及growth_rate(同比增长率,百分比),构成视频解读的核心数据来源。
(3)视频生产信息表:以video_id(视频唯一标识)为主键,通过外键report_id关联具体财报数据。关键字段记录生产流程:template_id(所使用的视频模板编号)、video_status(标识生产状态,如0-待审核、1-已发布)及create_time(视频生成时间戳)。
应帆Yinfluencer达分销数据管理平台基于关系型数据库(InnoDB引擎)构建,用于存储多维度的订单明细数据。表结构采用行式存储,单条记录对应一个订单明细,通过列定义各项属性,并利用索引与约束保障查询性能及数据完整性。
核心表为 yinfluencer.order_item,使用 id 字段作为自增主键,唯一标识每条订单记录。数据表字符集为 utf8mb4,支持存储 emoji 及特殊字符。核心字段分为以下几类:1)标识类:如 order_platform_id、product_id,用于关联平台及商品;2)基础信息类:包括 platform、product_name 等;3)金额类:如 payment_amout、settled_kickback;4)时间类:如 order_time、payment_time 等时间戳信息;5)状态类:如order_status、deleted 标记订单与删除状态。
为提升查询效率,表结构设计了普通索引(如 order_platform_idx)及联合索引 kol_page_idx,以支持高频条件与分页筛选。同时通过主键约束、非空约束及默认值设置,确保数据一致性与业务规则执行。
应帆应财智云申万行业异动资讯以申万行业分类为基准,采用分布式数据库 + 数据仓库架构,按 “行业 - 指数 - 异动 - 资讯 - ETF” 分层存储,字段标准化、主键唯一、关联绑定。
1. 核心字段及属性
行业代码:字符型(6 位),唯一,申万一级 / 二级行业编码
行业名称:字符型,行业全称(如 “半导体”)
指数代码:字符型(6 位),对应申万行业指数
指数涨幅:浮点型(±%),当日 / 区间涨跌幅
异动标记:布尔型,1 = 异动(涨跌超 ±3%/ 放量),0 = 正常
异动类型:字符型,领涨 / 领跌 / 资金流入 / 政策催化
资讯 ID:字符型,唯一,关联资讯原文
资讯摘要:文本型,核心异动原因
ETF 代码:字符型(6 位),跟踪该行业的 ETF
ETF 涨幅:浮点型(±%),同步联动涨幅
数据时间:日期时间型,精确到分钟
2. 主关键字段
联合主键:行业代码 + 指数代码 + 数据时间,确保每条异动记录唯一,支撑秒级查询与排序。
3. 数据逻辑
行业异动→指数涨跌→ETF 联动:系统通过关联字段绑定行业、指数、资讯与 ETF 数据,实时计算异动并推送资讯,助力机构 / 用户把握板块机会。
应帆应财智云基金讨论区数据智能分析本产品采用关系型结构化存储,以行式存储组织基金讨论区帖子的全量数据,以满足金融舆情采集场景下对数据存取与管理的需求。通过设置唯一索引与普通索引,实现对帖子数据的高效检索及采集状态的灵活管理。
核心数据字段设计如下:
feed_id (varchar(255), UNIQUE KEY):作为帖子唯一标识,用于确保数据不重复
is_crawl_comment (int(1), KEY, 默认值 1):评论采集状态标识,支持基于采集状态快速筛选帖子
title (varchar(255)):帖子标题
publisher (varchar(255)):发帖人昵称
create_time (datetime):原帖发布时间
content (text):帖子正文内容
read/comment/digg (int(11)):分别记录帖子的阅读数、评论数与点赞数
crawl_time (datetime):自动更新的系统采集时间
存储组织特点:存储组织通过结构化字段设计、针对性索引优化与InnoDB引擎适配,在确保事务一致性与中文兼容的基础上,实现金融舆情数据的高效采集、精准检索与稳定存储。
应帆CBNData中国消费品牌增长力模型基于PostgreSQL数据库构建,用于存储用户行为数据,采用关系型行存储方式,每条记录代表一个独立行为,并通过索引和约束保障性能与完整性。
核心表为public.user_actions,以id(bigserial类型)作为自增主键确保记录唯一性。主要字段分为四大类:1)关联类,如user_id和target_id,标识用户及目标对象;2)类型类,包括action_type、target_type等,定义行为与对象属性;3)位置类,即position_type,设有默认值约束;4)时间类,包含非空的created_at和updated_at时间戳。
为优化查询,表结构设计了单列索引(如基于created_at和user_id)与复合索引(如target_type和target_id组合),以支持多维度高效检索。此外,通过主键约束、默认值及非空约束,进一步确保了数据的一致性与可靠性。