六段式大模型事件追踪管线
系统包含初筛、聚类、忠实摘要、事件框架、翻译与热度计算。本地部署 Qwen3.5-4B 与腾讯混元 Hy-MT2,关闭思考模式后结构化输出稳定可解析;跨语言聚类在人工标注集上准确率达 84%;Jinja2 渲染中英双语静态站与 7 类 SVG 可视化;161 项 pytest 与 28 项 E2E 验收。
核心界面截图实测
站点首页:事件流与热度趋势
事件详情:时间线与双语摘要
宏观洞察:实体关系与多维演化
热榜监测:跨信源热度对比
大模型数据运营实习生 | 2026.04 - 2026.08
虚拟试穿训练数据生产架构
虚拟试穿模型缺少成体系训练数据,商品图散落在 10 余个时装与内衣品牌网站。独立负责自动化采集、智能模型筛选与 SAM3 分割三条线,建成三元组与四元组标准化生产管线。
自动化数据采集
API、HTTP、Playwright 混合策略,突破反爬风控;累计入库 3.1万余款商品、图视频逾 11 万份,断点续跑与分类对账。
智能多模态筛选
SGLang 多卡部署 Qwen3.8-27B 投机解码,吞吐较 llama.cpp 达 2.6 倍;多图同屏将请求量由 16.2 万次降至 1.3 万次,评测一致率 90%。
SAM3 分割与交付
模特图衣物精准分割,上装/下装/全身参数优化,单张分割 2.6s;合计交付 近 5 万组 三元组与四元组,支撑三类 LoRA 训练与部署。
总台值班场景 | 媒体监测实习生 | 2024.11 - 至今
总台智能舆情监测全链路链路
面向总台值班场景的日常舆情监测上报需求,值班员需从海量稿件中精准定位差错与舆情风险。独立开发覆盖采集、审核、数仓、看板与自动交付的全链路系统,以 AI 分级审核辅助人工:
模型智能审核路由
调度豆包 Seed 2.1 与 DeepSeek-V4 初审与帖子级精判,全量稿件先由 AI 把关;值班员从逐条浏览约 1,000 条转为仅复核约 25 条高危候选,用量约 200 万 tokens/值班日。
SQLite 数仓与看板交付
自建 17 表 SQLite 数仓按 ODS-DWD-DWS-ADS 四层建模,FastAPI 控制中心调度,ECharts 搭建漏斗与成本看板;终态事件成功率达 95%,上报与反馈条数居部门第一。
开源社区运营实习生 | 2025.03 - 2025.08
CARLA 人才与行业调研高清图表
学历与薪资交叉分布:学历加成,经验加持
全国岗位城市分布:北上深集中度
开发语言需求结构:C++ 与 Python 主导
岗位分类结构:研发 / 算法 / 测试占比
微信公众号已发表深度推文
语培新媒体运营实习生 | 2024.01 - 2024.05
微信公众号已发表爆款推文
小红书官方号与矩阵图文笔记
计算传播学第一作者研究成果
论文一:短视频传播归因研究(沈霄、杨凯隆,CSSCI 拟录用)
构建多模态特征工程(Librosa 响度节奏、OpenCV 色彩亮度、PySceneDetect 镜头等 23 维特征),结合 CatBoost 与 SHAP 树解释模型,探究县级融媒体传播机制与可见性因果机制。
样本筛选漏斗与清洗流程
四维信息生态理论框架
平台可见性因果机制图
CatBoost + SHAP 归因蜂群图
论文二:微博突发事件舆情演化(沈霄、杨凯隆,《信息技术与管理应用》2024(6))
采集 15.4 万条微博热搜,基于 StructBERT 与 AipNLP 情感建模,Tomotopy LDA 贝叶斯优化提取 4 类主题,季度词袋追踪与 NetworkX 语义网络构建。
热度时序走势与情感极性演化
季度跨期主题演化桑基图
突发事件高频词语义网络
全流程数据采集与建模架构
时序建模与特征工程方案
基于 287 万行训练集数据,预测未来 10 天各房屋电力需求。构建 10-35 天及 2-12 个月历史平移特征、1-3 阶差分与滚动窗口均值/方差;使用 OpenFE 自动提取特征交互;LightGBM、XGBoost 与 CatBoost 三模型结合 Ridge 线性加权融合。
正大杯全国总决赛二等奖 | 省级大创项目
消费者客群洞察与多模态调研
融合 5,400+ 电商真实评论与结构化问卷数据,利用微调 BERT 情感模型与 Biterm 短文本主题挖掘,结合 k-modes 聚类出「年轻新潮型、理智稳重型、从众优享型」三类客群画像。
好评与差评关键词词云分布
三类核心客群特征雷达画像
消费者 vs 潜在消费者动机差异
问卷信效度与维度相关系数矩阵