🎉非常高兴能够参加这个活动,并获得百炼平台的助力!!!
🧐项目:STAIR个人知识库——打造你的“第二大脑”🧠
👁️报名昵称:Jimmy+Cozy
百炼UID:1121201336065383;1811677918863336
❓业务卡点:
1.OSS的B站视频ASR转写:原方案采用本地流式识别,本地whisper跑
- 识别精度低:流式模型无法处理 B 站视频复杂的背景音(BGM),导致大量幻觉与重复文本。
- 架构不稳定:本地直传受网络波动影响大,长视频任务经常中断。
- 时间慢:处理切片视频时间消耗长
2.小红书的OCR识别
之前没有支持小红书平台,并且只支持文本信息的输入
3.从 Dify 转向百炼
- 并发稳定性不足: 随着任务量的增加,自建 Dify 容器在高并发下频繁出现内存溢出或响应延迟
- 代码节点维护成本高:在开源环境下需自行维护运行环境,常因依赖冲突或算力不足导致处理中断。
- 依赖API环境:因为网络变动偶尔会出现无法响应的状态
✊百炼助力
1.我们利用 阿里云百炼大模型 与 OSS 重构了B站视频ASR转写全链路:
- 数据安全:配置 私有 Bucket ,通过生成 临时签名 URL 实现数据的“阅后即焚”,确保音频文件在转写完成后自动清理,实现存储零成本。
- 模型选型:切换至 fun-asr 语音大模型,录音文件识别 (File Transcribe) 能力
2.我们用百炼的工作流平台搭建了微信和小红书链接的解析工作流,前端输入链接之后,自动判定哪个平台并完成内容的获取,调用千问的视觉识别模型(通义千问VL-OCR)实现了对图片的解析,并导出json总结,返回前端做内容卡片的渲染
3.我们把基于RAG进行知识库问答的工作流也切换至百炼平台,并替换为了千问的大语言模型,业务响应速度变快。
👀前后对比
参考图片
项目地址:https://pwa-stairt.vercel.app/
活动文档:https://my.feishu.cn/wiki/D6J4wMqWyiF6WEk1dLPcfEUTnMe