• 首页
  • 消息
  • 我的主页
    • 团队地图
    • 职位列表
    • 报刊亭
    • 我的
立即登录
设置
隐私政策用户条款营业执照人力资源服务许可证浙B2-20260388浙ICP备2024101243号浙公网安备33011002018106号© 2024-2026 Bonjour! 数字名片. All rights reserved.
社区找工
消息我
🦄 寻找 Co-Founder

Jimmy

PM/vibe coding l 在做个人知识库

  • 📍 中国·浙江省·宁波市
  • 🧙 独立开发者
  • 🧙 产品经理
  • 🧙 UX
0关注3被关注0互相关注
Jimmy🏄🏻‍♂️ ! Event
🎉非常高兴能够参加这个活动,并获得百炼平台的助力!!! 🧐项目:STAIR个人知识库——打造你的“第二大脑”🧠 👁️报名昵称:Jimmy+Cozy 百炼UID:1121201336065383;1811677918863336 ❓业务卡点: 1.OSS的B站视频ASR转写:原方案采用本地流式识别,本地whisper跑 - 识别精度低:流式模型无法处理 B 站视频复杂的背景音(BGM),导致大量幻觉与重复文本。 - 架构不稳定:本地直传受网络波动影响大,长视频任务经常中断。 - 时间慢:处理切片视频时间消耗长 2.小红书的OCR识别 之前没有支持小红书平台,并且只支持文本信息的输入 3.从 Dify 转向百炼 - 并发稳定性不足: 随着任务量的增加,自建 Dify 容器在高并发下频繁出现内存溢出或响应延迟 - 代码节点维护成本高:在开源环境下需自行维护运行环境,常因依赖冲突或算力不足导致处理中断。 - 依赖API环境:因为网络变动偶尔会出现无法响应的状态 ✊百炼助力 1.我们利用 阿里云百炼大模型 与 OSS 重构了B站视频ASR转写全链路: - 数据安全:配置 私有 Bucket ,通过生成 临时签名 URL 实现数据的“阅后即焚”,确保音频文件在转写完成后自动清理,实现存储零成本。 - 模型选型:切换至 fun-asr 语音大模型,录音文件识别 (File Transcribe) 能力 2.我们用百炼的工作流平台搭建了微信和小红书链接的解析工作流,前端输入链接之后,自动判定哪个平台并完成内容的获取,调用千问的视觉识别模型(通义千问VL-OCR)实现了对图片的解析,并导出json总结,返回前端做内容卡片的渲染 3.我们把基于RAG进行知识库问答的工作流也切换至百炼平台,并替换为了千问的大语言模型,业务响应速度变快。 👀前后对比 参考图片 项目地址:https://pwa-stairt.vercel.app/ 活动文档:https://my.feishu.cn/wiki/D6J4wMqWyiF6WEk1dLPcfEUTnMe

Jimmy