微信扫码
添加专属顾问
我要投稿
最近学习AI的时候,经常要看一些视频资料。但有些视频内容比较长,完整看下来比较花时间。
所以,就想着用大模型对视频内容先做一次总结,然后再有选择性地去看。
一不小心,就开发了一个视频总结智能体。
下面就给朋友们分享一下核心科技,啊哈哈。
第一步,获取视频
这里用小破站上讲解 GPT 的视频为例
用扣子中的插件,输出视频url就可以下载视频
第二步,提取视频内容
这里只提取了视频字幕。分两小步,先分离视频中的音频,再调用ASR语音识别技术,将音频转成文本。
这两步虽然在扣子中都有对应的插件,但我试了下没成功。就自己动手开发了一个插件。
代码是用大模型生成的。将插件发布后,就可以在工作流中使用了
第三步,总结视频内容
这个视频有27分钟,并且是英文版,提取的字幕大小30kb。长文本内容总结,当然用 Kimi。
Kimi可以帮我们总结、提炼,生成中文版的核心要点。
纯文字版内容读起来还是差点意思,我们可以继续添加插件,将 Kimi 生成的内容做成思维导图。
这样,一个27分钟的视频,经过智能体总结,分分钟掌握其中的核心要点。学习效率嗖嗖的。
这个智能体我们只能提取了字幕进行总结,其实还可以提取视频关键帧,送入视觉大模型,进行内容生成或者问答。
53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费场景POC验证,效果验证后签署服务协议。零风险落地应用大模型,已交付160+中大型企业
2025-04-30
深度解析OpenAI和Google智能体白皮书及背后两种路线|大模型研究
2025-04-30
MCP入门指南:大模型时代的USB接口
2025-04-30
通俗易懂的梳理MCP的工作流程(以高德地图MCP为例)
2025-04-30
一文说明 Function Calling、MCP、A2A 的区别!
2025-04-30
MCP很好,但它不是万灵药|一文读懂 MCP
2025-04-30
旅行规划太难做?5 分钟构建智能Agent,集成地图 MCP Server
2025-04-29
10万元跑满血版DeepSeek,这家公司掀了一体机市场的桌子|甲子光年
2025-04-29
谷歌大神首次揭秘Gemini预训练秘密:52页PPT干货,推理成本成最重要因素
2024-08-13
2024-06-13
2024-08-21
2024-09-23
2024-07-31
2024-05-28
2024-08-04
2024-04-26
2024-07-09
2024-09-17
2025-04-29
2025-04-29
2025-04-29
2025-04-28
2025-04-28
2025-04-28
2025-04-28
2025-04-28