glmv-caption
使用智谱GLM-V多模态模型系列为图片、视频和文档生成标题(描述)。当用户想要描述、添加字幕、总结或解释图片、视频或文件的内容时,请使用此技能。支持单个/多个输入、URL、本地路径以及Base64编码(仅限图片)。
把 Skill 的源码、资源快照、README、包体和安装信号放进一个可搜索、可筛选的公开目录。
使用智谱GLM-V多模态模型系列为图片、视频和文档生成标题(描述)。当用户想要描述、添加字幕、总结或解释图片、视频或文件的内容时,请使用此技能。支持单个/多个输入、URL、本地路径以及Base64编码(仅限图片)。
记忆是智能代理的基石。没有它,每次交互都从零开始。这项技能涵盖了代理记忆的架构:短期(上下文窗口)、长期(向量...)
为已有 AI 短视频做一次聚焦真实感精修,调整光影、材质、饱和度和重复细节,让镜头更自然、更耐看。
纯本地(localhost)音视频融合理解 skill:用 OpenVINO™ 在本地完成语音转写(ASR)+画面理解(VL), 全程不调用任何云端 API,解决云端 AI 不接受大视频/长视频被截断/隐私不能出网的痛点。 当用户用中文或英文提到 理解视频内容/看懂视频说了什么演了什么/视频总结/剧情梳理/字幕识别/ 长视频转写/离线视频分析/本地 ASR/视频转文字/understand thi…
把一张人像和短脚本或语音,制作成适合讲解、公告、课程和产品介绍的数字人口播视频。
AI图像生成与编辑能力,基于 Nano Banana (Gemini Image) 实现文生图、图生图、图像编辑。适用于创意设计、营销素材、社交媒体内容、演示文稿配图等场景。支持多种风格、高分辨率输出(最高4K)、文字渲染、角色一致性保持。
按已经写好的岗位稿和授权静帧,做成双选会口播,每张照片一条。
按已经写好的材料清单,做成每条说明一条口播。
用一首歌的情绪和节奏,制作一个短视觉短片——把音乐片段和视觉方向变成电影感宣传短片,让封面图随音乐动起来,或用松散参考构建氛围视觉。
一种利用GLM-V原生接地能力进行坐标转换、边界框可视化等功能的技能。GLM-V原生接地可以在图像中定位提示指定的任何目标,并基于图像大小输出归一化到0-1000的相对坐标。坐标格式包括2D边界框(默认)、2D点和3D边界框。GLM-V还支持视频中多个提示指定目标的空间时间定位和跟踪,每秒输出2D边界框。
给一条短视频在开头或结尾补上衔接画面——向后续写、向前补长、延长镜头、补全结尾,让画面自然延续。
用两张审核好的图片生成一条转场视频——从首帧到尾帧做变装、产品揭晓、前后对比、昼夜切换等丝滑转场。
用一张清晰人像照片和一段简短歌曲片段,生成一段照片开口唱歌的短片。
聘才猫 - 简历优化 使用时调用Pincaimao简历优化API,根据目标职位描述自动优化或重写简历内容。需要设置PCM_RESUME_OPTIMIZE_KEY环境变量。
把热线话术做成带标签的客服语音包,欢迎、菜单、等待、转接、非工作时间和错误提示一把声音录完。
按已经写好的销售留言稿,做成一组可导入的语音信箱。
从一个定稿的戏剧节拍和参考素材,生成一个电影感的竖屏短剧镜头——纯文本、确认的开场图、首尾两张图,或松散的演员和场景参考均可。
把产品图、人像、照片、插画或 AI 图片变成有明确动作和运镜的短视频。
使用ZhiPu GLM-OCR API从图片和PDF中识别并提取数学公式,并将其转换为LaTeX格式的官方技能。支持复杂的方程式、内联公式以及公式块。当用户想要提取公式、将公式图像转换为LaTeX或对数学表达式进行OCR时,请使用此技能。
将描述性文字转换为漫画页面的完整工作流。支持素描(黑白线稿)和彩绘(彩色漫画)两种风格,可从直接输入或文件(.docx、.txt)读取文字,生成后可编辑单页,最终输出为 PDF 文档。
用一张清晰的宠物照片和一段简短留言或配音,生成一段宠物说话视频。
按教师提供的板书事实,为每张板书照做成一条板书照转一镜短片。
按已经读过的对标Reel构图,给每张商品图做成一条详情一镜。
按已经写好的话术标题和话术正文,做成一组话术转卡组静帧。