获得徽章 0
赞了这篇沸点
要看不想看的第七局了。
6
赞了这篇沸点
有没有人打瓦
评论
赞了这篇沸点
#作品讨论:文抓抓 —— AI 驱动的文案提取与创作工具#

作品名称:文抓抓

一句话简介:视频、图片、文件一键转文字,再用 AI 总结、扩写、润色、生成思维导图。

使用链接:
微信小程序搜「文抓抓」
网页版 wzz.aryastark.cn

说说做这个产品的过程和感受。

起点其实很朴素:刷短视频的时候经常想把文案扒下来留着自己用,但纯靠听写太累;开完会想整理纪要,录音又丢在相册里再也不去听。市面上能"转文字"的工具不少,但基本转完就结束了——想再总结、换种风格、做 SEO,又得换别的工具来回倒。

于是就想把"提取"和"加工"这两步收进一个地方。前端用 UniApp 写一套,小程序和网页版一起跑;文字处理直接接 DeepSeek 大模型,总结、扩写、缩写、风格迁移、SEO、合规检测都走同一套接口,后面加新能力也快。

踩过的坑印象比较深的有几个:语音识别要把背景音乐、歌声和语音剥开,音轨分离那部分调了很久;字幕格式转换要兼容 SRT、VTT、ASS 一长串,每种的时间戳和样式标记都不一样;小程序里传大视频还有体积和性能的限制。这些功能看着都不起眼,真做起来全是细节。

另外这个过程我自己也基本是在和 AI 结对写——很多页面、接口都是 AI 协助搭起来的,这也是我把文抓抓发到作品广场来的原因。

现在文抓抓已经上线,小程序和网页版都能用,也接入了会员和收益。发到这里是想听听大家的反馈:还有哪些"对着文字费劲"的场景,是我没想到的?持续迭代更新ing[力量]
展开
初见666于2026-09-12 09:11发布的图片
初见666于2026-09-12 09:11发布的图片
初见666于2026-09-12 09:11发布的图片
初见666于2026-09-12 09:11发布的图片
3
赞了这篇沸点
#日新计划#
你用视频模型做了条短片,结果:嘴型和配音对不上、同一个主角第三秒换了张脸、想做直播实时换脸发现模型必须"等十几秒一次性吐完所有帧"。
这三件事分别卡在三道工程线上:声画不同源(后处理拼接必错位)、身份没被显式条件化(扩散每帧从噪声起步、脸是"隐式涌现")、DiT 是离线一次性生成(根本不能流式)。
而 2026 年这三个问题同时有了进展:同 latent 联合去噪、reference cross-attention 锁死身份、AR-DiT 把生成改成 chunk 流式即产即播。
展开
评论
赞了这篇沸点
加班第三天,下周可以不加班吗?
1
赞了这篇沸点
#每日快讯#
ECCV上,顶尖学者们开始研究如何让AI做生意了
多模态AI大牛轮番登台,全球64支团队组团解题
AI下一步往哪儿走,顶会往往最先露出风声。
9月8日至12日,ECCV 2026正在瑞典马尔默举行。大会由欧洲计算机视觉协会主办,汇聚了Google、Meta、Apple、Amazon等全球科技巨头作为主要赞助商。
作为计算机视觉顶会的ECCV…
展开
1
下一页