可灵2.6 – 快手可灵推出音画同出的AI视频生成模型,支模型持文生音画和图生音画两种模式可灵推出视频生成2.6模型,该模型提供了里程碑式的“音画同出”能力,彻底改变了传统AI视频生成模型“先无声画面、后人工配音”的工作流程,用户仅需输入一段文字或一张图片,即可自动产出融合自然语音、精准音...发现资讯9个月前07650
Mano – 明略科技推出的GUI智能操作模型,为自动化操作提供高效解决方案mano 是由明略科技研发的专用大模型,专注于图形用户界面(gui)的智能化操作。该模型建立在多模态基础架构之上,融合了在线强化学习与自动化训练数据采集等前沿技术。Mano的创新,不单单是解决了目前的...发现资讯11个月前07650
Devstral 2 – Mistral AI开源的新一代编程模型系列,支持在大型代码库中进行复杂的代码修改和重构Mistral AI 推出新一代编程模型家族 Devstral 2,支持端到端自动化编程,相比参数规模更大的闭源模型,其成本效率高达7倍以上,特别适合大规模自动化编码任务,其核心优势在于支持跨文件协同...发现资讯9个月前07640
Infography – 自动将文本内容转化可视化图表生成平台Infography是一款由专业团队开发的AI工具,能将复杂的数据或文本内容转化为直观的视觉呈现,主要面向市场营销人员、产品经理、教育工作者以及任何需要将复杂信息以视觉化方式呈现的用户。Infogra...发现资讯8个月前07610
Agentation – AI编程协作工具,支持自动捕获元素,可视化反馈问题转为代码Agentation是一款开源的 ai 编程协同工具,专为提升开发者与 ai 编程助手之间的协作效率而设计,它通过允许用户在网页界面中直接进行可视化标注,将直观的问题反馈自动转化为机器可解析的结构化信...发现资讯7个月前07560
Qianfan-VL – 百度开源的视觉理解模型,最高支持4K分辨率输入百度智能云千帆正式推出全新视觉理解模型 ——Qianfan-VL,共推出了3B、8B和70B三个版本,参数量覆盖从小到大的范围,能够灵活适应从边缘计算到云端推理的各类应用场景,并全面开源。 Qianf...发现资讯11个月前07560
EchoMimicV3 – 蚂蚁集团推出的多模态数字人视频生成框架,实现高效的模型训练和快速的动画生成。EchoMimicV3 是由蚂蚁集团研发的一款高效、多模态、多任务的数字人视频生成框架。该模型拥有 13 亿参数,采用任务混合与模态混合的创新范式,结合独特的训练与推理策略,能够在多种输入条件下实现快...发现资讯1年前07550
Code Wiki – Google推出的AI代码文档生成工具,自动化生成和更新代码文档Google 推出 Code Wiki,一款 AI 代码文档生成工具,能够自动分析 GitHub 代码仓库并生成结构化的 Wiki 文档。该工具自动绘制调用关系和组件关系图,并在代码更新时同步更新文档...发现9个月前07540
AudioFly – 科大讯飞开源的文生音效模型,支持本地部署、推理和微调。主要介绍 AudioFly是科大讯飞推出的开源文生音效模型,基于潜在扩散模型(LDM)架构,能够根据文本描述生成高质量音频。该模型支持44.1kHz采样率,在文本与音效的匹配度上表现优异,适用于短视频...发现资讯11个月前07540
SHARP – 苹果开源的3D场景生成AI模型,支持实时渲染高分辨率的 3D 视图Apple 近日开源了一款名为 SHARP的人工智能模型,该模型能够在不到一秒钟的时间内,仅凭一张普通的 2D 照片生成高度逼真的 3D 场景表示。它打破了传统3D 重建动辄数小时的耗时瓶颈,仅需不到...发现资讯8个月前07530