首页 > 其他分享 >微软发布 Phi-3.5 系列模型,涵盖端侧、多模态、MOE;字节 Seed-ASR:自动识别多语言丨 RTE 开发者日报

微软发布 Phi-3.5 系列模型,涵盖端侧、多模态、MOE;字节 Seed-ASR:自动识别多语言丨 RTE 开发者日报

时间:2024-08-22 16:06:04浏览次数:4  
标签:ASR Phi 端侧 模型 v0 AI Meta 3.5

 

 

 

开发者朋友们大家好:

 

这里是 「RTE 开发者日报」 ,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的 新闻 」、「有态度的 观点 」、「有意思的 数据 」、「有思考的 文章 」、「有看点的 会议 」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

 

本期编辑:@SSN,@鲍勃

01 有话题的新闻

1、微软发布 Phi-3.5-vision 轻量级、多模态的开源模型,端侧运行,可进行复杂视觉推理

 

微软发布 Phi-3.5-vision 轻量级、多模态的开源模型,其属于 Phi-3 模型家族。该模型专为需要文本和视觉输入的应用而设计,重点处理高质量、高推理密度的数据。它支持 128K 的上下文长度,并经过严格的微调和优化过程,旨在在内存或计算资源有限、低延迟要求高的环境中广泛用于商业和研究领域。

 

该模型具备广泛的图像理解、光学字符识别(OCR)、图表和表格解析、多图像或视频剪辑摘要等功能,非常适合多种 AI 驱动的应用,在图像和视频处理相关的基准测试中表现出显著的性能提升。

 

Phi 3.5 系列 AI 模型包括三款不同特点的模型:Phi-3.5-mini-instruct、Phi-3.5-MoE-instruct 和 Phi-3.5-vision-instruct。这些模型在 Hugging Face 平台上开源,并获得了 Microsoft 的 MIT 许可证,允许不受限制的商业应用和修改。

 

Phi-3.5-mini-instruct 是一款轻量级模型,拥有 38.2 亿参数,支持 128k token 上下文长度,适合在内存或算力受限的设备上使用,并且在多语言和多轮对话任务中表现良好。Phi-3.5-MoE-instruct 是微软 Phi 模型中的首个 MoE 模型,采用混合专家架构,拥有 420 亿个参数,专注于处理高质量推理密集数据,并在专业学科领域的 MMLU 基准测试中击败了 GPT-4o mini。Phi-3.5-vision-instruct 是一个多模态模型,集成了文本和图像处理功能,适用于图像理解、光学字符识别等任务,并在视觉任务基准测试中表现出色。(@雷锋网)

 

2、字节跳动 Seed-ASR:自动语音识别模型,可识别不同语言、方言、口音

 

字节跳动豆包近期推出的 Seed-ASR 是一款先进的自动语音识别模型,能够识别多种语言、方言和口音。Seed-ASR 通过超过 2000 万小时的语音数据和近 90 万小时的配对 ASR 数据进行训练,展现出了卓越的识别能力。

 

该模型支持精准识别普通话以及 13 种中国方言,同时具备处理各种口音的英语和其他 7 种语言的能力。Seed-ASR 还具备强大的上下文感知能力,能够根据特定场景,如历史对话记录、会议纪要等信息,更准确地进行语音内容的识别。此外,Seed-ASR 可以进一步部署以支持各种场景中的特定需求,而无需额外的语言模型。(@站长之家)

 

3、v0 发布一个基于聊天的网页开发助手,可生成用户界面、自动编写运行代码

 

v0 发布一个基于聊天的网页开发助手,用户可以通过聊天的方式与 v0 互动,让它帮助调试代码、回答开发问题、生成代码等,专门用于前端开发领域,可以为用户提供关于这些技术的深入指导和帮助。无论是编写代码、优化性能、部署应用,还是解决技术难题,v0 都能提供专业的支持和建议。

 

它拥有丰富的 TypeScript、React、Next.js、Vercel 等前端技术的知识。用户可以把 v0 视为个人的 web 开发助手,能够帮助处理与 web 开发相关的各种问题,提供建议、解决方案和技术支持。

 

v0 可以根据需求执行以下几种任务:

 

1.生成用户界面(UI):如果用户请求 v0 生成某种类型的 UI(如表单、按钮、布局等),它可以编写相应的代码,并生成 UI 的代码片段

 

2.运行代码:v0 可以帮助执行或运行代码段,提供实时反馈,帮助调试或验证代码的功能

 

3.回答编程相关问题:用户可以向 v0 提出关于 web 开发、前端技术(如 TypeScript、React、Next.js 等)的任何问题,v0 会一步步解答,帮助解决技术问题(@小互 AI)

 

4、Meta 部署新网络爬虫机器人,为其 AI 模型收集大量数据

 

Meta 悄悄发布了一款新的网络爬虫,可用于搜索互联网并收集大量数据,为其人工智能模型提供支持。

 

据三家追踪网络抓取器的公司称,Meta 新网络爬虫机器人 Meta External Agent 于上月推出,类似于 OpenAI 的 GPTBot,可以抓取网络上的人工智能训练数据,例如新闻文章中的文本或在线讨论组中的对话。

 

根据使用档案历史记录显示,Meta 确实在 7 月底更新了一个面向开发者的公司网站,其中一个标签显示了新爬虫的存在,但 Meta 至今还没有公开宣布其新爬虫机器人。

 

Meta 的 Llama 是最大的 LLM 之一,虽然该公司没有透露最新版本的模型 Llama 3 使用的训练数据,但其初始版本的模型使用了由 Common Crawl 等其他来源收集的大型数据集。今年早些时候,Meta 的联合创始人、首席执行官马克・扎克伯格在一次财报电话会议上曾吹嘘说,公司的社交平台已经积累了一套用于人工智能训练的数据集,甚至「超过了 Common Crawl」。

 

新爬虫的存在表明 Meta 庞大的数据库可能已经不够用了,因为该公司继续致力于更新 Llama 和扩展 Meta AI,通常需要新的和高质量的培训数据来不断改进功能。

 

来自 Dark Visitors 的数据显示,全球近 25% 的最受欢迎的网站现在已屏蔽了 GPTBot,但只有 2% 的网站屏蔽了 Meta 的新爬虫机器人。(@IT 之家)

 

5、Salesforce 推出 xGen-MM 开源多模态 AI 模型

 

 

 

xGen-MM 是由 Salesforce AI Research 开发的一系列最新的基础大型多模态模型(LMMs)。该系列在 BLIP 系列的成功设计基础上进行了改进,确保了更强大和更优越的基础。这些模型在高质量的图像标注数据集和交错的图像-文本数据上进行了大规模训练,能够执行各种视觉语言任务,并在基准测试中取得了竞争性表现。(@机器之心 SOTA 模型)

02 有态度的观点

1、谷歌 DeepMind 首席执行官兼联合创始人:AGI 将有助于理解宇宙和意识的奥秘,十年内治愈所有疾病

 

在 Google DeepMind 的播客中,谷歌 DeepMind 首席执行官兼联合创始人 Demis Hassabis 指出,尽管现代人工智能系统没有正确的世界模型或真实经验,却在理解抽象概念和从语言学习方面表现出异常的有效性。

 

Hassabis 对公众对人工智能的快速接受感到惊讶,并强调了 AI 聊天机器人和语言模型的「异常有效性」。他提到了 AI 领域的长期规划、代理和保障措施的挑战,并预测了大多数疾病和通用人工智能的治疗方法将在未来十年内开发出来。

 

Hassabis 强调了 AI 安全性的重要性,包括对 AGI 的谨慎态度、国际合作、适应性监管、以及对 AI 产品的测试和错误发现。他还讨论了人工智能对现实、物理和意识的基本问题的潜在解答能力,以及 AGI 在理解宇宙量子层面奥秘方面的应用。最后,他表示对 AGI 在未来十年内得到发展持乐观态度。(@雷锋网)

 

写在最后:

 

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

 

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。

 

 

素材来源官方媒体/网络新闻

标签:ASR,Phi,端侧,模型,v0,AI,Meta,3.5
From: https://www.cnblogs.com/Agora/p/18374084

相关文章

  • delphi webbrowser屏蔽右键菜单 防止右键 防止ctrl N
    本文介绍了如何在Delphi中通过事件处理和消息过滤,阻止WebBrowser控件中的右键菜单以及防止用户使用Ctrl+N快捷键。通过`ProcessMsg`和`ApplicationEvents1Message`等方法实现对浏览器行为的控制。{关键字=webbrowser屏蔽右键菜单防止右键防止ctrlN采集软件=MKM-我的知识管理......
  • 从零到一,全面掌握Apache DolphinScheduler发版流程,实战派经验分享!
    引言ApacheDolphinScheduler的发版流程对于确保软件质量和社区协作至关重要,社区Committer王兴杰为我们详细介绍了ApacheDolphinScheduler的发版流程,包括环境准备、流程文档、基础工具准备、依赖包确认等关键步骤,并指出了发版流程中可能会遇到的麻烦以及相应的解决方案,欢迎学习......
  • 微软发布功能强大的全新 Phi-3.5 机型,击败谷歌、OpenAI 等公司
    微软并没有因为与OpenAI的合作而满足于其在人工智能领域的成功。相反,这家因总部位于华盛顿州而被称为雷德蒙德(Redmond)的公司今天发布了其不断发展的语言/多模态人工智能Phi系列中的3个新模型。这三个模型分别针对基本/快速推理、更强大的推理和视觉(图像和视频分析)任......
  • 使用sphinx自动提取python中的注释成为接口文档
    写好了代码,交付给他人使用的时候,查看代码固然可以了解各类和函数的功能细节,但接口文档能更方便的查找和说明功能。所以,一价与代码同步的接口文档是很有必要的。sphinx可以根据python中的注释,自动的生成接口文档,这样有利于保证文档和代码功能的同步。让我们来了解如何自动生......
  • 知识图谱——Gephi梳理学术脉络
    Gephi是一款开源的图形可视化和分析工具,它主要用于处理和可视化大型网络数据集。虽然Gephi主要用于图形分析,但它也可以作为一种有用的工具来辅助学术写作,尤其是在需要分析和展示研究领域内的网络关系时。下面我将详细介绍如何使用Gephi进行学术写作,并给出一个具体的例子。Geph......
  • delphi加密C#解密(AES-256)
    因为公司内部业务需要,用delphi加密的内容(流和字符串)要用C#解密,因为不懂delphi,我这里只是问同事要了代码,贴上delphi加密:共两个文件(AES.pas和ElAES.pas)AES.pas:(**************************************************************)(*......
  • Delphi 的 TMS 控件安装方法
    * 参考:tmsxdataaurliussparkle的手工安装(XE7)--------------------------------------------------------------------------------------------说明:下述安装方法的意思是:1)将所有包项目的编译结果放在 /Bin目录中,并将/Bin路径,放入系统变量Path的查找路径中。因编译......
  • Delphi下将自己写的Form加入到对象库
    1、设计好窗体,在窗体空白的地方点击右键,在弹出的菜单中选中“AddtoRespository”。在弹出的对话框中填写标题、描述、作者等信息,选择存放的页。完成后点“OK”保存。2、打开Tools->Repository,选中相应的页,可以修改已加入对象(窗体)的属性或删除已加入的对象。相关资料:对象库(Obje......
  • delphi多线程文件复制怎么实现
    在Delphi中,可以使用TThread类来实现多线程文件复制。以下是一个示例代码:unitUnit1;interfaceusesWinapi.Windows,Winapi.Messages,System.SysUtils,System.Variants,System.Classes,Vcl.Graphics,Vcl.Controls,Vcl.Forms,Vcl.Dialogs,Vcl.StdCtrls;type......
  • delphi 常用控件属性设置说明
    常用DELPHI控件属性设置说明目录TFormClass TPanel组件 TToolBarClass TToolButtonClass TTimerClass TADOConnectionClass TADOQueryClass TADODataSetClass TDBGridClass TADOStoredProcClass TButtonClass TBitBtnClass TComboBoxClass TStaticText......