云知声
  • 大模型
    通用
    Unisound U2 文本 通用大语言大模型 U2-ASR 语音 语音识别 U2-TTS 语音 语音合成 U2-TTS-Clone 语音 声音克隆 U2-TTS-Design 语音 音色设计 U1-OCR 视觉 智能文档解析与抽取
    医疗
    U2-Med 文本 医疗文本智能处理 U1-OCR-Med 视觉 医疗文书解析
  • Token Hub
    MaaS 平台 模型即服务,一站式调用大模型能力 智算平台 智算资源与模型服务统一调度 AI 1.0 开放平台 语音与 AI 基础能力开放接入
  • Agent Hub
    UniAgentOS 智能体操作系统
    Skill Hub 技能市场,扩展智能体能力边界
    产品
    U2 Agent 原生Agent大模型智能助手 U2Claw 聚合多领域AI专家的桌面AI Agent龙虾智能工具 兽牙智能体平台 零代码构建企业专属智能体 智慧营销平台 AI赋能销售全流程管理 智慧客服平台 让客服更高效、更智能
    行业Agent
    智慧医疗 Agent 医疗场景全流程智能化 智慧保险 Agent 保险业务智能处理 智慧医保 Agent 医保风控与智能审核 智慧座舱 Agent 车载智能交互 数字员工 Agent 全流程自动化的数字化员工 数字助理 Agent 你的 AI 工作搭子
  • 端侧智能
    芯片应用开发平台 端侧芯片方案一站式开发
    智能硬件
    智聆降噪麦克风阵列 远场拾音与智能降噪 多模态智慧客服屏 多模态交互的智能服务终端 兽牙语记 随身录音转写与智能纪要 兽牙端侧AI-HUB 端侧算力中枢,本地化 AI 部署
  • 研究与学习
    论文博客 前沿技术研究与实践分享
    云知学院
    政企AI人才培训 助力企业全员 AI 认知与能力提升 院校AI教育合作 共建高校 AI 人才培养体系 中小学AI素养培养 从基础到进阶的 AI 素养课程
  • 关于我们
    公司介绍 了解云知声的历史与愿景 新闻动态 公司最新动态与媒体报道 加入我们 与优秀的人一起做有挑战的事 投资者关系 公告、财报与投资者信息
付费 2025年6月

面向跨领域虚假信息检测的自动化决策规则优化多智能体框架

技术发布 2026年8月

当 OCR 学会"重建":云知声 U1-OCR 将图片、PDF 一键还原为可编辑 PPT,开启文档智能的重建时代

近日,云知声文档智能基础大模型 U1-OCR 能力全新升级,正式上线 IMG2PPT 智能转换功能。IMG2PPT 基于 U1-OCR 文档智能引擎打造,可将 JPG、PNG、PDF 等静态文件中的内容还原为原生可编辑 PPT,让文本框、图片、列表、形状、表格等全部成为 PPT 原生可编辑对象。这标志着 OCR 技术正式从 "单一内容识别",进阶至 "智能理解 + 结构重建" 的全新阶段。

技术发布 2026年8月

云知声U2-RadiMed正式发布,引领医学影像AI迈入“临床推理”时代

作为国内首个深度融合医学影像理解、报告生成、临床推理决策、视觉问答的全链路影像大模型,该模型支持单张、多张影像与文本的多模态混合输入,可完成“看影像→调知识→做推理→出结论”的完整工作闭环,为临床医生提供从病灶筛查、精准诊断到个体化治疗决策的全方位AI辅助支撑,助力影像诊断迈向更高阶的智能化。

技术发布 2026年7月

云知声U2-ASR、U2-TTS多语种能力全面升级,一套模型打通全球"听与说"

云知声近日全面完成 U2-ASR 与 U2-TTS 的多语种能力升级:ASR 新增 13 种国际语言识别,TTS 新增 8 种东南亚语言合成。至此,U2 语音大模型已支持超 100 种中国方言及超 15 种国际语言。

技术发布 2026年7月

云知声发布U2-Med专家级三医大模型:以【智能向善】重塑产业,让AI成为扎根一线的“数字专家”

以“智能向善”为初心,U2-Med致力于将AI从“对话工具”升级为扎根业务一线的“数字专家”。通过打破三医数据与业务的孤岛,重构产业生态,U2-Med不仅是在攀登技术的高峰,更是在仰望人类健康的星辰大海——以AI的力量推动医疗服务向更高效、更公平、更智能的方向演进,让科技的温度真正造福全人类的健康福祉。

学术论文 2026年7月

VAPO:利用全模态大语言模型实现端到端幻灯片增强语音识别

全模态大语言模型为幻灯片增强语音识别提供了端到端解决方案,但容易受到“视觉干扰”,即过度依赖幻灯片文字而忽视语音信号,导致错误转写。为此,本文提出视觉锚定策略优化(VAPO),通过“先看后听”的推理机制,以视觉信息作为语义锚点辅助转写,并结合多目标强化学习进行优化。同时构建 SlideASR-Bench 基准。实验表明,VAPO 可有效减少视觉干扰,并显著降低专业领域中的实体识别错误。

学术论文 2026年7月

HEALing 熵坍缩:基于混合领域熵动态对齐的少样本 RLVR 探索增强方法

可验证奖励强化学习(RLVR)已被证明能够有效提升大语言模型的推理能力,但现有方法大多依赖充足的训练数据。在低资源场景下,RLVR 更容易出现严重的“熵坍缩”,从而限制模型探索能力并影响推理性能。 为此,本文提出面向少样本 RLVR 的 HEAL(混合领域熵动态对齐) 框架。HEAL 首先引入高价值的通用领域数据,以增强模型探索的多样性;随后提出 熵动态对齐(EDA) 机制,通过对齐目标领域与通用领域的轨迹级熵动态,进一步缓解熵坍缩,并帮助模型学习更丰富的探索策略。 多领域实验表明,HEAL 能够持续提升少样本 RLVR 的性能。尤其是在仅使用 32 个目标领域样本的情况下,其效果即可达到甚至超过使用 1000 个目标领域样本训练的全量 RLVR。

学术论文 2026年7月

GuideTree:面向长篇医疗记录的指南引导式审阅树

阅读顺序检测是文档理解的基础。现有方法大多采用统一监督,默认不同版面区域的学习难度基本一致。本文指出这一假设存在明显缺陷,并发现一种“位置差异(Positional Disparity)”现象:模型在相对确定的起始和结束区域表现良好,但在结构复杂的中间区域性能明显下降。这是因为大量简单样本会淹没复杂版面中的有效学习信号。 为解决这一问题,本文提出基于**焦点偏好优化(Focal Preference Optimization,FPO)**的 FocalOrder 框架。该方法利用指数移动平均机制动态识别难学习的阅读顺序转换,并通过难度校准的成对排序目标增强全局逻辑一致性。 大量实验表明,FocalOrder 在 OmniDocBench v1.0 和 Comp-HRDoc 上取得了新的 SOTA 性能。其轻量级模型不仅优于多种专用基线,还显著超过大规模通用视觉语言模型,证明针对文档自身结构歧义进行优化,是准确理解复杂文档结构的关键。

学术论文 2026年7月

FocalOrder:面向阅读顺序检测的焦点偏好优化方法

阅读顺序检测是文档理解的基础。现有方法大多采用统一监督,默认不同版面区域的学习难度基本一致。本文指出这一假设存在明显缺陷,并发现一种“位置差异(Positional Disparity)”现象:模型在相对确定的起始和结束区域表现良好,但在结构复杂的中间区域性能明显下降。这是因为大量简单样本会淹没复杂版面中的有效学习信号。 为解决这一问题,本文提出基于焦点偏好优化(Focal Preference Optimization,FPO)的 FocalOrder 框架。该方法利用指数移动平均机制动态识别难学习的阅读顺序转换,并通过难度校准的成对排序目标增强全局逻辑一致性。 大量实验表明,FocalOrder 在 OmniDocBench v1.0 和 Comp-HRDoc 上取得了新的 SOTA 性能。其轻量级模型不仅优于多种专用基线,还显著超过大规模通用视觉语言模型,证明针对文档自身结构歧义进行优化,是准确理解复杂文档结构的关键。

云知声

让智能成为推动人类进步的新力量

公众号 公众号二维码 公众号 微博号 微博号二维码 微博号 推特
商务合作:bd@unisound.com
市场公关:marketing@unisound.com
投资者关系:ir@unisound.com
联系电话:010-82902873
总部地址:海淀区建材城中路 27 号金隅智造工场 N6 号楼一层 101-124
  • Unisound U2
  • U2-ASR
  • U2-TTS
  • U2-TTS-Clone
  • U2-TTS-Design
  • U1-OCR
  • U2 Agent
  • U2Claw
  • 兽牙智能体平台
  • 智慧营销平台
  • 智慧客服平台
  • 智慧医疗 Agent
  • 智慧保险 Agent
  • 智慧医保 Agent
  • 智慧座舱 Agent
  • 数字员工 Agent
  • 数字助理 Agent
  • 公司介绍
  • 新闻动态
  • 加入我们
  • 投资者关系
© 2025 云知声智能科技股份有限公司 版权所有 | 港交所上市 (09678.HK)
公安备案 京公网安备11010802013422号 | 京ICP备12032250号 | 网信算备110108172572101230023号

联系我们

填写信息,我们将尽快与您联系

提交成功!

我们将在1个工作日内联系您,请保持手机畅通。