易捷多源数据处理平台
易捷多源数据处理平台 产品手册
1 产品概述
1.1 产品简介
易捷多源数据处理平台是一款面向音频、图片、扫描文档等非结构化数据的智能化处理系统,集成音频预处理、智能声源分离、多语种语音ASR转写、高精度OCR图文识别、大模型多语种翻译、文本智能解析、内容规整归纳等全链条AI能力。系统实现素材上传、标准化预处理、智能任务调度、自动化处理、人工精准复核、结果统一管理、批量数据导出的全闭环业务流程。
1.2 核心技术架构栈
后端技术体系:基于SpringBoot微服务架构开发,搭载MySQL关系型数据库、RabbitMQ异步消息队列、MinIO分布式对象存储、FFmpeg音视频标准化处理组件,配套完善的AI模型接口封装、任务调度、权限管控、日志审计、文件运维能力,服务稳定可扩展、高并发不阻塞。
前端技术体系:基于Vue框架开发,集成Wavesurfer专业音频可视化组件,实现音频波形渲染、精准进度控制、倍速播放、片段定位等可视化能力,页面交互简洁、响应快速、适配主流浏览器。
算法技术体系:平台支持多类别、多版本AI模型自由选型与切换,涵盖语音识别、音频处理、图文识别、通用大模型四大类,所有模型支持GGUF量化离线部署。支持大模型有:语音识别 ASR 模型:WhisperLargev3,WhisperMedium,SenseVoice,FunASRparaformerlarge。音频处理模型:Demucs,SilerVAD,pyannotevad。OCR 图文识别模型:PaddleOCRV4,PaddleOCRV4slightly,QwenVL2B。文本大模型:Qwen2.5-32B、Qwen2.514BInstruct,DeepSeekV2Lite,Yi1.534BChat,Llama38BInstruct。
1.3 部署与算力适配能力
算力适配:支持纯CPU离线部署、GPU加速部署两种模式,可根据业务并发量、数据处理量级灵活选配硬件资源,适配小规模单机部署、大规模集群并发部署场景,保障多AI任务并行推理稳定不卡顿。
网络部署:纯内网隔离部署模式,依托内网防火墙访问控制策略实现内网访问权限管控,杜绝外网数据交互;公网拓展部署模式可配套业务域名、公网可信SSL证书、网络流量资源,实现标准化公网合规访问。
存储架构:业务元数据、任务状态、用户权限、操作日志结构化数据存储于MySQL数据库;原始音频、图片、扫描件等非结构化文件存储于MinIO对象存储;RabbitMQ消息队列承担全量AI任务、文件处理任务的异步调度,实现大批量任务削峰填谷,保障任务不丢失、不重复、有序执行。
2 系统总体架构
平台采用分层架构设计,五层架构分工明确、独立迭代、互不干扰,具备极强的稳定性、扩展性和运维便捷性。
1.接入层:基于Web浏览器统一接入,支持管理员账号登录、身份校验、系统消息通知、权限校验、安全退出等基础接入能力,无需安装客户端,跨设备可访问。
2.业务应用层:平台核心业务操作层,包含素材管理、听音工作台、转写库管理、图文解译、AI模型管理、系统管理六大核心功能模块,覆盖全部非结构化数据处理业务场景,为用户提供可视化、可操作、可管控的全流程业务能力。
3.服务能力层:封装平台通用核心技术能力,包含文件上传校验、音视频标准化预处理、声源智能分离、多模型语音转写、高精度OCR图文识别、大模型多语种翻译与文本解析、异步任务调度、批量数据导出、操作权限校验、日志记录等基础服务,为上层业务模块提供统一技术支撑。
4.AI推理层:离线本地化部署多套备选AI模型,涵盖语音、音频、图文、大模型四大品类,支持模型启停、切换、参数配置、负载监控、接口自测,可根据业务场景、硬件配置自由适配最优模型组合。
5.基础设施层:包含MySQL数据库、RabbitMQ消息队列、MinIO对象存储、服务器硬件算力、内网网络安全设施,为平台整体运行提供底层硬件、存储、网络、调度基础支撑。
3 全品类AI模型选型体系(多模型自由切换)
平台不绑定单一算法模型,针对每一类业务场景均提供多款开源主流、离线可用的AI模型,支持用户在后台自主选型、切换启用、参数调试,适配不同精度、速度、硬件资源的业务需求,所有模型均支持4-bit/8-bit量化,适配内网CPU离线部署。
3.1 语音ASR转写模型(音频文字识别)
Whisper-Large-v3:支持99%以上主流语种识别,长音频、多口音、低清晰度音频适配性强,识别精度最高,适用于高标准、高精度、多语种核心业务场景,为平台默认高精度模型。
Whisper-Medium:轻量化平衡模型,中文识别精度优异,推理速度更快、硬件资源消耗更低,适用于大批量中文音频批量转写场景,兼顾效率与精度。
SenseVoice:国产开源语音模型,强噪声抗干扰能力突出,针对现场录音、嘈杂环境录音、带背景音音频优化效果显著,适配复杂环境采集的音频素材处理。
FunASR-paraformer-large:阿里开源高精度中文语音模型,推理速度快、断点续识能力强,针对长时长中文音频、会议录音、访谈录音适配性极佳,硬件门槛低、并发能力强。
3.2 音频智能处理模型
Demucs声源分离模型:精准实现人声与背景音乐、环境噪音分离,可单独提取纯净人声轨道,剔除杂音、伴奏干扰,有效提升后续语音转写的识别准确率,适配带配乐、带环境音的音频素材预处理。
Siler-VAD语音端点检测模型:轻量高效,精准识别音频中有效语音片段,自动过滤静音段、空白段、无效杂音片段,实现音频智能切片预处理,减少无效推理任务,提升整体处理效率。
pyannote-vad高精度检测模型:支持长音频多说话人片段分割,精准区分不同说话人语音区间,适配多人对话、访谈、会议录音的精细化预处理场景。
3.3 OCR图文识别模型
PaddleOCR-V4标准版:国产主流开源OCR模型,扫描件、截图、常规图文素材,中英文识别精准,支持图片倾斜校正、模糊修复、排版还原,为平台默认图文识别模型。
PaddleOCR-V4轻量版:极致轻量化模型,推理速度大幅提升,资源占用极低,适用于大批量、标准化清晰图片的快速批量识别场景。
Qwen-VL-2B多模态OCR模型:大模型图文识别能力,突破传统OCR局限,支持复杂排版、手写字体、模糊素材、小语种图文识别,可自动规整排版、纠错补全,适配非标准化、复杂图文素材处理。
3.4 文本大模型(翻译、解析、摘要、规整)
Qwen2.5-32B-Instruct(主力模型):325亿参数量,支持29+主流语种互译,具备长文本解析、错别字纠错、文本规整、内容摘要、语义归纳能力,128K超长上下文窗口,适配长音频转写文本、长篇文档解析,综合性能最优。
Qwen2.5-14B-Instruct:140亿参数量,轻量化高性能模型,资源消耗低、并发能力强,基础翻译、文本规整、摘要能力均衡,适配硬件资源有限、大批量常规文本处理场景。
deepseek-ai/DeepSeek-V4-Flash:迈向百万上下文智能AI。
Yi-1.5-34B-Chat:多语种翻译专项优化,小语种、冷门语种翻译精度更高,适配外文音频、外文文档的精细化翻译解析场景。
Llama-3-8B-Instruct:超轻量模型,硬件门槛极低,响应速度快,适配简单文本清洗、基础摘要、常规文本纠错等轻量化业务场景。
4 系统核心功能模块(极致细化版)
4.1 素材管理模块
负责所有音频素材的上传、校验、预处理、存储、集中管控,分为音频上传、素材库两大子功能,覆盖素材全生命周期管理。

4.1.1 音频上传功能
1. 多格式兼容上传:全面支持WAV、MP3、M4A、FLAC等主流音频格式,兼容日常采集、设备录制、网络导出的各类音频文件。
2. 单/批量上传模式:支持单文件精准上传、多文件批量多选上传,适配少量精准素材、大批量素材入库两种业务场景。
3. 全维度文件校验:上传自动校验文件格式合法性、文件大小阈值、文件完整性,自动拦截损坏文件、空文件、非法格式文件,避免无效任务占用算力资源。
4. 智能化预处理:依托FFmpeg组件自动完成音频标准化处理,统一采样率、声道格式、编码格式,修复部分音频格式异常问题,为后续AI识别、声源分离提供标准化素材,保障处理精度统一。
5. 异步无阻塞上传:大体积、长时长音频文件采用异步上传机制,后台静默传输处理,前端可正常操作其他功能,不卡顿、不闪退、不阻塞系统操作。
6. 安全存储归档:原始音频文件加密存储至MinIO对象存储,永久留存可追溯;MySQL同步记录素材名称、文件大小、音频时长、上传时间、原始语种、存储路径、业务备注等全维度元数据。
7. 实时进度可视化:上传过程实时展示等待、上传中、预处理中、上传成功、上传失败五种状态,精准展示上传进度百分比,失败自动提示故障原因,支持一键重新上传。
8. 自定义标签备注:上传阶段可手动录入业务备注、素材来源、采集场景、关联业务编号等自定义信息,实现素材精细化分类管理。
4.1.2 素材库管理功能
1. 多维度精准筛选:支持语种筛选、文件格式筛选、任务状态筛选、时间区间筛选四大筛选维度,可自由组合筛选条件,快速定位目标素材。
2. 全字段列表展示:列表可视化展示素材名称、语种类型、文件格式、音频时长、文件大小、上传时间、处理状态、业务备注、关联任务编号等完整信息。
3. 在线音频预览播放:无需下载,直接在线播放原始音频,支持进度拖拽、暂停、继续播放,快速核验素材有效性。
4. 自定义模型任务发起:单条/批量选中素材后,可自主选择本次处理所需的语音转写模型、声源分离模型,灵活适配不同精度、速度需求。
5. 原始文件下载:支持随时下载归档的原始音频文件,用于本地备份、二次核验、线下归档。
6. 素材信息编辑:支持随时修改素材业务备注、标签信息,更新素材业务属性。
7. 单/批量删除管理:支持单条无效素材删除、批量清理过期素材,删除后同步清空MinIO存储文件及数据库记录,无冗余残留。
8. 智能分页适配:支持自定义每页展示条数,大数据量素材库流畅加载,无卡顿、无数据丢失。
9. 任务自动联动:素材发起AI任务后,自动同步至转写库管理模块,实现素材与任务数据无缝联动。
4.2 听音工作台模块
1. 专业音频波形可视化:集成Wavesurfer可视化组件,精准渲染音频波形图谱,直观区分静音段、人声段、杂音段,辅助人工快速定位重点校对区域。
2. 全维度播放控制:支持播放、暂停、停止、进度拖拽精准定位、倍速播放(0.5-2倍速),适配慢速细核、快速通读不同校对场景。
3. 音文时间轴对齐:转写文本与音频时间轴精准绑定,点击文本自动跳转对应音频片段,播放音频自动定位对应文本段落,实现听音、改字同步联动。
4. 全量人工校对编辑:支持在线全文编辑、局部修改、错别字修正、断句优化、人名地名精准校正、语义补全,完全修正AI识别误差。
5. 重点片段标记备注:支持标记音频重点片段、异常片段、杂音片段,添加自定义备注,便于后续溯源核查。
6. 复核结果实时保存:校对完成后一键保存修正结果,自动覆盖原有AI初处理文本,同步更新至转写库,数据实时同步不丢失。
7. 单条结果快速导出:支持单独导出当前校对完成的精准文本结果,快速落地业务使用。
8. 任务状态筛选:可筛选待复核、已复核、异常待处理任务,精准区分工作台任务状态,提升校对效率。

4.3 转写库管理模块
本模块集中管控平台所有语音转写任务,实现任务全生命周期可视化管理,涵盖任务调度、状态监控、结果查看、重试修复、批量导出全能力。
1. 任务自动接入:自动接收素材库发起的转写请求,通过RabbitMQ队列有序调度,根据选中模型执行对应AI转写推理。
2. 全字段任务展示:列表展示任务编号、关联素材名称、音频时长、识别语种、提交时间、处理状态、所用AI模型、处理耗时、转写文本、任务日志等完整信息。
3. 多条件精准检索:支持按时间区间、语种类型、任务状态、所用模型筛选任务,快速定位目标任务。
4. 任务详情全景查看:支持查看任务完整推理日志、原始音频、时间戳分片文本、AI识别原始结果、人工修正结果,全流程可追溯。
5. 失败任务一键重试:针对处理超时、推理异常、模型故障等失败任务,支持一键重试,可更换适配模型重新推理,解决任务异常问题。
6. 一键跳转复核:支持从转写库直接跳转听音工作台,快速开展人工校对工作,流程无缝衔接。
7. 多格式批量导出:支持单条、批量导出转写结果,兼容TXT、Excel两种格式,导出文件排版规整、时间信息完整,可直接用于业务归档。
8. 无效任务清理:支持手动删除无效、过期、废弃任务记录,保持任务库整洁有序。
9. 智能状态联动:AI推理完成、人工校对完成后自动更新任务状态,失败任务自动记录故障日志,便于运维排查问题。

4.4 图文解译模块
本模块针对图片、扫描文档、截图、纸质材料翻拍图等静态非结构化数据,实现OCR文字识别、大模型智能翻译、文本规整、内容解析全流程自动化处理。
1. 多格式图片上传:支持JPG、PNG、BMP等主流图片格式上传,适配扫描文档、屏幕截图、纸质拍照素材、外文图文素材。
2. 自定义OCR模型选型:用户可根据图片质量、排版复杂度,自主选择标准版、轻量版、多模态OCR模型,适配不同识别场景。
3. 高精度文字提取:自动完成图片倾斜校正、模糊修复、排版还原,精准提取图片内印刷体、常规手写体文字,输出原始识别文本。
4. 大模型智能解析翻译:将OCR原始文本送入自选大模型,实现多语种互译、文本纠错、杂乱内容规整、长篇内容摘要、关键信息提取。
5. 异步任务处理:图文识别、翻译解析任务异步排队执行,大批量图片上传不阻塞系统操作,后台有序推理处理。
6. 多维度结果展示:页面同步展示原始图片、OCR原始识别文本、大模型优化后文本、翻译结果、本次任务所用模型信息,结果对比清晰直观。
7. 人工二次校正:支持在线编辑修改识别错误、翻译偏差内容,人工优化结果精度,保障输出内容合规可用。
8. 结果批量导出:支持导出OCR原始文本、优化后规整文本、多语种翻译结果,满足归档、上报、整理需求。
9. 图文任务全量管理:支持按时间、状态、所用模型筛选图文任务,失败任务支持一键重试,可清理无效任务记录。
4.5 AI模型管理模块
本模块为平台AI能力运维核心,统一管控所有离线部署的AI推理服务,实现模型可视化、可管控、可切换、可监控,无需手动修改代码即可完成模型适配。
1. 全模型清单可视化:集中展示所有已部署的语音、音频、OCR、大模型,清晰展示模型名称、版本、参数量、量化规格、文件大小、当前运行状态、资源占用情况。
2. 模型接口自测功能:内置接口测试工具,一键验证模型推理接口连通性、可用性,快速排查模型故障。
3. 默认模型自定义设置:支持为转写、分离、OCR、翻译各类业务设置默认模型,实现常规任务自动适配最优模型,特殊任务可手动切换。
4. 量化版本适配管理:支持4-bit、8-bit量化模型自由切换,根据服务器硬件资源高低,灵活适配高性能/高性价比模型方案。

4.6 系统管理模块
本模块为平台基础运维保障模块,承担账号管控、权限隔离、日志审计、系统参数配置、消息通知等核心运维能力,保障系统安全、稳定、合规运行。
1. 账号用户管理:支持新增、编辑、启用、禁用系统管理员账号,自定义账号名称、登录密码,规范账号准入机制。

2. 角色权限分级管控:支持自定义角色、分配菜单权限、功能操作权限,实现不同岗位账号权限隔离,精准控制可操作模块与功能,防止越权操作。

3. 全量操作审计日志:自动记录所有核心操作,包含账号登录、文件上传、AI任务发起、模型切换、数据修改、数据删除、参数配置等行为,留存操作人、操作时间、操作内容、IP信息,全程可追溯、可审计。

4. 系统全局参数配置。

5 系统非功能特性
5.1 安全特性
1 网络安全管控:内网依托防火墙访问控制策略,实现访问权限管控、非法访问拦截;公网拓展部署支持可信SSL加密传输,保障数据传输安全。
2. 权限分级隔离:账号角色权限分层管控,越权操作拦截,核心功能专人管控,避免误操作、违规操作。
3. 全流程审计追溯:所有关键操作留痕存档,日志不可篡改,满足合规审计、溯源核查要求。
4. 存储安全防护:MinIO对象存储具备权限管控、文件防篡改、冗余备份能力,保障素材文件安全存储。
5.2 性能特性
1. 异步队列削峰抗压:基于RabbitMQ实现任务异步调度,大批量任务自动排队处理,避免瞬时高并发压垮系统,保障服务稳定。
2. 量化模型高效推理:全量AI模型支持GGUF量化部署,适配纯CPU环境,低资源消耗、高推理效率,可根据硬件灵活调配模型精度与速度。
3. 数据库优化提速:MySQL数据表建立合理索引,分页查询、条件查询高效响应,大数据量下页面加载流畅无延迟。
4. 多任务并发适配:支持多模型同时运行、多任务并行处理,音频、图文任务互不干扰,大幅提升整体处理吞吐量。
5.3 兼容特性
1. 全浏览器兼容:适配Edge等主流浏览器,无需安装客户端,跨电脑、跨设备均可访问。
2. 全格式素材兼容:适配主流音频、图片格式,兼容各类设备采集的原始素材,无需提前手动转码。
3. 内网系统兼容:完美适配Windows服务器内网隔离部署环境,无外网依赖、无系统适配壁垒。
6 标准完整业务流程
1. 管理员登录系统,进入素材管理模块完成音频素材上传、系统自动预处理并归档至素材库;
2. 在素材库选中目标素材,根据业务精度需求自主选择AI模型,发起语音转写、声源分离处理任务;
3. 系统通过异步队列自动调度任务,调用对应AI模型完成智能化处理,任务状态实时更新;
4. 处理完成后任务自动归档至转写库管理模块,用户可查看原始AI处理结果;
5. 跳转听音工作台,结合音频波形与原声,人工校对修正转写文本,输出精准结果并保存;
6. 针对图片、扫描文档素材,进入图文解译模块上传素材,选配OCR与大模型,完成识别、翻译、解析处理并人工校正;
7. 所有处理完成的文本、图文结果,支持单条/批量导出归档;
8. 运维人员通过AI模型管理模块实时监控模型运行状态,按需启停、切换、调试模型;
9. 管理员通过系统管理模块完成账号权限、日志审计、系统参数的日常运维管控。

