Data-Juicer零基础实战指南从AI数据混乱到智能果汁的魔法榨取【免费下载链接】data-juicerData processing for and with foundation models! ➡️ ➡️ 项目地址: https://gitcode.com/gh_mirrors/da/data-juicer还在为海量AI数据处理头疼吗面对杂乱无章的文本、图片、视频数据你是不是感觉像面对一堆未经处理的水果不知道如何榨出美味的AI果汁今天让我带你快速上手Data-Juicer——这个能把原始数据榨成AI-ready智能果汁的神奇工具 Data-Juicer是什么为什么你需要它想象一下你有一大堆水果数据有些新鲜多汁高质量数据有些已经腐烂噪声数据还有些混着果皮和种子格式不统一。Data-Juicer就像一台智能榨汁机帮你自动清洗、去皮、榨汁、过滤最终产出纯净美味的AI训练数据。核心价值Data-Juicer是一个模块化、可扩展的数据处理操作系统专门为AI时代设计。它提供了200个数据处理算子OPs覆盖文本、图像、音频、视频等全模态数据让你能够像搭积木一样构建数据处理流水线。适用场景大模型预训练数据清洗去重、过滤、质量评估智能体交互数据整理对话清洗、工具痕迹处理RAG知识库构建语义分块、实体提取、归一化多模态数据处理图像标注、视频分析、音频转写 三分钟极速体验你的第一个数据处理流水线步骤1一键安装真的只要一分钟# 使用uv安装推荐速度更快 uv pip install py-data-juicer # 或者用传统pip pip install py-data-juicer小贴士如果你只需要基础功能这个最小安装包就足够了。但如果你想要更多榨汁能力可以按需添加安装选项功能描述适用场景py-data-juicer[generic]基础ML/DL能力通用数据处理py-data-juicer[nlp]自然语言处理文本清洗、分词py-data-juicer[vision]计算机视觉图像视频处理py-data-juicer[all]全功能套餐土豪玩家首选步骤2创建你的第一个榨汁配方Data-Juicer使用YAML配置文件来定义数据处理流程我们称之为配方。创建一个简单的my_first_juice.yaml# 我的第一个数据处理配方 project_name: hello-juicer dataset_path: ./my_data.jsonl np: 4 # 使用4个进程并行处理 export_path: ./output/cleaned_data.jsonl process: # 第一步过滤中文内容 - language_id_score_filter: lang: zh min_score: 0.8 # 第二步清理HTML标签 - clean_html_mapper: {} # 第三步去除过长文本 - text_length_filter: min_len: 10 max_len: 1000比喻理解这个配方就像告诉榨汁机先挑出新鲜的中文水果然后去掉果皮HTML标签最后过滤掉太大或太小的果肉。步骤3启动榨汁机# 运行你的配方 dj-process --config my_first_juice.yaml看到控制台输出的处理进度了吗恭喜你的第一个AI数据果汁正在制作中 可视化你的数据处理成果处理完成后Data-Juicer会自动生成处理报告。但如果你想更直观地看到数据质量的变化可以试试内置的可视化工具from data_juicer.core.analyzer import Analyzer from data_juicer.core.data import NestedDataset # 加载处理前后的数据 original_ds NestedDataset.from_jsonl(./my_data.jsonl) processed_ds NestedDataset.from_jsonl(./output/cleaned_data.jsonl) # 对比分析 analyzer Analyzer() stats_before analyzer.analyze(original_ds) stats_after analyzer.analyze(processed_ds) print(f原始数据条数: {stats_before[num_examples]}) print(f处理后数据条数: {stats_after[num_examples]}) print(f过滤比例: {1 - stats_after[num_examples]/stats_before[num_examples]:.1%})不同数据处理方法在多个评估指标上的表现对比 深度配置打造个性化数据工厂场景1文本数据精炼流水线假设你要处理爬取的网页数据里面混着各种语言和格式project_name: web-content-refiner dataset_path: ./crawled_webpages.jsonl np: 8 # 8核并发速度更快 process: # 1. 语言识别与分流 - language_id_score_filter: lang: [en, zh] min_score: 0.7 # 2. 深度清洗 - clean_html_mapper: {} - clean_links_mapper: {} - remove_comments_mapper: {} # 3. 质量过滤 - text_length_filter: min_len: 50 max_len: 5000 # 4. 去重处理 - document_deduplicator: method: simhash threshold: 0.9 # 5. 格式标准化 - whitespace_normalization_mapper: {} - punctuation_normalization_mapper: {}性能提示这个流水线可以处理TB级别的网页数据Data-Juicer会自动优化算子融合提升2-10倍处理速度场景2多模态数据处理Data-Juicer不仅擅长文本还能处理图像和视频project_name: multimodal-cleaner dataset_path: ./mixed_media_dataset.jsonl process: # 图像处理分支 - image_size_filter: min_pixels: 10000 max_pixels: 10000000 - image_aesthetics_filter: min_score: 4.0 - image_nsfw_filter: max_score: 0.3 # 视频处理分支 - video_duration_filter: min_duration: 1.0 max_duration: 300.0 - video_resolution_filter: min_height: 240 min_width: 320 # 跨模态关联 - image_text_matching_filter: min_score: 0.6 常见问题与排错指南问题1安装依赖冲突怎么办症状pip install时出现版本冲突错误解决方案# 使用uv避免环境污染 uv venv my-juicer-env source my-juicer-env/bin/activate # Linux/Mac # 或 my-juicer-env\Scripts\activate # Windows # 按需安装避免一次性装太多 uv pip install py-data-juicer uv pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118问题2处理速度太慢优化策略增加并行度调整np参数根据CPU核心数设置启用Ray分布式# 安装分布式支持 uv pip install py-data-juicer[distributed] # 启动Ray集群 ray start --head --port6379 # 在配置中指定Ray use_ray: true ray_address: auto使用OP融合Data-Juicer会自动合并连续算子减少IO开销问题3内存不足内存优化技巧# 在配置文件中调整 global_settings: chunk_size: 1000 # 减小批次大小 use_disk_cache: true # 启用磁盘缓存 checkpoint_path: ./checkpoints # 设置检查点 创意应用用Data-Juicer打造AI数据艺术品应用1智能对话数据清洗对话质量评估指标随训练步数的变化趋势# 对话数据质量提升配方 process: - dialog_clarification_quality_mapper: model_name: gpt-3.5-turbo - dialog_coreference_mapper: {} - dialog_non_repetition_mapper: max_repetition_ratio: 0.3 - dialog_sentiment_detection_mapper: {} - llm_quality_score_filter: min_score: 0.7 model_name: gpt-4应用2学术论文数据提取from data_juicer.ops.mapper import LatexFigureContextExtractorMapper from data_juicer.ops.filter import TextEntityDependencyFilter # 从LaTeX论文中提取图表上下文 pipeline [ LatexFigureContextExtractorMapper(), TextEntityDependencyFilter(min_dependency_score0.5), # ... 更多学术专用算子 ] 性能对比为什么选择Data-Juicer特性Data-Juicer传统方法优势处理速度5TB数据去重仅需2.8小时数天甚至数周10-100倍加速扩展性支持千节点集群单机或小集群线性扩展算子数量200内置算子需要自己实现开箱即用可视化内置分析工具需要额外开发一站式解决方案社区生态活跃开源社区闭源或小众持续更新维护 下一步学习建议学习路径推荐新手阶段1-2天完成本指南的所有示例尝试修改demos/process_simple/process.yaml运行几个内置demodemos/目录下的示例进阶阶段3-7天学习YAML配方语法查看config/config_all.yaml探索更多算子浏览ops/目录尝试分布式处理学习Ray集成专家阶段1-2周开发自定义算子优化大规模流水线贡献代码到开源社区实用资源导航配方模板demos/目录包含各种场景的配置文件算子文档docs/operators/有详细的使用说明测试用例tests/目录提供了丰富的示例代码工具脚本tools/目录包含实用工具加入社区Data-Juicer有一个活跃的开源社区你可以在那里 查看最新文档 报告问题和bug 提出功能建议 与其他开发者交流经验 总结从数据混乱到AI智能的捷径Data-Juicer就像给你的AI项目配上了一台智能榨汁机简单易用YAML配方无需编码经验⚡极速处理分布式加速TB级数据轻松应对模块化设计200算子按需组合全面可视化从处理过程到结果分析一目了然高度可扩展支持自定义算子满足特殊需求记住好的AI模型从好的数据开始。与其在杂乱的数据海洋中挣扎不如让Data-Juicer帮你榨出最纯净的AI智能果汁最后的小贴士开始你的第一个项目时可以从最小的配置开始逐步添加更多算子。就像学做果汁一样先学会榨橙汁再尝试复杂的混合果汁配方。祝你在AI数据处理的道路上越走越顺Data-Juicer将原始数据转化为AI-ready智能果汁的魔法工具【免费下载链接】data-juicerData processing for and with foundation models! ➡️ ➡️ 项目地址: https://gitcode.com/gh_mirrors/da/data-juicer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
Data-Juicer零基础实战指南:从AI数据混乱到智能果汁的魔法榨取
Data-Juicer零基础实战指南从AI数据混乱到智能果汁的魔法榨取【免费下载链接】data-juicerData processing for and with foundation models! ➡️ ➡️ 项目地址: https://gitcode.com/gh_mirrors/da/data-juicer还在为海量AI数据处理头疼吗面对杂乱无章的文本、图片、视频数据你是不是感觉像面对一堆未经处理的水果不知道如何榨出美味的AI果汁今天让我带你快速上手Data-Juicer——这个能把原始数据榨成AI-ready智能果汁的神奇工具 Data-Juicer是什么为什么你需要它想象一下你有一大堆水果数据有些新鲜多汁高质量数据有些已经腐烂噪声数据还有些混着果皮和种子格式不统一。Data-Juicer就像一台智能榨汁机帮你自动清洗、去皮、榨汁、过滤最终产出纯净美味的AI训练数据。核心价值Data-Juicer是一个模块化、可扩展的数据处理操作系统专门为AI时代设计。它提供了200个数据处理算子OPs覆盖文本、图像、音频、视频等全模态数据让你能够像搭积木一样构建数据处理流水线。适用场景大模型预训练数据清洗去重、过滤、质量评估智能体交互数据整理对话清洗、工具痕迹处理RAG知识库构建语义分块、实体提取、归一化多模态数据处理图像标注、视频分析、音频转写 三分钟极速体验你的第一个数据处理流水线步骤1一键安装真的只要一分钟# 使用uv安装推荐速度更快 uv pip install py-data-juicer # 或者用传统pip pip install py-data-juicer小贴士如果你只需要基础功能这个最小安装包就足够了。但如果你想要更多榨汁能力可以按需添加安装选项功能描述适用场景py-data-juicer[generic]基础ML/DL能力通用数据处理py-data-juicer[nlp]自然语言处理文本清洗、分词py-data-juicer[vision]计算机视觉图像视频处理py-data-juicer[all]全功能套餐土豪玩家首选步骤2创建你的第一个榨汁配方Data-Juicer使用YAML配置文件来定义数据处理流程我们称之为配方。创建一个简单的my_first_juice.yaml# 我的第一个数据处理配方 project_name: hello-juicer dataset_path: ./my_data.jsonl np: 4 # 使用4个进程并行处理 export_path: ./output/cleaned_data.jsonl process: # 第一步过滤中文内容 - language_id_score_filter: lang: zh min_score: 0.8 # 第二步清理HTML标签 - clean_html_mapper: {} # 第三步去除过长文本 - text_length_filter: min_len: 10 max_len: 1000比喻理解这个配方就像告诉榨汁机先挑出新鲜的中文水果然后去掉果皮HTML标签最后过滤掉太大或太小的果肉。步骤3启动榨汁机# 运行你的配方 dj-process --config my_first_juice.yaml看到控制台输出的处理进度了吗恭喜你的第一个AI数据果汁正在制作中 可视化你的数据处理成果处理完成后Data-Juicer会自动生成处理报告。但如果你想更直观地看到数据质量的变化可以试试内置的可视化工具from data_juicer.core.analyzer import Analyzer from data_juicer.core.data import NestedDataset # 加载处理前后的数据 original_ds NestedDataset.from_jsonl(./my_data.jsonl) processed_ds NestedDataset.from_jsonl(./output/cleaned_data.jsonl) # 对比分析 analyzer Analyzer() stats_before analyzer.analyze(original_ds) stats_after analyzer.analyze(processed_ds) print(f原始数据条数: {stats_before[num_examples]}) print(f处理后数据条数: {stats_after[num_examples]}) print(f过滤比例: {1 - stats_after[num_examples]/stats_before[num_examples]:.1%})不同数据处理方法在多个评估指标上的表现对比 深度配置打造个性化数据工厂场景1文本数据精炼流水线假设你要处理爬取的网页数据里面混着各种语言和格式project_name: web-content-refiner dataset_path: ./crawled_webpages.jsonl np: 8 # 8核并发速度更快 process: # 1. 语言识别与分流 - language_id_score_filter: lang: [en, zh] min_score: 0.7 # 2. 深度清洗 - clean_html_mapper: {} - clean_links_mapper: {} - remove_comments_mapper: {} # 3. 质量过滤 - text_length_filter: min_len: 50 max_len: 5000 # 4. 去重处理 - document_deduplicator: method: simhash threshold: 0.9 # 5. 格式标准化 - whitespace_normalization_mapper: {} - punctuation_normalization_mapper: {}性能提示这个流水线可以处理TB级别的网页数据Data-Juicer会自动优化算子融合提升2-10倍处理速度场景2多模态数据处理Data-Juicer不仅擅长文本还能处理图像和视频project_name: multimodal-cleaner dataset_path: ./mixed_media_dataset.jsonl process: # 图像处理分支 - image_size_filter: min_pixels: 10000 max_pixels: 10000000 - image_aesthetics_filter: min_score: 4.0 - image_nsfw_filter: max_score: 0.3 # 视频处理分支 - video_duration_filter: min_duration: 1.0 max_duration: 300.0 - video_resolution_filter: min_height: 240 min_width: 320 # 跨模态关联 - image_text_matching_filter: min_score: 0.6 常见问题与排错指南问题1安装依赖冲突怎么办症状pip install时出现版本冲突错误解决方案# 使用uv避免环境污染 uv venv my-juicer-env source my-juicer-env/bin/activate # Linux/Mac # 或 my-juicer-env\Scripts\activate # Windows # 按需安装避免一次性装太多 uv pip install py-data-juicer uv pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118问题2处理速度太慢优化策略增加并行度调整np参数根据CPU核心数设置启用Ray分布式# 安装分布式支持 uv pip install py-data-juicer[distributed] # 启动Ray集群 ray start --head --port6379 # 在配置中指定Ray use_ray: true ray_address: auto使用OP融合Data-Juicer会自动合并连续算子减少IO开销问题3内存不足内存优化技巧# 在配置文件中调整 global_settings: chunk_size: 1000 # 减小批次大小 use_disk_cache: true # 启用磁盘缓存 checkpoint_path: ./checkpoints # 设置检查点 创意应用用Data-Juicer打造AI数据艺术品应用1智能对话数据清洗对话质量评估指标随训练步数的变化趋势# 对话数据质量提升配方 process: - dialog_clarification_quality_mapper: model_name: gpt-3.5-turbo - dialog_coreference_mapper: {} - dialog_non_repetition_mapper: max_repetition_ratio: 0.3 - dialog_sentiment_detection_mapper: {} - llm_quality_score_filter: min_score: 0.7 model_name: gpt-4应用2学术论文数据提取from data_juicer.ops.mapper import LatexFigureContextExtractorMapper from data_juicer.ops.filter import TextEntityDependencyFilter # 从LaTeX论文中提取图表上下文 pipeline [ LatexFigureContextExtractorMapper(), TextEntityDependencyFilter(min_dependency_score0.5), # ... 更多学术专用算子 ] 性能对比为什么选择Data-Juicer特性Data-Juicer传统方法优势处理速度5TB数据去重仅需2.8小时数天甚至数周10-100倍加速扩展性支持千节点集群单机或小集群线性扩展算子数量200内置算子需要自己实现开箱即用可视化内置分析工具需要额外开发一站式解决方案社区生态活跃开源社区闭源或小众持续更新维护 下一步学习建议学习路径推荐新手阶段1-2天完成本指南的所有示例尝试修改demos/process_simple/process.yaml运行几个内置demodemos/目录下的示例进阶阶段3-7天学习YAML配方语法查看config/config_all.yaml探索更多算子浏览ops/目录尝试分布式处理学习Ray集成专家阶段1-2周开发自定义算子优化大规模流水线贡献代码到开源社区实用资源导航配方模板demos/目录包含各种场景的配置文件算子文档docs/operators/有详细的使用说明测试用例tests/目录提供了丰富的示例代码工具脚本tools/目录包含实用工具加入社区Data-Juicer有一个活跃的开源社区你可以在那里 查看最新文档 报告问题和bug 提出功能建议 与其他开发者交流经验 总结从数据混乱到AI智能的捷径Data-Juicer就像给你的AI项目配上了一台智能榨汁机简单易用YAML配方无需编码经验⚡极速处理分布式加速TB级数据轻松应对模块化设计200算子按需组合全面可视化从处理过程到结果分析一目了然高度可扩展支持自定义算子满足特殊需求记住好的AI模型从好的数据开始。与其在杂乱的数据海洋中挣扎不如让Data-Juicer帮你榨出最纯净的AI智能果汁最后的小贴士开始你的第一个项目时可以从最小的配置开始逐步添加更多算子。就像学做果汁一样先学会榨橙汁再尝试复杂的混合果汁配方。祝你在AI数据处理的道路上越走越顺Data-Juicer将原始数据转化为AI-ready智能果汁的魔法工具【免费下载链接】data-juicerData processing for and with foundation models! ➡️ ➡️ 项目地址: https://gitcode.com/gh_mirrors/da/data-juicer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考