拆分
split
by BytesAgain
Data splitting techniques and strategies reference — partitioning datasets, string splitting, file splitting, and ML train/test splits. Use when dividing data, chunking files, or designing data partitioning strategies.
安装
claude skill add --url github.com/openclaw/skills/tree/main/skills/bytesagain1/split文档
Split — Data Splitting Reference
Quick-reference skill for data splitting techniques, partitioning strategies, and practical patterns.
When to Use
- Splitting strings by delimiters, patterns, or fixed widths
- Partitioning datasets for ML training/validation/test
- Dividing large files into manageable chunks
- Database sharding and horizontal partitioning
- Understanding split strategies for distributed systems
Commands
intro
scripts/script.sh intro
Overview of data splitting — concepts, common use cases, and terminology.
string
scripts/script.sh string
String splitting techniques — delimiters, regex, fixed-width, tokenization.
file
scripts/script.sh file
File splitting methods — by size, lines, patterns, and round-robin.
dataset
scripts/script.sh dataset
ML dataset splitting — train/val/test, stratified, time-series, k-fold.
database
scripts/script.sh database
Database partitioning — horizontal, vertical, hash, range, and list.
strategies
scripts/script.sh strategies
Splitting strategies for distributed systems — consistent hashing, sharding keys.
examples
scripts/script.sh examples
Practical split examples across languages and tools.
pitfalls
scripts/script.sh pitfalls
Common pitfalls and best practices when splitting data.
help
scripts/script.sh help
version
scripts/script.sh version
Configuration
| Variable | Description |
|---|---|
SPLIT_DIR | Data directory (default: ~/.split/) |
Powered by BytesAgain | bytesagain.com | hello@bytesagain.com
相关 Skills
技能工坊
by anthropics
覆盖 Skill 从创建到迭代优化全流程:起草能力、补测试提示、跑评测与基准方差分析,并持续改写内容和描述,提升效果与触发准确率。
✎ 技能工坊把技能从创建、迭代到评测串成闭环,方差分析加描述优化,特别适合把触发准确率打磨得更稳。
PPT处理
by anthropics
处理 .pptx 全流程:创建演示文稿、提取和解析幻灯片内容、批量修改现有文件,支持模板套用、合并拆分、备注评论与版式调整。
✎ 涉及PPTX的创建、解析、修改到合并拆分都能一站搞定,连备注、模板和评论也能处理,做演示文稿特别省心。
PDF处理
by anthropics
遇到 PDF 读写、文本表格提取、合并拆分、旋转加水印、表单填写或加解密时直接用它,也能提取图片、生成新 PDF,并把扫描件通过 OCR 变成可搜索文档。
✎ PDF杂活别再来回切工具了,文本表格提取、合并拆分到OCR识别一次搞定,连扫描件也能变可搜索。
相关 MCP 服务
文件系统
编辑精选by Anthropic
Filesystem 是 MCP 官方参考服务器,让 LLM 安全读写本地文件系统。
✎ 这个服务器解决了让 Claude 直接操作本地文件的痛点,比如自动整理文档或生成代码文件。适合需要自动化文件处理的开发者,但注意它只是参考实现,生产环境需自行加固安全。
by wonderwhy-er
Desktop Commander 是让 AI 直接执行终端命令、管理文件和进程的 MCP 服务器。
✎ 这工具解决了 AI 无法直接操作本地环境的痛点,适合需要自动化脚本调试或文件批量处理的开发者。它能让你用自然语言指挥终端,但权限控制需谨慎,毕竟让 AI 执行 rm -rf 可不是闹着玩的。
by stickerdaniel
LinkedIn Profile and Job Scraper 是让 Claude 直接抓取 LinkedIn 个人资料、公司信息和职位详情的工具。
✎ 这个服务器解决了招聘和商业调研中手动复制粘贴 LinkedIn 数据的痛点,适合猎头或市场分析师快速获取候选人背景和公司动态。不过,LinkedIn 反爬机制频繁更新,数据稳定性需要持续维护,使用时建议搭配人工验证。
相关资讯
Vercel CEO Guillermo Rauch 接受 TechCrunch 采访,讨论了智能体在生产环境中的现实挑战:数据安全、审计追踪、工具调用权限。他提出模型与智能体应解耦,Vercel 的 Eve 框架和 Sandbox 产品旨在提供灵活的“插拔”架构。同时他观察到,谷歌 Gemini、DeepSeek 等模型因性价比而崛起,客户正从单一模型合作伙伴转向多模型策略。
Google 将第八代 TPU 拆分为训练专用芯片 TPU 8t 和推理专用芯片 TPU 8i,以应对智能体工作负载带来的不同需求。TPU 8i 通过新拓扑和更大内存突破内存墙,TPU 8t 则面向超大规模训练集群。两款芯片均于今年晚些时候上市。