OCR

OCR 公开 已发布

仲夏·Aun 分享于 2天12小时前 | 0 | 2
如何安装动作?

适用于
分类(旧)
文本处理 翻译 Windows
关键词



更多信息
分享时间 2天12小时前
最后更新 2天12小时前
修订版本 0
用户许可 可自己使用或修改,不可再分享
Quicker版本 1.45.5
动作大小 9.6 KB

分享到

「截图 OCR 翻译助手:选中屏幕内容,快速识别并翻译」

简介

截图 OCR 翻译助手:选中屏幕内容,快速识别并翻译(GPT-5.6开发)

平时浏览英文网页、软件界面、PDF 或图片资料时,经常会遇到无法直接复制的文字。为了解决这个问题,我制作了一个 Quicker 截图 OCR 翻译动作。

运行后只需框选屏幕区域,动作便会自动识别图片中的文字、清理多余空格,并在独立窗口中显示结果。需要翻译时,点击窗口顶部的“AI翻译”按钮,译文就会追加在原文下方,方便对照阅读。

主要功能

截图文字识别

运行后选择屏幕上的任意区域,Quicker 会通过 OCR 提取其中的文字。适用于:

  • 无法复制文字的网页和软件

  • 图片、扫描件和 PDF

  • 英文提示信息

  • 视频字幕和课程资料

  • 软件更新日志

自动整理原文

OCR 结果经常带有不规则缩进和多余空格。动作会自动删除每行左右两侧的空白,使内容统一左对齐。

这一过程使用本地正则替换,不调用 AI,速度很快。

使用的正则表达式为:

^[ \t]+|[ \t]+$

DeepSeek AI 翻译

文本窗口顶部提供“AI翻译”按钮。点击后,动作会自动判断原文语言:

  • 中文内容翻译成英文

  • 其他语言翻译成简体中文

  • 保留数字、日期、单位、型号和专有名词

  • 尽量保留原文段落结构

  • 不添加解释、总结和多余前缀

翻译结果不会覆盖原文,而是追加到原文下方:

这里是OCR识别的原文……

===== 翻译结果 =====
这里是翻译后的内容……

因此可以在同一个窗口中对照阅读原文和译文。

支持局部翻译

除了翻译全文,也可以扩展为局部翻译:先在文本窗口中选中一段文字,再点击翻译按钮,只处理选中的内容。

这对于长文章、专业术语和软件提示非常实用,也能减少 API 用量。

自定义阅读窗口

文本窗口支持调整:

  • 窗口尺寸和显示位置

  • 字体名称和大小

  • 自动换行

  • 行号显示

  • 窗口置顶

  • 背景和文字颜色

我使用“得意黑”作为显示字体,并将窗口设置为屏幕宽度的 75%、高度的 80%,阅读体验更舒适。

动作运行流程

整个动作的处理顺序如下:

选择截图区域
    ↓
基础 OCR 识别
    ↓
正则清理多余空格
    ↓
显示原文窗口
    ↓
点击 AI 翻译
    ↓
调用 DeepSeek
    ↓
在原文下方追加译文

OCR 和文本清理会自动运行,AI 只在点击翻译按钮时调用,避免不必要的等待和费用。

DeepSeek 配置

AI 翻译使用 DeepSeek 的 OpenAI 兼容接口。

接口端点:Chat
API地址:https://api.deepseek.com/chat/completions
模型:deepseek-v4-flash
温度:0.2

deepseek-v4-flash 的响应速度和成本比较适合日常翻译。如果更加重视复杂文本的翻译质量,也可以换成 deepseek-v4-pro

使用者需要自行在 DeepSeek 开放平台创建 API Key。API Key 属于敏感信息,请勿写入动作说明、公开分享或出现在截图中。

文本窗口翻译按钮

工具栏中的全文翻译按钮使用以下配置:

[fa:Solid_Language:#1677FF]AI翻译|call:a$append$sp$AI翻译

其中:

  • a 表示处理全部文字

  • append 表示把结果追加到窗口末尾

  • sp 表示调用动作内子程序

  • AI翻译 是子程序名称

AI 返回译文后,再通过“组合成文本”步骤添加换行和标题,使原文与译文清晰分隔。

使用方法

  1. 运行动作。

  2. 框选需要识别的屏幕区域。

  3. 等待 OCR 结果窗口出现。

  4. 查看或修改识别结果。

  5. 点击顶部“AI翻译”。

  6. 在原文下方查看翻译结果。

  7. 根据需要复制、编辑或保存内容。

最近更新

修订版本 更新时间 更新说明
0 2天12小时前

最近讨论

暂无讨论